post
xberg - 다국어 문서 인텔리전스 프레임워크
xberg는 PDF, 이미지, 오디오, 아카이브 등 100개 이상의 포맷을 통일된 형식으로 처리합니다. 한글 HWP 지원과 LLM 기반 구조화 추출이 특징입니다.
한 줄 요약
xberg는 PDF, 이미지, 스프레드시트, 오디오 등 100개 이상의 포맷을 통일된 형식으로 처리하는 문서 인텔리전스 프레임워크다.
핵심 내용
101개 포맷, 371개 코드 언어, 15개 언어 바인딩, 6개 출력 포맷 지원
포맷 감지부터 OCR 추출을 하나의 코어에서 처리해 여러 라이브러리 조합 불필요
URL/웹 수집으로 HTTP(S) URL에서 단일 문서 추출 또는 크롤링 가능
MP3, M4A, WAV, WebM, MP4 오디오/비디오를 Whisper ONNX로 음성→텍스트 변환
.zip, .tar, .gz, .7z 아카이브 내부의 중첩 문서까지 재귀 추출
Tesseract, PaddleOCR, Candle, VLM(GPT-4/Claude/Gemini Vision) 중 선택 가능한 OCR
PP-DocLayout-V3, RT-DETR 레이아웃 모델과 TATR, SLANet 표 구조 모델로 읽기 순서 복원
로컬 또는 호스팅 LLM으로 스키마 기반 JSON 구조화 추출, 프롬프트 엔지니어링 불필요
왜 중요한가
조직의 데이터는 다양한 형식으로 흩어져 있다. xberg는 이런 문서들을 일관되게 처리해 RAG나 AI 파이프라인의 입력으로 사용할 수 있게 만든다. 특히 한글 HWP/HWPX 파일 지원으로 한국 조직에서도 즉시 활용 가능하며, 로컬 임베딩과 LLM 통합으로 보안성을 높일 수 있다. MIT 라이선스로 상업용 프로젝트에도 자유롭게 사용할 수 있다.
참조한 것 · 가져온 것
원문: https://github.com/xberg-io/xberg
GeekNews: https://news.hada.io/topic?id=32452