icon of Chonkie

Chonkie

Retrieval-Augmented Generation(RAG)에 최적화된 경량 고성능 텍스트 청킹 라이브러리입니다.

커뮤니티:

제품 개요

Chonkie이란 무엇인가요?

Chonkie preview

Chonkie는 대용량 및 복잡한 문서를 Retrieval-Augmented Generation 워크플로우에 적합하도록 효율적으로 분할하는 오픈소스 Python 라이브러리입니다. 토큰, 단어, 문장, 의미 기반 등 다양한 청킹 전략을 지원하여, 개발자가 NLP 및 머신러닝 요구에 맞게 텍스트 분할 방식을 선택할 수 있습니다. 최소 설치 용량과 최적화된 속도로 대용량 언어 모델 처리 속도를 높이고, 맥락 관리와 검색 정확도를 개선합니다.


주요 기능

  • 다양한 청킹(Chunking) 방식

    TokenChunker, WordChunker, SentenceChunker, SemanticChunker, SDPMChunker 등 다양한 청커를 지원하여 유연한 텍스트 분할이 가능합니다.

  • 경량화 및 고속 처리

    기본 설치 용량이 매우 작으며(~21MB), 토큰 청킹 성능은 경쟁 제품 대비 최대 33배 빠릅니다.

  • 쉬운 통합

    pip 설치와 간단한 API, 그리고 GPT-2, Transformers, tiktoken 등 인기 토크나이저와의 호환성을 제공합니다.

  • RAG 최적화

    Retrieval-Augmented Generation(RAG)을 위해 문서를 맥락에 맞는 단위로 분할하여 모델 추론 성능을 높입니다.

  • 모듈형 의존성 시스템

    필요한 청커와 의존성만 설치할 수 있어 불필요한 용량을 줄이고 배포 효율성을 높입니다.


사용 사례

  • 대용량 문서 처리 : 연구 논문, 법률 문서, 도서 등 복잡한 문서를 LLM이 처리하기 쉬운 단위로 분할합니다.
  • 향상된 검색 및 추출 시스템 : 텍스트를 의미 단위로 분할하여 사용자 쿼리에 더 잘 맞는 검색 결과를 제공합니다.
  • RAG 파이프라인 : Retrieval-Augmented Generation 워크플로우에서 언어 모델에 잘 구조화된 맥락 청크를 제공합니다.
  • NLP 및 머신러닝 : 효율적이고 유연한 텍스트 분할이 필요한 NLP 전처리 단계에 활용할 수 있습니다.

자주 묻는 질문

Chonkie 대안

🚀

Chonkie 웹사이트 분석