Chunking란?
긴 문서를 검색·임베딩에 알맞은 크기의 조각으로 잘라 나누는 전처리 작업입니다. RAG에서 원문을 통째로 넣을 수 없으므로, 문단·문장·토큰 단위로 나눠 각 조각을 벡터로 저장합니다. 너무 크게 자르면 관련 없는 내용이 섞이고, 너무 잘게 자르면 앞뒤 문맥이 끊깁니다. 조각 크기와 겹침(overlap) 설정이 검색 정확도를 좌우해, RAG 품질의 첫 단추로 꼽힙니다.
CARD NEWS · 데이터·DB
SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 화면을 캡처하거나 브라우저의 인쇄 기능으로 PDF를 저장해 공유할 수 있습니다.
긴 문서를 검색·임베딩에 알맞은 크기의 조각으로 잘라 나누는 전처리 작업입니다. RAG에서 원문을 통째로 넣을 수 없으므로, 문단·문장·토큰 단위로 나눠 각 조각을 벡터로 저장합니다. 너무 크게 자르면 관련 없는 내용이 섞이고, 너무 잘게 자르면 앞뒤 문맥이 끊깁니다. 조각 크기와 겹침(overlap) 설정이 검색 정확도를 좌우해, RAG 품질의 첫 단추로 꼽힙니다.
청킹(chunking)은 긴 자료를 검색하기 좋은 크기로 토막 내는 작업입니다. AI에 문서를 한 번에 다 넣을 수 없으니, 문단이나 정해진 길이로 잘라 조각마다 따로 저장해요. 두꺼운 규정집을 통째로 주는 대신 조항별로 나눠 색인해 두는 것과 비슷합니다. 너무 크게 자르면 엉뚱한 내용이 섞이고, 너무 잘게 자르면 앞뒤 맥락이 끊겨서 답이 부정확해져요.
케이스 1: Anthropic — 문맥을 붙인 청킹으로 검색 실패율 감소 Anthropic은 2024년 각 조각 앞에 그 조각의 맥락을 요약해 붙이는 '컨텍스추얼 리트리벌'을 공개했습니다 [1]. 조각이 문맥을 잃어 검색이 빗나가는 문제를 겨냥했습니다 [1]. 문맥 임베딩과 문맥 BM25를 함께 쓰고 리랭킹까지 얹어 측정했습니다 [1].
카드를 캡처하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 쓸 수 있습니다. CC BY-SA 4.0에 따라 출처(AI for Everyone by Percent · ai.percent.ac)와 라이선스를 표시하면 상업적으로도 이용할 수 있습니다. 내용을 바꿨다면 그 사실을 밝히고 같은 라이선스로 공유해 주세요.