2

BM25
비엠 이십오
정보 검색 분야에서 쓰이는 Best Matching 25(베스트 매칭 25)의 약자로, 질의어와 문서의 단어 일치도를 점수로 매기는 키워드 기반 랭킹 함수입니다. 1970년대와 1980년대에 Robertson과 Spärck Jones 등이 세운 확률적 검색 모델을 잇는 TF-IDF 계열 기법입니다 [1]. 문서 길이 정규화를 맡는 b와 용어 빈도 포화를 맡는 k1, 두 파라미터가 점수를 조절합니다 [3]. Apache Lucene과 Elasticsearch, OpenSearch가 기본 스코어링으로 채택했습니다 [2]. RAG의 하이브리드 검색에서는 의미 기반 벡터 검색과 짝을 이룹니다 [4].
데이터·DB
Overfitting
오버피팅
Overfitting(과적합)은 모델이 학습 데이터에는 잘 맞지만 처음 보는 새 데이터에서는 성능이 떨어지는 현상입니다. 데이터에 담긴 규칙 대신 잡음과 우연한 패턴까지 외운 결과입니다. 반대편에는 규칙 자체를 덜 배운 과소적합(underfitting)이 있습니다. 탐지는 학습에 쓰지 않은 검증 세트로 합니다. 학습 오차는 계속 내려가는데 검증 오차가 어느 시점부터 올라가는 학습·검증 곡선이 전형적인 신호입니다. 완화 기법으로는 정규화, 드롭아웃, 조기종료, 데이터 증강, 학습 데이터 확대가 쓰입니다.
기본
검색 · AI for Everyone