LLM-as-a-Judge란?
LLM 평가 분야에서 쓰이는 기법으로, 강한 LLM(대규모 언어 모델)에게 다른 모델의 답변을 채점·비교·선택하게 해 사람 평가를 대신하게 하는 방법입니다. 이름 그대로 LLM을 심판(Judge)으로 세우는 방식입니다. 2023년 LMSYS 연구진이 MT-Bench 논문으로 용어를 대중화했고, GPT-4 판정이 인간 선호와 80% 넘게 일치한다는 결과가 출발점이 됐습니다. 정답이 하나로 정해지지 않는 개방형 답변을 대규모로 평가할 때 표준처럼 쓰입니다.