CARD NEWS · 프롬프트·AI 활용

LLM-as-a-Judge 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.

1/4
프롬프트·AI 활용

LLM-as-a-Judge란?

LLM 평가 분야에서 쓰이는 기법으로, 강한 LLM(대규모 언어 모델)에게 다른 모델의 답변을 채점·비교·선택하게 해 사람 평가를 대신하게 하는 방법입니다. 이름 그대로 LLM을 심판(Judge)으로 세우는 방식입니다. 2023년 LMSYS 연구진이 MT-Bench 논문으로 용어를 대중화했고, GPT-4 판정이 인간 선호와 80% 넘게 일치한다는 결과가 출발점이 됐습니다. 정답이 하나로 정해지지 않는 개방형 답변을 대규모로 평가할 때 표준처럼 쓰입니다.

2/4
쉬운 풀이

엘엘엠 애즈 어 저지(LLM-as-a-Judge)는 AI의 답안지를 사람이 아니라 더 뛰어난 AI가 채점하게

엘엘엠 애즈 어 저지(LLM-as-a-Judge)는 AI의 답안지를 사람이 아니라 더 뛰어난 AI가 채점하게 하는 방식입니다. 글쓰기 답변처럼 정답이 하나가 아닌 과제는 사람이 일일이 읽고 평가해야 했는데, 시간과 비용이 너무 컸어요. 채점 기준을 프롬프트로 정해 주면 판정 LLM이 수천 건을 몇 분 만에 평가합니다. 다만 채점자 AI에게도 편향이 있어서, 사람 평가와 얼마나 일치하는지 먼저 확인하고 쓰는 것이 원칙입니다.

3/4
활용 사례

누가·언제 쓰나?

케이스 1: LMSYS — 판정자 GPT-4 자체를 검증한 원조 연구 LMSYS 연구진은 2023년 80개 멀티턴 질문의 MT-Bench를 만들어 GPT-4를 판정자로 세웠습니다 [1]. 판정 결과를 전문가 평가·Chatbot Arena의 인간 선호와 대조했습니다 [1]. 위치·장황함·자기강화 편향 같은 판정자의 약점도 함께 공개했습니다 [1]. 도입효과: GPT-4 판정과 인간 선호 일치율

4/4
더 알아보기

ai.percent.ac
/word/llm-as-a-judge

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.