Benchmark란?
AI 모델 평가 분야에서 쓰이는 용어로, 서로 다른 인공지능 모델의 성능을 같은 잣대로 비교하기 위해 표준화된 시험 문제집을 모아 정답률·점수로 줄을 세우는 평가 방식입니다.
CARD NEWS · 기본
SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.
AI 모델 평가 분야에서 쓰이는 용어로, 서로 다른 인공지능 모델의 성능을 같은 잣대로 비교하기 위해 표준화된 시험 문제집을 모아 정답률·점수로 줄을 세우는 평가 방식입니다.
벤치마크는 여러 AI 모델을 똑같은 시험지로 풀게 한 다음 점수로 줄을 세워 비교하는 표준 시험이에요. 모델마다 광고 문구가 다르고 답변 스타일도 제각각이라, 같은 문제 세트로 같은 조건에서 돌려 봐야 누가 정말 잘하는지가 보입니다. 한 학기 동안 다 같은 시험지로 반 전체 등수를 매기는 기말고사를 떠올리면 가까워요. AI 모델을 고를 때 보도자료에 자주 등장하는 "MMLU 88점", "SWE-bench Verified 77%" 같은 숫자가 모두 여기에서 나오기 때문에, 한 번쯤은 알아 두면 모델 비교가 훨씬 수월합니다.
**케이스 1: MMLU — 다과목 객관식으로 폭넓은 지식 측정** Hendrycks 연구팀이 2020년 arXiv에 공개한 MMLU는 초등 수학부터 미국사·법·컴퓨터과학까지 57개 과목 객관식 1만 5,908문항으로 구성됩니다[2]. 사람 전문가 추정치는 약 89.8%이고, 공개 당시 GPT-3는 43.9% 수준이었습니다[2]. 신규 모델 출시 보도자료에서 "MMLU 88점 달성" 같은 표
카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.