CARD NEWS · 기본

Benchmark 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 화면을 캡처하거나 브라우저의 인쇄 기능으로 PDF를 저장해 공유할 수 있습니다.

1/4
기본

Benchmark란?

AI 모델 평가 분야에서 쓰이는 용어로, 서로 다른 인공지능 모델의 성능을 같은 잣대로 비교하기 위해 표준화된 시험 문제집을 모아 정답률·점수로 줄을 세우는 평가 방식입니다.

2/4
쉬운 풀이

이렇게 이해하면 쉬워요

벤치마크는 여러 AI 모델을 똑같은 시험지로 풀게 한 다음 점수로 줄을 세워 비교하는 표준 시험이에요. 모델마다 광고 문구가 다르고 답변 스타일도 제각각이라, 같은 문제 세트로 같은 조건에서 돌려 봐야 누가 정말 잘하는지가 보입니다. 한 학기 동안 다 같은 시험지로 반 전체 등수를 매기는 기말고사를 떠올리면 가까워요.

3/4
활용 사례

누가·언제 쓰나?

케이스 1: MMLU — 다과목 객관식으로 폭넓은 지식 측정 Hendrycks 연구팀이 2020년 arXiv에 공개한 MMLU는 초등 수학부터 미국사·법·컴퓨터과학까지 57개 과목 객관식 1만 5,908문항으로 구성됩니다[2]. 9% 수준이었습니다[2]. 신규 모델 출시 보도자료에서 "MMLU 88점 달성" 같은 표현이 등장하면 이 시험을 가리킵니다[2].

4/4
더 알아보기

ai.percent.ac
/word/benchmark

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 캡처하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 쓸 수 있습니다. CC BY-SA 4.0에 따라 출처(AI for Everyone by Percent · ai.percent.ac)와 라이선스를 표시하면 상업적으로도 이용할 수 있습니다. 내용을 바꿨다면 그 사실을 밝히고 같은 라이선스로 공유해 주세요.