CARD NEWS · 개발

AI 평가 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.

1/4
개발

AI 평가란?

개발 분야에서 쓰이는 말로, AI 모델이나 AI 시스템의 품질을 정해진 과제와 지표로 반복 가능하게 측정하는 평가 절차와 도구를 뜻합니다. 평가를 뜻하는 evaluations를 줄여 이밸(evals)이라 부릅니다. 정확도만 보지 않습니다. 효율·편향·유해성처럼 정확도 너머의 여러 축을 함께 잽니다. 표준 평가 하네스를 쓰면 같은 프롬프트로 여러 모델을 비교할 수 있어, 논문과 제품 사이에 재현성과 비교가능성이 생깁니다. LLM을 서비스에 올리기 전 품질을 확인하는 개발 공정의 한 단계입니다.

2/4
쉬운 풀이

AI 이밸은 모델의 실력을 채점하는 표준 시험지예요

AI 이밸은 모델의 실력을 채점하는 표준 시험지예요. 이밸은 평가를 뜻하는 evaluations의 줄임말입니다. 사람이 자격증 시험을 여러 과목으로 나눠 치르듯, 모델도 수학·상식·코딩·안전성 같은 항목별 문제를 풀고 항목마다 점수를 받아요. 프롬프트를 한 줄 바꿨을 때 점수가 오르내리는지 같은 시험지로 비교할 수 있어야, 정말 좋아졌는지 나빠졌는지 판단할 수 있습니다. 그래서 AI를 만드는 팀이라면 좋은 이밸을 만드는 일을, 모델을 키우는 일만큼 영향력 큰 작업으로 꼽습니다.

3/4
활용 사례

누가·언제 쓰나?

케이스 1: OpenAI — Evals 오픈소스 프레임워크 OpenAI는 2023년 LLM 평가 프레임워크 Evals를 오픈소스로 공개했습니다 [1]. 공개 벤치마크 레지스트리와 함께, 팀이 자기 업무 패턴에 맞춘 비공개 평가를 직접 작성하도록 지원합니다 [1]. 공식 문서는 "LLM으로 무언가를 만든다면 좋은 평가를 만드는 일이 가장 영향력 큰 작업 중 하나"라고 적었습니다 [1]. 이후

4/4
더 알아보기

ai.percent.ac
/word/ai-evals

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.