AI 평가란?
개발 분야에서 쓰이는 말로, AI 모델이나 AI 시스템의 품질을 정해진 과제와 지표로 반복 가능하게 측정하는 평가 절차와 도구를 뜻합니다. 평가를 뜻하는 evaluations를 줄여 이밸(evals)이라 부릅니다. 정확도만 보지 않습니다. 효율·편향·유해성처럼 정확도 너머의 여러 축을 함께 잽니다. 표준 평가 하네스를 쓰면 같은 프롬프트로 여러 모델을 비교할 수 있어, 논문과 제품 사이에 재현성과 비교가능성이 생깁니다. LLM을 서비스에 올리기 전 품질을 확인하는 개발 공정의 한 단계입니다.