3

Benchmark
벤치마크
AI 모델 평가 분야에서 쓰이는 용어로, 서로 다른 인공지능 모델의 성능을 같은 잣대로 비교하기 위해 표준화된 시험 문제집을 모아 정답률·점수로 줄을 세우는 평가 방식입니다.
기본
Text-to-SQL
텍스트 투 에스큐엘
자연어로 쓴 질문을 데이터베이스에서 실행할 수 있는 SQL 쿼리로 자동 변환하는 기술입니다. 학술적으로는 시맨틱 파싱의 대표 과제로, 2018년 예일대의 Spider 벤치마크가 표준 평가 기준을 세웠습니다. LLM 등장 이후 정확도가 크게 올라, 개발자가 아닌 직군도 채팅으로 데이터를 조회하는 사내 도구로 확산하고 있습니다. 다만 깨끗한 벤치마크와 달리 실제 기업 데이터베이스 환경에서는 정답률이 크게 떨어져, 사람의 검증 절차와 함께 쓰는 것이 전제입니다.
데이터·DB
SWE-bench
AI 모델 평가 분야에서 Princeton NLP팀이 2023년에 공개한 코딩 능력 벤치마크로, 실제 GitHub 이슈와 PR을 모아 LLM이 진짜 오픈소스 버그를 해결할 수 있는지 평가하는 표준 평가입니다.
기본
검색 · AI for Everyone