SWE-bench란?
AI 모델 평가 분야에서 Princeton NLP팀이 2023년에 공개한 코딩 능력 벤치마크로, 실제 GitHub 이슈와 PR을 모아 LLM이 진짜 오픈소스 버그를 해결할 수 있는지 평가하는 표준 평가입니다.
CARD NEWS · 기본
SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.
AI 모델 평가 분야에서 Princeton NLP팀이 2023년에 공개한 코딩 능력 벤치마크로, 실제 GitHub 이슈와 PR을 모아 LLM이 진짜 오픈소스 버그를 해결할 수 있는지 평가하는 표준 평가입니다.
SWE-bench는 AI가 진짜 프로그래머처럼 일할 수 있는지 보는 실전 시험이에요. 모의고사로 짧은 코드 한두 줄을 시키는 게 아니라, 실제 오픈소스 프로젝트에 올라온 버그 신고서를 주고 "이거 직접 고쳐 봐"라고 시킵니다. 조별 과제로 따지면 교수님이 "이 깃허브 저장소에서 사용자가 신고한 오류 한 건을 해결해 와"라고 학기 말 과제를 던지는 것과 비슷해요. 어느 모델이 코딩을 잘한다고 말할 때 요즘 업계가 거의 다 이 시험 점수로 비교하기 때문에, AI 코딩 도구를 고를 때 한 번쯤 들어두면 좋습니다.
**케이스 1: Anthropic — Claude Sonnet 4.5 출시 시 핵심 지표로 공개** 2025년 9월 Anthropic은 Claude Sonnet 4.5를 발표하면서 SWE-bench Verified 점수를 대표 코딩 지표로 내세웠습니다.[4] 단순한 스캐폴드(bash + 파일 편집 도구 2개)에 10회 평균 조건으로 측정해 77.2%를 기록했고, 병렬 컴퓨트를 쓰면 82.0%
카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.