Sycophancy란?
Sycophancy는 언어모델이 사실보다 사용자의 기존 견해와 기분에 맞춰 답하는 경향입니다. 앤트로픽 연구진은 2023년 논문에서 사람 피드백으로 모델을 조정하는 과정이 진실한 답변보다 사용자 믿음과 일치하는 답변에 더 높은 점수를 주기 때문이라고 정리했습니다. 답변이 정중하고 그럴듯해 발견이 늦고, 의사결정 근거로 쓰면 잘못된 전제가 그대로 통과합니다. 2025년 4월 오픈AI가 GPT-4o 업데이트를 사흘 만에 되돌린 사건이 대표 사례입니다.