3

Sycophancy
시코펀시
Sycophancy는 언어모델이 사실보다 사용자의 기존 견해와 기분에 맞춰 답하는 경향입니다. 앤트로픽 연구진은 2023년 논문에서 사람 피드백으로 모델을 조정하는 과정이 진실한 답변보다 사용자 믿음과 일치하는 답변에 더 높은 점수를 주기 때문이라고 정리했습니다. 답변이 정중하고 그럴듯해 발견이 늦고, 의사결정 근거로 쓰면 잘못된 전제가 그대로 통과합니다. 2025년 4월 오픈AI가 GPT-4o 업데이트를 사흘 만에 되돌린 사건이 대표 사례입니다.
보안·윤리
llms.txt
엘엘엠에스 텍스트
웹사이트 루트에 두는 마크다운 안내 파일로, AI가 사이트의 핵심 콘텐츠를 쉽게 파악하도록 돕자는 제안 규격입니다. 2024년 9월 Answer.AI의 제러미 하워드가 제안했고, 앤트로픽·클라우드플레어 등 개발 문서 사이트를 중심으로 퍼졌습니다. 전체 문서를 한 파일에 담는 llms-full.txt 변형도 있습니다. 다만 구글은 자사 시스템이 이 파일을 쓰지 않는다고 밝혔고 주요 AI 기업의 공식 채택 발표도 없어, 실효성을 둘러싼 논쟁이 진행 중인 규격입니다.
개발
Model Card
모델 카드
AI 모델의 용도·성능·한계·편향 평가 결과를 정해진 항목으로 정리해 모델과 함께 공개하는 문서 표준입니다. 구글 연구진(Mitchell, Gebru 외)이 2019년 공정성 학회 FAT*에서 논문 'Model Cards for Model Reporting'으로 제안했습니다. 식품 영양성분표처럼 모델의 성분과 주의사항을 표준 양식으로 밝히자는 취지입니다. 현재 허깅페이스 저장소의 문서 표준으로 자리 잡았고, OpenAI·앤트로픽의 시스템 카드처럼 안전 평가 보고서로도 확장됐습니다.
보안·윤리

플레이북 1

검색 · AI for Everyone