Constitutional AI란?
AI 모델 학습 분야에서 Anthropic이 2022년에 공개한 RLHF 대체 기법으로, 사람이 매번 답안을 평가하는 대신 미리 정의된 원칙(헌법)에 따라 AI가 스스로 자기 답변을 비판·수정하도록 학습시키는 방식입니다.
CARD NEWS · AI 트렌드
SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 화면을 캡처하거나 브라우저의 인쇄 기능으로 PDF를 저장해 공유할 수 있습니다.
AI 모델 학습 분야에서 Anthropic이 2022년에 공개한 RLHF 대체 기법으로, 사람이 매번 답안을 평가하는 대신 미리 정의된 원칙(헌법)에 따라 AI가 스스로 자기 답변을 비판·수정하도록 학습시키는 방식입니다.
사람이 매번 "이 답이 좋다·나쁘다"를 일일이 골라주는 대신, "혐오 표현을 피해라" 같은 원칙 60여 개를 헌법처럼 적어두고 AI가 그 헌법을 읽으며 자기 답을 스스로 빨간펜으로 고쳐 학습하는 방식이에요. 조별 과제에서 매번 교수님께 첨삭받는 대신, 채점 기준표를 받아 팀원끼리 서로 고쳐 주는 절차와 닮았습니다.
케이스 1: Anthropic Claude — 무해성·도움성 동시 개선 Anthropic은 CAI로 학습한 RL-CAI 모델이 RLHF 기준선보다 무해성 Elo 점수에서 명확히 앞서면서 도움성은 유지하거나 약간 개선됐다고 보고했습니다 [1]. 기존에는 무해성과 도움성이 서로 깎아먹는 trade-off 관계였는데, CAI는 두 지표의 파레토 프런티어 자체를 끌어올렸다는 평가입니다 [1].
카드를 캡처하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 쓸 수 있습니다. CC BY-SA 4.0에 따라 출처(AI for Everyone by Percent · ai.percent.ac)와 라이선스를 표시하면 상업적으로도 이용할 수 있습니다. 내용을 바꿨다면 그 사실을 밝히고 같은 라이선스로 공유해 주세요.