CARD NEWS · AI 트렌드

Constitutional AI 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.

1/4
AI 트렌드

Constitutional AI란?

AI 모델 학습 분야에서 Anthropic이 2022년에 공개한 RLHF 대체 기법으로, 사람이 매번 답안을 평가하는 대신 미리 정의된 원칙(헌법)에 따라 AI가 스스로 자기 답변을 비판·수정하도록 학습시키는 방식입니다.

2/4
쉬운 풀이

사람이 매번 "이 답이 좋다·나쁘다"를 일일이 골라주는 대신, "혐오 표현을 피해라" 같은 원칙 60여 개를

사람이 매번 "이 답이 좋다·나쁘다"를 일일이 골라주는 대신, "혐오 표현을 피해라" 같은 원칙 60여 개를 헌법처럼 적어두고 AI가 그 헌법을 읽으며 자기 답을 스스로 빨간펜으로 고쳐 학습하는 방식이에요. 조별 과제에서 매번 교수님께 첨삭받는 대신, 채점 기준표를 받아 팀원끼리 서로 고쳐 주는 절차와 닮았습니다. Anthropic이 Claude를 학습시킬 때 쓴 안전성 기법이고, AI를 사람 가치에 맞춘다는 정렬(alignment) 논의에서 자주 등장하니 알아두면 좋아요.

3/4
활용 사례

누가·언제 쓰나?

**케이스 1: Anthropic Claude — 무해성·도움성 동시 개선** Anthropic은 CAI로 학습한 RL-CAI 모델이 RLHF 기준선보다 무해성 Elo 점수에서 명확히 앞서면서 도움성은 유지하거나 약간 개선됐다고 보고했습니다 [1]. 기존에는 무해성과 도움성이 서로 깎아먹는 trade-off 관계였는데, CAI는 두 지표의 파레토 프런티어 자체를 끌어올렸다는 평가입니다 [1]

4/4
더 알아보기

ai.percent.ac
/word/constitutional-ai

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.