CARD NEWS · AI 트렌드

Constitutional AI 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 화면을 캡처하거나 브라우저의 인쇄 기능으로 PDF를 저장해 공유할 수 있습니다.

1/4
AI 트렌드

Constitutional AI란?

AI 모델 학습 분야에서 Anthropic이 2022년에 공개한 RLHF 대체 기법으로, 사람이 매번 답안을 평가하는 대신 미리 정의된 원칙(헌법)에 따라 AI가 스스로 자기 답변을 비판·수정하도록 학습시키는 방식입니다.

2/4
쉬운 풀이

이렇게 이해하면 쉬워요

사람이 매번 "이 답이 좋다·나쁘다"를 일일이 골라주는 대신, "혐오 표현을 피해라" 같은 원칙 60여 개를 헌법처럼 적어두고 AI가 그 헌법을 읽으며 자기 답을 스스로 빨간펜으로 고쳐 학습하는 방식이에요. 조별 과제에서 매번 교수님께 첨삭받는 대신, 채점 기준표를 받아 팀원끼리 서로 고쳐 주는 절차와 닮았습니다.

3/4
활용 사례

누가·언제 쓰나?

케이스 1: Anthropic Claude — 무해성·도움성 동시 개선 Anthropic은 CAI로 학습한 RL-CAI 모델이 RLHF 기준선보다 무해성 Elo 점수에서 명확히 앞서면서 도움성은 유지하거나 약간 개선됐다고 보고했습니다 [1]. 기존에는 무해성과 도움성이 서로 깎아먹는 trade-off 관계였는데, CAI는 두 지표의 파레토 프런티어 자체를 끌어올렸다는 평가입니다 [1].

4/4
더 알아보기

ai.percent.ac
/word/constitutional-ai

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 캡처하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 쓸 수 있습니다. CC BY-SA 4.0에 따라 출처(AI for Everyone by Percent · ai.percent.ac)와 라이선스를 표시하면 상업적으로도 이용할 수 있습니다. 내용을 바꿨다면 그 사실을 밝히고 같은 라이선스로 공유해 주세요.