AI Alignment란?
AI 활용 분야에서 쓰이는 용어로, 인공지능 시스템이 만든 행동·답변이 사람이 의도한 가치·목표와 일치하도록 학습 시점부터 조정하는 연구·기술 분야를 가리킵니다.
CARD NEWS · 보안·윤리
SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.
AI 활용 분야에서 쓰이는 용어로, 인공지능 시스템이 만든 행동·답변이 사람이 의도한 가치·목표와 일치하도록 학습 시점부터 조정하는 연구·기술 분야를 가리킵니다.
AI 정렬은 인공지능에게 "이렇게 답해 줘"라고 가르친 방향대로 실제 답이 나오는지 맞추는 일이에요. 보고서 양식을 미리 정해 두고 "이 양식 그대로 써 줘"라고 부탁했는데 모델이 자기 마음대로 다른 양식으로 써 오면 정렬이 어긋난 상황입니다. 조별 과제에서 역할 분담표를 만들어 줬는데 팀원이 자기 판단대로 다른 일을 하고 있는 장면과 비슷합니다. 모델이 점점 더 많은 결정을 대신하게 될수록 "내가 의도한 방향이 정말 모델에 전달됐나"를 확인하는 절차가 중요해지기 때문에 알아둘 필요가 있어요.
**케이스 1: OpenAI — InstructGPT의 RLHF로 ChatGPT 응답 톤 정렬** OpenAI는 2022년 3월 arXiv 2203.02155 *Training language models to follow instructions with human feedback* 논문에서 사람이 두 응답 중 더 나은 쪽을 고르는 비교 데이터로 보상 모델을 학습시키고, 이를 보상 신호로 모
카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.