1/4
보안·윤리
AI Alignment란?
AI 활용 분야에서 쓰이는 용어로, 인공지능 시스템이 만든 행동·답변이 사람이 의도한 가치·목표와 일치하도록 학습 시점부터 조정하는 연구·기술 분야를 가리킵니다.
CARD NEWS · 보안·윤리
SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 화면을 캡처하거나 브라우저의 인쇄 기능으로 PDF를 저장해 공유할 수 있습니다.
AI 활용 분야에서 쓰이는 용어로, 인공지능 시스템이 만든 행동·답변이 사람이 의도한 가치·목표와 일치하도록 학습 시점부터 조정하는 연구·기술 분야를 가리킵니다.
AI 정렬은 인공지능에게 "이렇게 답해 줘"라고 가르친 방향대로 실제 답이 나오는지 맞추는 일이에요. 보고서 양식을 미리 정해 두고 "이 양식 그대로 써 줘"라고 부탁했는데 모델이 자기 마음대로 다른 양식으로 써 오면 정렬이 어긋난 상황입니다. 조별 과제에서 역할 분담표를 만들어 줬는데 팀원이 자기 판단대로 다른 일을 하고 있는 장면과 비슷합니다.
02155 *Training language models to follow instructions with human feedback* 논문에서 사람이 두 응답 중 더 나은 쪽을 고르는 비교 데이터로 보상 모델을 학습시키고, 이를 보상 신호로 모델을 다시 강화학습하는 RLHF 파이프라인을 공개했습니다 [6].
카드를 캡처하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 쓸 수 있습니다. CC BY-SA 4.0에 따라 출처(AI for Everyone by Percent · ai.percent.ac)와 라이선스를 표시하면 상업적으로도 이용할 수 있습니다. 내용을 바꿨다면 그 사실을 밝히고 같은 라이선스로 공유해 주세요.