RLHF란?
AI 모델 학습 분야에서 쓰이는 Reinforcement Learning from Human Feedback(인간 피드백 기반 강화학습)의 약자로, 사람이 모델 답변 중 더 좋은 쪽을 골라준 기록을 보상으로 삼아 모델 행동을 다듬는 학습 방법입니다.
CARD NEWS · 보안·윤리
SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.
AI 모델 학습 분야에서 쓰이는 Reinforcement Learning from Human Feedback(인간 피드백 기반 강화학습)의 약자로, 사람이 모델 답변 중 더 좋은 쪽을 골라준 기록을 보상으로 삼아 모델 행동을 다듬는 학습 방법입니다.
RLHF는 "사람이 채점을 도와주는 강화학습"이에요. 모델이 같은 질문에 답변 두 개를 만들어 내면, 사람이 "이쪽이 더 좋다"고 골라 줍니다. 모델은 그 선택 기록을 점수표 삼아 다음부터 더 좋아 보이는 쪽으로 답하도록 학습하는 방식입니다. 선생님이 답안 두 개 중 더 좋은 걸 골라주는 채점을 수천 번 반복하면, 학생이 자연스럽게 선생님 취향에 맞춰 답을 쓰게 되는 것과 비슷해요. ChatGPT가 처음 나왔을 때 "말귀를 알아듣는다"는 평가를 받은 핵심 기법이라, AI 정렬을 이해하려면 꼭 알아야 하는 단어입니다.
**케이스 1: OpenAI ChatGPT — RLHF가 상업화의 결정타** OpenAI는 InstructGPT와 같은 RLHF 파이프라인 위에서 ChatGPT를 만들었습니다. 사람 라벨러가 모델 출력에 순위를 매긴 데이터로 보상모델을 학습하고, 그 보상으로 PPO를 돌립니다.[1] 그 결과 동일 평가에서 1.3B 정렬 모델이 100배 큰 175B 비정렬 모델보다 사람 선호도가 높게 나왔습니
카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.