DPO란?
AI 학습 분야에서 쓰이는 Direct Preference Optimization(직접 선호 최적화)의 약자로, 사람이 고른 더 나은 답과 덜 나은 답의 쌍을 모델에 직접 학습시켜 사람 선호에 맞추는 사후학습 기법입니다. 기존 RLHF는 선호 데이터로 보상 모델을 따로 만든 뒤 강화학습을 돌려야 했는데, DPO는 그 중간 단계를 없애고 한 번의 학습으로 처리합니다. 2023년 스탠퍼드대 연구진이 제안한 뒤 구현이 간단하고 학습이 안정적이라는 이유로 널리 쓰이며, SFT 다음 단계의 표준 선택지 중 하나로 자리 잡았습니다.