DPO
디피오
AI 학습 분야에서 쓰이는 Direct Preference Optimization(직접 선호 최적화)의 약자로, 사람이 고른 더 나은 답과 덜 나은 답의 쌍을 모델에 직접 학습시켜 사람 선호에 맞추는 사후학습 기법입니다. 기존 RLHF는 선호 데이터로 보상 모델을 따로 만든 뒤 강화학습을 돌려야 했는데, DPO는 그 중간 단계를 없애고 한 번의 학습으로 처리합니다. 2023년 스탠퍼드대 연구진이 제안한 뒤 구현이 간단하고 학습이 안정적이라는 이유로 널리 쓰이며, SFT 다음 단계의 표준 선택지 중 하나로 자리 잡았습니다.
쉽게 말하면?
디피오(DPO)는 Direct Preference Optimization, 즉 직접 선호 최적화의 약자예요. 같은 질문에 대한 두 답변을 놓고 사람이 더 나은 쪽을 고른 기록을 모델에 그대로 학습시키는 방식입니다. 예전에는 채점 기준표를 만드는 심사위원 모델을 따로 두고 훈련했다면, DPO는 심사위원 없이 선택 기록만으로 바로 가르치는 셈입니다.
한 줄로 비유하면?
심사위원을 따로 두는 대신, 선배가 고른 더 나은 보고서 사례만 모아 신입에게 바로 보여 주는 것과 같습니다.
어디에 쓰이나?
케이스 1스탠퍼드대 등 연구진(미국) — 보상 모델을 없앤 제안
2023년 공개된 DPO 논문은 언어 모델 자체가 이미 보상 모델 역할을 한다는 점에 착안해, 보상 모델 학습과 강화학습 샘플링을 생략한 학습법을 제시했습니다 [1]. 논문은 DPO가 안정적이고 계산이 가벼우면서도 구현이 훨씬 단순하다고 밝혔습니다 [1]. 이 연구는 NeurIPS 2023에 채택됐습니다 [2].
도입효과: 감성 제어 과제에서 PPO 기반 RLHF를 상회, 요약·단일턴 대화 품질은 동등하거나 개선(논문 기준) [1]
케이스 2LG AI연구원(한국) — 엑사원 3.0의 2단계 사후학습
LG AI연구원은 2024년 엑사원 3.0 기술 보고서에서 SFT로 지시 수행 능력을 기른 뒤 DPO로 사람 선호에 맞추는 2단계 절차를 명시했습니다 [3][4]. 국내 대표 공개 모델이 DPO를 표준 공정으로 채택한 사례입니다 [4]. 사후학습 절차를 공개한 기술 보고서라 도입 검토 시 참고하기 좋습니다.
도입효과: 한국어 벤치마크 KoBEST 평균 74.1로 비교군 1위, 한국어 멀티턴 LogicKor 8.77 최고점(보고서 기준) [4]
케이스 3OpenAI(미국) — 기법 선택 가이드에 편입
OpenAI는 공식 쿡북에서 파인튜닝 기법을 SFT, DPO, 강화 파인튜닝(RFT)으로 나누고 선택 기준을 안내합니다 [5]. 말투나 형식처럼 정답이 명확한 과제는 SFT, 두 답변 중 어느 쪽이 나은지가 관건인 과제는 DPO를 권합니다 [5]. 기업이 자사 데이터로 모델을 조정할 때의 판단 기준이 됩니다.
도입효과: 선호 비교형 과제를 DPO로 분류하는 공식 선택 기준 제시(공식 쿡북 기준) [5]
케이스 4Hugging Face(미국) — 오픈소스 표준 구현
허깅페이스는 TRL 라이브러리의 DPOTrainer로 DPO 학습을 표준화했습니다 [6]. 선호 쌍 데이터셋 포맷과 트레이너 API를 제공해 연구실과 기업이 같은 방식으로 재현할 수 있게 했습니다 [6]. 저자들이 공개한 참조 구현도 함께 쓰입니다 [7].
도입효과: 선호 쌍(chosen·rejected) 데이터셋 포맷 표준화와 트레이너 API 제공으로 구현 진입장벽 완화(공식 문서 기준) [6]
주의할 점은?
오늘 바로 해보기
01. 사내에서 AI 답변 두 개를 나란히 놓고 더 나은 쪽을 고르는 기록을 남겨 봅니다. 이것이 DPO 데이터의 기본 단위입니다 [1].
02. OpenAI 쿡북의 SFT·DPO·RFT 선택 기준을 읽고 맡길 과제가 어느 쪽인지 판별합니다 [5].
03. 선호를 고르는 기준(정확성·말투·길이 등)을 문서로 먼저 정합니다. 기준이 흔들리면 학습도 흔들립니다.
04. 개발자라면 허깅페이스 TRL의 DPOTrainer 예제로 소형 공개 모델에 적용해 봅니다 [6].
05. 파인튜닝 전에 프롬프트 개선과 RAG로 충분한지 먼저 검토합니다. DPO는 선호 데이터 수집 비용이 드는 선택지입니다.
한계와 진화
한계는 선호 데이터의 품질과 범위입니다. 사람이 고른 기준이 일관되지 않으면 모델도 엉뚱한 방향으로 정렬되고, 수집된 선호에 없는 상황에서는 효과가 보장되지 않습니다. 짧고 무난한 답을 선호하는 편향이 쌓이면 답변이 지나치게 밋밋해지는 부작용도 보고됩니다. 그래서 DPO 단독보다 SFT·평가와 묶은 파이프라인 설계가 중요합니다 [5].
진화는 변형 기법의 확산입니다. DPO 이후 선호 학습을 변형한 여러 기법이 제안됐고, 채점 기준으로 강화학습하는 RFT처럼 목적에 따라 갈래가 나뉘고 있습니다 [5]. 국내외 모델 기술 보고서가 사후학습 절차를 공개하면서, DPO는 연구실 용어를 넘어 모델 도입 검토 실무에서 자주 마주치는 항목이 됐습니다 [4].
참고 자료
- Direct Preference Optimization: Your Language Model is Secretly a Reward Model — 논문·Rafailov 외(arXiv)·2023 — https://arxiv.org/abs/2305.18290
- Direct Preference Optimization (NeurIPS 2023 Proceedings) — 학회 논문집·NeurIPS·2023 — https://papers.nips.cc/paper_files/paper/2023/hash/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html
- EXAONE 3.0 7.8B Instruction Tuned Language Model — 논문·LG AI Research(arXiv)·2024 — https://arxiv.org/abs/2408.03541
- LG AI Research Open-Sources EXAONE 3.0 — 기술 보도·MarkTechPost·2024 — https://www.marktechpost.com/2024/09/08/lg-ai-research-open-sources-exaone-3-0-a-7-8b-bilingual-language-model-excelling-in-english-and-korean-with-top-performance-in-real-world-applications-and-complex-reasoning/
- Fine-Tuning Techniques — Choosing Between SFT, DPO, and RFT — 공식 쿡북·OpenAI·2026 접속 — https://developers.openai.com/cookbook/examples/fine_tuning_direct_preference_optimization_guide
- DPO Trainer — 공식 문서·Hugging Face TRL·상시 갱신 — https://huggingface.co/docs/trl/dpo_trainer
- Reference implementation for DPO — 오픈소스 저장소·GitHub(eric-mitchell)·2023 — https://github.com/eric-mitchell/direct-preference-optimization
대표 출처
논문 (2023) · Stanford 외(Rafailov 외), Direct Preference Optimization: Your Language Model is Secretly a Reward Model이 페이지에 대한 의견을 남겨주세요
여러분의 의견은 다음 갱신에 반영됩니다.