CARD NEWS · 기본

DPO 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.

1/4
기본

DPO란?

AI 학습 분야에서 쓰이는 Direct Preference Optimization(직접 선호 최적화)의 약자로, 사람이 고른 더 나은 답과 덜 나은 답의 쌍을 모델에 직접 학습시켜 사람 선호에 맞추는 사후학습 기법입니다. 기존 RLHF는 선호 데이터로 보상 모델을 따로 만든 뒤 강화학습을 돌려야 했는데, DPO는 그 중간 단계를 없애고 한 번의 학습으로 처리합니다. 2023년 스탠퍼드대 연구진이 제안한 뒤 구현이 간단하고 학습이 안정적이라는 이유로 널리 쓰이며, SFT 다음 단계의 표준 선택지 중 하나로 자리 잡았습니다.

2/4
쉬운 풀이

디피오(DPO)는 Direct Preference Optimization, 즉 직접 선호 최적화의 약자예요

디피오(DPO)는 Direct Preference Optimization, 즉 직접 선호 최적화의 약자예요. 같은 질문에 대한 두 답변을 놓고 사람이 더 나은 쪽을 고른 기록을 모델에 그대로 학습시키는 방식입니다. 예전에는 채점 기준표를 만드는 심사위원 모델을 따로 두고 훈련했다면, DPO는 심사위원 없이 선택 기록만으로 바로 가르치는 셈입니다.

3/4
활용 사례

누가·언제 쓰나?

케이스 1: 스탠퍼드대 등 연구진(미국) — 보상 모델을 없앤 제안 2023년 공개된 DPO 논문은 언어 모델 자체가 이미 보상 모델 역할을 한다는 점에 착안해, 보상 모델 학습과 강화학습 샘플링을 생략한 학습법을 제시했습니다 [1]. 논문은 DPO가 안정적이고 계산이 가벼우면서도 구현이 훨씬 단순하다고 밝혔습니다 [1]. 이 연구는 NeurIPS 2023에 채택됐습니다 [2]. 도입효과:

4/4
더 알아보기

ai.percent.ac
/word/dpo

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.