4건
Reinforcement Learning
리인포스먼트 러닝 (강화학습)
머신러닝 분야에서 쓰이는 용어로, AI가 정답을 통째로 배우는 대신 직접 행동해 보고 보상(점수)을 받으며 시행착오로 최적의 전략을 스스로 익히는 학습 방법입니다. 지도학습이 정답지 달린 문제집이라면, 강화학습은 점수판만 보고 게임을 반복해 실력을 올리는 방식입니다. 2016년 알파고로 대중에게 알려졌고, ChatGPT를 사람 선호에 맞게 다듬은 RLHF, 2025년 딥시크 R1의 추론 능력 학습까지 현대 AI 성능 도약의 핵심 기법으로 쓰입니다.
기본
DPO
디피오
AI 학습 분야에서 쓰이는 Direct Preference Optimization(직접 선호 최적화)의 약자로, 사람이 고른 더 나은 답과 덜 나은 답의 쌍을 모델에 직접 학습시켜 사람 선호에 맞추는 사후학습 기법입니다. 기존 RLHF는 선호 데이터로 보상 모델을 따로 만든 뒤 강화학습을 돌려야 했는데, DPO는 그 중간 단계를 없애고 한 번의 학습으로 처리합니다. 2023년 스탠퍼드대 연구진이 제안한 뒤 구현이 간단하고 학습이 안정적이라는 이유로 널리 쓰이며, SFT 다음 단계의 표준 선택지 중 하나로 자리 잡았습니다.
기본
RLAIF
AI 모델 학습 분야에서 쓰이는 RLAIF(Reinforcement Learning from AI Feedback, 인공지능 피드백 기반 강화학습)의 약자로, 사람 대신 다른 LLM이 답안 두 개 중 더 나은 쪽을 골라 보상을 만들어 모델을 학습시키는 방법입니다.
보안·윤리
RLHF
AI 모델 학습 분야에서 쓰이는 Reinforcement Learning from Human Feedback(인간 피드백 기반 강화학습)의 약자로, 사람이 모델 답변 중 더 좋은 쪽을 골라준 기록을 보상으로 삼아 모델 행동을 다듬는 학습 방법입니다.
보안·윤리