Reinforcement Learning
리인포스먼트 러닝 (강화학습)
머신러닝 분야에서 쓰이는 용어로, AI가 정답을 통째로 배우는 대신 직접 행동해 보고 보상(점수)을 받으며 시행착오로 최적의 전략을 스스로 익히는 학습 방법입니다. 지도학습이 정답지 달린 문제집이라면, 강화학습은 점수판만 보고 게임을 반복해 실력을 올리는 방식입니다. 2016년 알파고로 대중에게 알려졌고, ChatGPT를 사람 선호에 맞게 다듬은 RLHF, 2025년 딥시크 R1의 추론 능력 학습까지 현대 AI 성능 도약의 핵심 기법으로 쓰입니다.
쉽게 말하면?
강화학습은 점수로 가르치는 방법이에요. 정답을 일일이 알려주는 대신, 잘하면 점수를 주고 못하면 깎는 규칙만 정해 두면 AI가 수백만 번 시도하며 스스로 요령을 찾습니다. 신입사원에게 매뉴얼을 외우게 하는 대신 평가 기준만 명확히 주고 실전에서 배우게 하는 것과 비슷해요. 게임 AI부터 챗봇 말투 교정까지 두루 쓰입니다.
한 줄로 비유하면?
매뉴얼 없이 성과 지표만 주고 실전 반복으로 요령을 익히게 하는 훈련 방식입니다.
어디에 쓰이나?
케이스 1딥마인드 — 서울에서 열린 알파고 대국
구글 딥마인드의 알파고는 사람 기보 학습에 자기 대국(self-play) 강화학습을 결합해 바둑 실력을 끌어올렸습니다. 2016년 3월 서울에서 열린 이세돌 9단과의 5번기에서 4승 1패로 이기며 강화학습을 전 세계에 각인시켰습니다.[1] 사람이 가르치지 않은 수를 스스로 찾아낸 점이 핵심이었습니다.
도입효과: 세계 최상위 프로 기사 상대 4승 1패 (2016-03, 서울 대국)[1]
케이스 2OpenAI — 사람 피드백 강화학습(RLHF)으로 만든 ChatGPT의 말투
OpenAI는 사람이 매긴 답변 선호 순위를 보상으로 쓰는 RLHF로 GPT-3를 다듬은 InstructGPT를 2022년 발표했습니다.[2] 이 기법이 그해 말 ChatGPT의 공손하고 지시를 잘 따르는 말투의 기반이 됐습니다. 모델 크기를 키우지 않고도 사용자가 체감하는 품질을 끌어올린 사례입니다.
도입효과: 사람 평가에서 13억 파라미터 InstructGPT 출력이 1,750억 파라미터 GPT-3보다 선호됨 (2022 논문)[2]
케이스 3딥시크 — 순수 강화학습만으로 추론 능력을 끌어낸 R1
중국 딥시크는 정답 여부를 자동 채점할 수 있는 수학·코딩 문제를 보상으로 삼아, 사람 시범 데이터 없이 강화학습만으로 추론 능력을 학습시킨 R1-Zero와 R1을 2025년 1월 공개했습니다. 이 연구는 2025년 9월 학술지 네이처 표지 논문으로 실렸습니다.[3] 추론 모델 경쟁의 방법론적 전환점으로 평가받습니다.
도입효과: 수학 경시 AIME 2024 정확도 15.6% → 71.0% (R1-Zero 강화학습 전후, 2025 논문)[3]
케이스 4엔씨소프트 — 게임 대전 AI를 프로 수준으로 훈련
한국 게임사 엔씨소프트는 심층 강화학습으로 블레이드앤소울의 대전 콘텐츠 '비무' AI를 훈련해 2018년 블소 토너먼트 월드 챔피언십 이벤트 매치에서 프로게이머와 블라인드 대전을 시연했습니다.[4] 실시간 격투 게임에서 프로 수준 경기력을 낸 연구로 국제 학술 무대에 발표됐고, 국내 기업이 강화학습을 실제 서비스 콘텐츠에 적용한 초기 사례입니다.
도입효과: 상용 게임 대전 콘텐츠에 프로 수준 강화학습 AI 적용·공개 시연 (2018 이벤트, 2019 논문)[4]
참고 자료
- AlphaGo seals 4-1 victory over Go grandmaster Lee Sedol — 언론 보도 · The Guardian · 2016-03-15
- Training language models to follow instructions with human feedback — arXiv 논문 · OpenAI · 2022-03
- DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning — 학술지 논문 · Nature · 2025-09
- Creating Pro-Level AI for a Real-Time Fighting Game Using Deep Reinforcement Learning — arXiv 논문 · NCSOFT · 2019-04
- Deep RL Course — 무료 강좌 · Hugging Face · 2023
대표 출처
학술지 (Nature, DeepSeek-R1 논문, 2025-09)이 페이지에 대한 의견을 남겨주세요
여러분의 의견은 다음 갱신에 반영됩니다.