CARD NEWS · 기본

Reinforcement Learning 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.

1/4
기본

Reinforcement Learning란?

머신러닝 분야에서 쓰이는 용어로, AI가 정답을 통째로 배우는 대신 직접 행동해 보고 보상(점수)을 받으며 시행착오로 최적의 전략을 스스로 익히는 학습 방법입니다. 지도학습이 정답지 달린 문제집이라면, 강화학습은 점수판만 보고 게임을 반복해 실력을 올리는 방식입니다. 2016년 알파고로 대중에게 알려졌고, ChatGPT를 사람 선호에 맞게 다듬은 RLHF, 2025년 딥시크 R1의 추론 능력 학습까지 현대 AI 성능 도약의 핵심 기법으로 쓰입니다.

2/4
쉬운 풀이

강화학습은 점수로 가르치는 방법이에요

강화학습은 점수로 가르치는 방법이에요. 정답을 일일이 알려주는 대신, 잘하면 점수를 주고 못하면 깎는 규칙만 정해 두면 AI가 수백만 번 시도하며 스스로 요령을 찾습니다. 신입사원에게 매뉴얼을 외우게 하는 대신 평가 기준만 명확히 주고 실전에서 배우게 하는 것과 비슷해요. 게임 AI부터 챗봇 말투 교정까지 두루 쓰입니다.

3/4
활용 사례

누가·언제 쓰나?

케이스 1: 딥마인드 — 서울에서 열린 알파고 대국 구글 딥마인드의 알파고는 사람 기보 학습에 자기 대국(self-play) 강화학습을 결합해 바둑 실력을 끌어올렸습니다. 2016년 3월 서울에서 열린 이세돌 9단과의 5번기에서 4승 1패로 이기며 강화학습을 전 세계에 각인시켰습니다.[1] 사람이 가르치지 않은 수를 스스로 찾아낸 점이 핵심이었습니다. 도입효과: 세계 최상위 프로 기사 상대

4/4
더 알아보기

ai.percent.ac
/word/reinforcement-learning

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.