CARD NEWS · 기본

Reinforcement Learning 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 화면을 캡처하거나 브라우저의 인쇄 기능으로 PDF를 저장해 공유할 수 있습니다.

1/4
기본

Reinforcement Learning란?

머신러닝 분야에서 쓰이는 용어로, AI가 정답을 통째로 배우는 대신 직접 행동해 보고 보상(점수)을 받으며 시행착오로 최적의 전략을 스스로 익히는 학습 방법입니다. 지도학습이 정답지 달린 문제집이라면, 강화학습은 점수판만 보고 게임을 반복해 실력을 올리는 방식입니다. 2016년 알파고로 대중에게 알려졌고, ChatGPT를 사람 선호에 맞게 다듬은 RLHF, 2025년 딥시크 R1의 추론 능력 학습까지 현대 AI 성능 도약의 핵심 기법으로 쓰입니다.

2/4
쉬운 풀이

이렇게 이해하면 쉬워요

강화학습은 점수로 가르치는 방법이에요. 정답을 일일이 알려주는 대신, 잘하면 점수를 주고 못하면 깎는 규칙만 정해 두면 AI가 수백만 번 시도하며 스스로 요령을 찾습니다. 신입사원에게 매뉴얼을 외우게 하는 대신 평가 기준만 명확히 주고 실전에서 배우게 하는 것과 비슷해요. 게임 AI부터 챗봇 말투 교정까지 두루 쓰입니다.

3/4
활용 사례

누가·언제 쓰나?

케이스 1: 딥마인드 — 서울에서 열린 알파고 대국 구글 딥마인드의 알파고는 사람 기보 학습에 자기 대국(self-play) 강화학습을 결합해 바둑 실력을 끌어올렸습니다. [1] 사람이 가르치지 않은 수를 스스로 찾아낸 점이 핵심이었습니다. [2] 이 기법이 그해 말 ChatGPT의 공손하고 지시를 잘 따르는 말투의 기반이 됐습니다.

4/4
더 알아보기

ai.percent.ac
/word/reinforcement-learning

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 캡처하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 쓸 수 있습니다. CC BY-SA 4.0에 따라 출처(AI for Everyone by Percent · ai.percent.ac)와 라이선스를 표시하면 상업적으로도 이용할 수 있습니다. 내용을 바꿨다면 그 사실을 밝히고 같은 라이선스로 공유해 주세요.