2건
Reinforcement Learning
리인포스먼트 러닝 (강화학습)
머신러닝 분야에서 쓰이는 용어로, AI가 정답을 통째로 배우는 대신 직접 행동해 보고 보상(점수)을 받으며 시행착오로 최적의 전략을 스스로 익히는 학습 방법입니다. 지도학습이 정답지 달린 문제집이라면, 강화학습은 점수판만 보고 게임을 반복해 실력을 올리는 방식입니다. 2016년 알파고로 대중에게 알려졌고, ChatGPT를 사람 선호에 맞게 다듬은 RLHF, 2025년 딥시크 R1의 추론 능력 학습까지 현대 AI 성능 도약의 핵심 기법으로 쓰입니다.
기본
Data Labeling
데이터 라벨링
데이터·DB 분야에서 쓰이는 용어로, 원시 데이터에 의미나 정답 태그를 붙여 머신러닝이 그 라벨로 학습할 수 있게 만드는 작업입니다. Scale AI 공식 가이드는 지도학습이 대량의 라벨 데이터로 모델을 학습시켜 분류나 예측을 하게 한다고 설명합니다. 모델 성능은 데이터와 라벨의 품질에 좌우됩니다. 그래서 자주 간과되지만 머신러닝에서 결정적인 작업으로 꼽힙니다. 최근에는 사람 라벨링에 머신러닝을 결합해 일부를 자동화하기도 합니다.
데이터·DB