Pre-training란?
AI 모델 학습 분야에서 쓰이는 용어로, LLM이 대량의 웹·책·코드 텍스트를 미리 읽으며 단어 사이의 통계 관계를 익히는 첫 번째 학습 단계로, 모델의 기초 언어 능력이 만들어지는 과정입니다.
CARD NEWS · 기본
SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.
AI 모델 학습 분야에서 쓰이는 용어로, LLM이 대량의 웹·책·코드 텍스트를 미리 읽으며 단어 사이의 통계 관계를 익히는 첫 번째 학습 단계로, 모델의 기초 언어 능력이 만들어지는 과정입니다.
사전학습은 거대 언어 모델이 인터넷·책·코드에서 모아 둔 글을 통째로 읽으며 "어떤 단어 다음에 어떤 단어가 자주 따라오는가"를 익히는 첫 단계예요. 신입사원이 부서 발령 전에 지난 5년치 회의록과 매뉴얼을 통독하면서 회사 말투와 기본 업무 지식을 머리에 채우는 장면과 비슷합니다. 이 단계가 끝난 모델은 아직 지시를 잘 따르거나 회사 양식에 맞추지는 못하지만, 문법·세계 지식·기본 추론이 가중치 안에 새겨진 상태입니다. 사전학습이 만들어 둔 이 베이스 위에 파인튜닝과 RLHF가 얹혀야 ChatGPT나 Claude처럼 쓸 수 있는 모델이 됩니다.
**케이스 1: Google BERT — MLM 사전학습으로 NLP 11개 과제 SOTA 갱신** 2018년 10월 구글이 arXiv에 공개한 BERT 논문은 위키피디아와 BooksCorpus 약 33억 단어 규모 코퍼스에서 마스킹 언어 모델(MLM)과 다음 문장 예측 과제로 양방향 트랜스포머를 사전학습한 결과를 보고했습니다 [1]. 사전학습된 BERT-Large(340M 파라미터) 가중치
카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.