CARD NEWS · 기본

Knowledge Distillation 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.

1/4
기본

Knowledge Distillation란?

큰 '교사(teacher)' 모델이 만든 출력 확률 분포를 작은 '학생(student)' 모델이 모방하도록 학습시켜, 성능은 최대한 유지하면서 크기를 줄이는 모델 경량화 기법입니다. 정답 라벨만 쓰는 대신, 교사 모델이 각 선택지에 매긴 확률(soft label)까지 신호로 넘겨주는 것이 핵심입니다. 그래서 학생 모델이 혼자 학습할 때보다 더 높은 성능에 도달하기도 합니다. 2015년 제프리 힌턴 연구진이 정리한 개념으로, 오늘날 소형 언어모델을 만드는 표준 방법의 하나입니다.

2/4
쉬운 풀이

지식 증류(knowledge distillation)는 잘하는 큰 모델의 판단을 작은 모델이 따라 배우게 하

지식 증류(knowledge distillation)는 잘하는 큰 모델의 판단을 작은 모델이 따라 배우게 하는 방법입니다. 정답만 알려주는 게 아니라 '이 문제는 A가 70%, B가 25%로 보인다'는 큰 모델의 감각까지 함께 전달해요. 선배가 정답뿐 아니라 헷갈리는 선택지의 미묘한 차이까지 짚어 주면 신입이 훨씬 빨리 느는 것과 비슷합니다. 그래서 작은 모델이 혼자 공부할 때보다 더 높은 성적에 도달할 때가 많아요. 휴대폰이나 값싼 서버에 올릴 경량 모델을 만들 때 자주 씁니다.

3/4
활용 사례

누가·언제 쓰나?

케이스 1: Hugging Face(DistilBERT) — BERT를 40% 줄인 경량 인코더 Hugging Face 연구진은 2019년 BERT를 지식 증류로 압축한 DistilBERT를 공개했습니다 [2]. 사전학습 단계에서 큰 BERT를 교사로 삼아 작은 모델이 그 출력을 모방하도록 학습했습니다 [2]. 이후 자연어 처리 경량화의 표준 참고 사례로 자리 잡았습니다 [2]. 문서 분류·

4/4
더 알아보기

ai.percent.ac
/word/knowledge-distillation

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.