Knowledge Distillation
널리지 디스틸레이션
큰 '교사(teacher)' 모델이 만든 출력 확률 분포를 작은 '학생(student)' 모델이 모방하도록 학습시켜, 성능은 최대한 유지하면서 크기를 줄이는 모델 경량화 기법입니다. 정답 라벨만 쓰는 대신, 교사 모델이 각 선택지에 매긴 확률(soft label)까지 신호로 넘겨주는 것이 핵심입니다. 그래서 학생 모델이 혼자 학습할 때보다 더 높은 성능에 도달하기도 합니다. 2015년 제프리 힌턴 연구진이 정리한 개념으로, 오늘날 소형 언어모델을 만드는 표준 방법의 하나입니다.
쉽게 말하면?
지식 증류(knowledge distillation)는 잘하는 큰 모델의 판단을 작은 모델이 따라 배우게 하는 방법입니다. 정답만 알려주는 게 아니라 '이 문제는 A가 70%, B가 25%로 보인다'는 큰 모델의 감각까지 함께 전달해요. 선배가 정답뿐 아니라 헷갈리는 선택지의 미묘한 차이까지 짚어 주면 신입이 훨씬 빨리 느는 것과 비슷합니다. 그래서 작은 모델이 혼자 공부할 때보다 더 높은 성적에 도달할 때가 많아요. 휴대폰이나 값싼 서버에 올릴 경량 모델을 만들 때 자주 씁니다.
한 줄로 비유하면?
선임의 판단 노하우까지 전수받아 몸집을 줄인 신입 실무자입니다.
어디에 쓰이나?
케이스 1Hugging Face(DistilBERT) — BERT를 40% 줄인 경량 인코더
Hugging Face 연구진은 2019년 BERT를 지식 증류로 압축한 DistilBERT를 공개했습니다 [2]. 사전학습 단계에서 큰 BERT를 교사로 삼아 작은 모델이 그 출력을 모방하도록 학습했습니다 [2]. 이후 자연어 처리 경량화의 표준 참고 사례로 자리 잡았습니다 [2]. 문서 분류·검색 같은 실무에 가볍게 얹을 수 있습니다 [2].
도입효과: 모델 크기 40% 감소·추론 속도 60% 향상, 언어 이해 성능 97% 유지 (원본 BERT 대비) [2]
케이스 2DeepSeek — R1의 추론 능력을 소형 Qwen에 증류
DeepSeek는 2025년 1월 추론 특화 모델 R1이 생성한 80만 개 샘플로 Qwen 계열 소형 모델을 증류했습니다 [3]. 소형 모델에는 강화학습을 직접 돌리기보다 증류가 더 낫다고 보고했습니다 [3]. 32B 증류 모델은 수학 경시 AIME 2024와 MATH-500에서 OpenAI o1-mini를 앞섰습니다 [4]. 무거운 추론 모델의 능력을 값싼 모델로 옮기는 대표 사례입니다 [3].
도입효과: AIME 2024 정답률(pass@1) 72.6% (o1-mini 63.6% 대비 +9.0%p), MATH-500 94.3% — DeepSeek-R1-Distill-Qwen-32B 기준 [4]
케이스 3Google DeepMind(Gemma 2) — 소형 모델을 증류로 학습
Google DeepMind는 2024년 Gemma 2의 2B·9B 모델을 일반적인 다음 토큰 예측 대신 지식 증류로 학습했습니다 [5]. 정답 하나(one-hot) 대신 큰 교사 모델의 확률 분포를 목표로 삼았습니다 [5]. 이론상 계산 최적 학습량의 50배가 넘는 토큰으로 훈련했습니다 [5]. 같은 크기를 처음부터 학습할 때보다 성능이 높았다고 밝혔습니다 [5].
도입효과: 학습 토큰량 이론적 계산 최적치의 50배 초과 (2B·9B, 교사 분포 증류 기준), 처음부터 학습 대비 성능 향상 [5]
케이스 4네이버 클로바(한국) — 가지치기+증류로 0.5B 모델 초저비용 학습
네이버 클로바는 HyperCLOVAX-SEED-Text-Instruct-0.5B를 공개하며 가지치기(pruning)와 지식 증류를 결합했다고 공식 기술 블로그에 밝혔습니다 [6]. 큰 모델을 잘라 낸 뒤 증류로 성능을 회복시키는 방식입니다 [6]. 같은 크기의 Qwen2.5-0.5B-Instruct와 학습 비용을 비교했습니다 [6]. 대부분의 벤치마크에서 우위를 보였다고 설명했습니다 [6].
도입효과: 학습 비용 4,358 GPU시간·6,537달러 (Qwen2.5-0.5B의 169,257 GPU시간·253,886달러 대비 약 39배 효율) [6]
주의할 점은?
오늘 바로 해보기
01. Hugging Face에서 distilbert-base 모델을 불러와 같은 문장 분류 작업을 원본 BERT와 나란히 실행해 봅니다.
02. 두 모델의 정확도와 추론 속도를 표로 기록해 크기·속도·성능의 교환 관계를 확인합니다.
03. DeepSeek-R1-Distill-Qwen-7B 모델 카드에서 AIME·MATH-500 점수를 읽고 원본 대비 어디까지 따라잡았는지 정리합니다 [4].
04. 사내에서 큰 모델로 처리 중인 반복 업무(분류·요약) 한 건을 골라 '교사→학생' 증류 후보로 적어 봅니다.
05. 힌턴 2015 논문 초록에서 'soft label' 개념 한 단락을 읽고 정답 라벨과의 차이를 한 줄로 메모합니다 [1].
한계와 진화
지식 증류의 한계는 학생 모델이 교사의 능력을 넘어서기 어렵다는 점입니다. 좋은 교사 모델과 충분한 학습 데이터가 없으면 효과가 작습니다 [1]. 교사가 가진 오류나 편향까지 함께 전달될 수 있어, 증류한 소형 모델이 특정 실수를 그대로 물려받기도 합니다 [3]. 교사 모델을 반복 호출해 학습 신호를 만들어야 하므로, 큰 교사를 자주 돌리는 계산 비용도 함께 따져야 합니다 [3]. 학생 규모가 너무 작으면 교사의 미묘한 판단을 다 담지 못해, 크기와 성능 사이의 타협점을 찾아야 합니다 [1]. 정답 하나가 아니라 확률 분포를 배우게 하는 것이 핵심이므로, 어떤 신호를 얼마나 부드럽게 넘길지 조정이 필요합니다 [1]. 즉 무작정 줄이는 게 아니라 교사·데이터·손실 설계를 함께 맞추는 작업입니다 [1].
진화 방향은 두 갈래입니다.
- 소형 모델을 처음부터 학습하는 대신 증류로 학습하는 방식이 표준으로 굳어지고 있습니다. Google은 Gemma 2 소형 모델을 교사 분포 증류로 학습해 처음부터 학습보다 높은 성능을 얻었고, DeepSeek는 소형 모델에는 강화학습보다 증류가 낫다고 보고했습니다 [3][5].
- 양자화·가지치기 같은 다른 경량화 기법과 결합하는 흐름입니다. 국내에서는 네이버 클로바가 가지치기와 증류를 함께 써 0.5B 모델을 Qwen2.5-0.5B 대비 약 39배 저렴하게 학습한 결과를 공개했습니다 [6]. 이 방식은 상용 대형 모델의 출력을 교사 데이터로 삼아 사내 소형 모델을 학습시키는 형태로도 쓰이는데, 이때는 원본 모델의 이용약관과 라이선스를 함께 확인해야 합니다 [3]. 정확도·비용·라이선스를 함께 저울질하는 것이 증류 도입의 점검표이며, 소형 추론 모델을 만드는 표준 경로로 자리 잡는 흐름입니다 [1].
참고 자료
- Distilling the Knowledge in a Neural Network — arXiv 논문·Hinton·Vinyals·Dean(Google)·2015 — https://arxiv.org/abs/1503.02531
- DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter — arXiv 논문·Hugging Face(Sanh 외)·2019 — https://arxiv.org/abs/1910.01108
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning — arXiv 논문·DeepSeek-AI·2025 — https://arxiv.org/abs/2501.12948
- DeepSeek-R1-Distill-Qwen-32B (모델 카드) — 공식 문서·DeepSeek-AI / Hugging Face·2025 — https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-32B
- Gemma 2: Improving Open Language Models at a Practical Size — arXiv 기술리포트·Google DeepMind·2024 — https://arxiv.org/abs/2408.00118
- 작지만 강력하게: 고효율 LLM을 만드는 HyperCLOVA X의 경량화 기술 — 공식 기술블로그·네이버 클로바·2025 — https://clova.ai/tech-blog/작지만-강력하게-고효율-llm을-만드는-hyperclova-x의-경량화-기
대표 출처
arXiv 논문 (2015) · Hinton 외, Distilling the Knowledge in a Neural Network이 페이지에 대한 의견을 남겨주세요
여러분의 의견은 다음 갱신에 반영됩니다.