Speculative Decoding
스페큘러티브 디코딩
작고 빠른 '초안(draft) 모델'이 다음 토큰 여러 개를 먼저 제안하면, 크고 정확한 본 모델이 이를 한 번에 검증해 맞은 부분까지 통째로 채택하는 추론 가속 기법입니다. 토큰을 하나씩 순서대로 생성하던 과정을 병렬 검증으로 바꿔 속도를 높입니다. 틀린 토큰이 나온 지점부터 본 모델이 다시 이어 씁니다. 최종 출력은 본 모델이 혼자 생성한 것과 동일하게 유지되는 것이 특징입니다. 2022년 구글 연구진이 정리했습니다.
쉽게 말하면?
스페큘러티브 디코딩은 '빠른 초벌 + 꼼꼼한 검수'로 답을 빨리 뽑는 방법입니다. 작고 빠른 모델이 다음에 올 단어 여러 개를 미리 써 두면, 크고 정확한 모델이 한꺼번에 맞는지 확인해요. 맞은 부분은 그대로 채택하고 틀린 곳부터 다시 씁니다. 신입이 초안을 빠르게 작성해 오면 팀장이 한 번에 검토하고 맞는 데까지 승인하는 결재 흐름과 비슷해요. 답의 내용은 큰 모델이 혼자 쓸 때와 똑같고 속도만 빨라지는 게 장점입니다. 다만 초안 모델이 자주 틀리면 검수만 늘어 효과가 줄기도 합니다.
한 줄로 비유하면?
신입 초안을 팀장이 한 번에 검수해 맞는 데까지 결재하는 방식입니다.
어디에 쓰이나?
케이스 1Google — 스페큘러티브 디코딩 원 논문(T5-XXL)
Google 연구진은 2022년 스페큘러티브 디코딩을 제안했습니다 [1]. 작은 근사 모델이 초안을 만들고 본 모델이 검증하는 구조로, 모델을 다시 학습할 필요가 없습니다 [1]. T5-XXL에서 표준 구현과 비교해 측정했습니다 [1]. 출력이 원본과 완전히 동일하게 유지된다는 점을 입증했습니다 [1].
도입효과: 추론 속도 2~3배 향상 (표준 T5X 구현 대비, 출력 동일 조건) [1]
케이스 2DeepMind — 700억 파라미터 Chinchilla 가속
DeepMind는 2023년 같은 아이디어를 '스페큘러티브 샘플링'으로 정리했습니다 [2]. 초안 모델이 짧은 후속 토큰을 제안하고, 수정된 기각 샘플링으로 본 모델의 확률 분포를 보존합니다 [2]. 700억 파라미터 Chinchilla 모델에 분산 환경에서 적용했습니다 [2]. 샘플 품질을 해치지 않고 속도만 끌어올렸습니다 [2].
도입효과: 디코딩 속도 2~2.5배 향상 (Chinchilla 70B, 표준 자기회귀 디코딩 대비, 품질 손실 없음) [2]
케이스 3NVIDIA — TensorRT-LLM으로 Llama 3.1 405B 서빙 가속
NVIDIA는 2024년 TensorRT-LLM에 초안-본 모델 방식 스페큘러티브 디코딩을 적용한 결과를 공개했습니다 [4]. 본 모델 Llama 3.1 405B를 H200 GPU 4장에 올렸습니다 [4]. 초안 모델로 Llama 3.2 3B를 썼습니다 [4]. 초안 모델이 없을 때(초당 33.46 토큰)와 비교했습니다 [4].
도입효과: 처리량 초당 120.75 토큰 = 3.61배 향상 (초안 모델 없는 33.46 토큰/초 대비, Llama 3.1 405B·H200 4장) [4]
케이스 4네이버 클로바(한국) — HyperCLOVA X 서빙에 적용
네이버 클로바는 2025년 상용 HyperCLOVA X 서빙에 스페큘러티브 디코딩을 적용한 과정을 공식 기술 블로그에 공개했습니다 [5]. 입력마다 추측 토큰 길이를 고정하지 않고 동적으로 조절하는 방식을 설명했습니다 [5]. 자체 서빙 환경에 맞춘 구현·튜닝 경험을 정리했습니다 [5]. 한국어 대규모 상용 모델에 이 기법을 적용한 국내 사례입니다 [5].
도입효과: 상용 HyperCLOVA X 서빙 파이프라인에 스페큘러티브 디코딩 도입 (고정 길이 대신 입력별 동적 추측 길이 방식 적용) [5]
주의할 점은?
오늘 바로 해보기
01. vLLM 문서의 speculative decoding 예제를 열어 draft 모델을 지정하는 설정 한 줄을 확인합니다.
02. 같은 프롬프트를 일반 디코딩과 스페큘러티브 디코딩으로 각각 생성해 응답 시간을 잽니다.
03. 두 방식의 출력 텍스트가 동일한지 대조해 '품질 손실 없음'을 눈으로 확인합니다.
04. 초안 모델 크기를 작게·크게 바꿔 가며 속도와 토큰 수용률이 어떻게 달라지는지 표에 적습니다.
05. NVIDIA TensorRT-LLM 블로그에서 3.61배 수치의 측정 조건(GPU·모델·배치 크기)을 확인합니다 [4].
한계와 진화
스페큘러티브 디코딩의 효과는 초안 모델과 본 모델이 얼마나 자주 일치하느냐(수용률)에 달려 있습니다. 초안이 자주 틀리면 검증만 늘어 이득이 줄어듭니다 [1]. 국내 기업 SqueezeBits의 실측에서는 초안 모델을 0.5B에서 8B로 키우자 토큰 수용률이 53.5%에서 76.5%로 올랐고, 입력이 길어질수록 수용률이 떨어졌습니다 [6]. 같은 분석에서 당시 TensorRT-LLM은 배치 크기 1에서만 이 기법이 효과를 냈다고 지적했습니다 [6]. 초안 모델을 함께 돌리는 만큼 GPU 메모리와 관리 포인트가 늘어, 작은 모델에서는 배보다 배꼽이 커질 수 있습니다 [1]. 배치가 커지면 원래 GPU 활용도가 높아 가속 효과가 줄어드는 구간도 있습니다 [6]. 즉 초안 모델 선택과 배치 조건에 따라 이득 폭이 크게 달라집니다 [6].
진화 방향은 두 갈래입니다.
- 별도 초안 모델 없이 본 모델에 예측 헤드를 여러 개 달아 여러 토큰을 한 번에 내는 방식입니다. 2024년 Medusa가 대표적입니다 [3].
- 상용 서빙 프레임워크로 흡수되는 흐름입니다. vLLM과 NVIDIA TensorRT-LLM이 기능으로 제공하고, 국내에서는 네이버 클로바가 HyperCLOVA X 서빙에 입력별 동적 추측 길이 방식을 적용했습니다 [4][5]. 초안 모델을 잘 고르면 출력 품질은 그대로 둔 채 속도만 얻으므로, 지연이 중요한 대화형 서비스에서 효과가 큽니다 [1]. 초안 모델을 본 모델과 함께 배포하는 구성이나, N-그램·자기 초안처럼 초안 생성 비용 자체를 줄이는 변형도 이어지며 선택지가 넓어지고 있습니다 [3]. 출력을 바꾸지 않으면서 지연만 줄이는 몇 안 되는 기법이라, 서빙 비용 최적화의 기본 카드로 자리 잡는 추세입니다 [1]. 배치 크기와 트래픽 패턴에 따라 이득이 달라지므로, 실제 워크로드에서 켜고 끄며 측정해 보는 것이 좋습니다 [6].
참고 자료
- Fast Inference from Transformers via Speculative Decoding — arXiv 논문·Leviathan 외(Google)·2022 — https://arxiv.org/abs/2211.17192
- Accelerating Large Language Model Decoding with Speculative Sampling — arXiv 논문·DeepMind(Chen 외)·2023 — https://arxiv.org/abs/2302.01318
- Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads — arXiv 논문·Cai 외·2024 — https://arxiv.org/abs/2401.10774
- TensorRT-LLM Speculative Decoding Boosts Inference Throughput by up to 3.6x — 공식 기술블로그·NVIDIA·2024 — https://developer.nvidia.com/blog/tensorrt-llm-speculative-decoding-boosts-inference-throughput-by-up-to-3-6x/
- Breaking the speed barrier: How we implemented speculative decoding for HyperCLOVA X — 공식 기술블로그·네이버 클로바·2025 — https://clova.ai/en/tech-blog/breaking-the-speed-barrier-how-we-implemented-speculative-decoding-for-hyperclova-x
- vLLM vs TensorRT-LLM #11. Speculative Decoding — 기술블로그·SqueezeBits(스퀴즈비츠)·2024 — https://blog.squeezebits.com/vllm-vs-tensorrtllm-11-speculative-decoding-37301
대표 출처
arXiv 논문 (2022) · Leviathan 외(Google), Fast Inference from Transformers via Speculative Decoding이 페이지에 대한 의견을 남겨주세요
여러분의 의견은 다음 갱신에 반영됩니다.