KV Cache
케이브이 캐시
LLM 추론 분야에서 쓰이는 Key-Value Cache(키-값 캐시)의 약자로, 언어 모델이 답을 생성할 때 앞 토큰들의 어텐션 계산 결과인 키와 값을 GPU 메모리에 저장해 두고 재사용하는 기법입니다. 매 토큰마다 전체 문맥을 다시 계산하는 낭비를 없애 생성 속도를 높입니다. 대신 문맥이 길어질수록 캐시가 메모리를 차지해, LLM 서빙 비용과 컨텍스트 길이 한계를 결정하는 핵심 변수가 됩니다. API 제공사의 프롬프트 캐싱 할인은 이 캐시를 재사용하는 상용화 형태입니다.
쉽게 말하면?
케이브이 캐시(KV Cache)는 AI가 긴 글을 읽으며 만든 메모를 버리지 않고 쌓아 두는 임시 기억장치예요. 문장을 만들 때마다 처음부터 다시 읽으면 느리니, 앞서 읽은 내용의 요점(키와 값)을 책갈피 메모로 남겨 두는 방식입니다. 메모 덕에 다음 단어 생성이 빨라지지만, 글이 길어질수록 메모 뭉치가 책상(GPU 메모리)을 가득 채우는 것이 문제입니다.
한 줄로 비유하면?
긴 회의에서 매번 회의록을 처음부터 다시 읽는 대신, 요점 메모를 쌓아 두고 이어서 말하는 것과 같습니다.
어디에 쓰이나?
케이스 1vLLM·UC버클리(미국) — 캐시 메모리 낭비를 4% 아래로
UC버클리 연구진은 2023년 KV 캐시를 페이지 단위로 관리하는 페이지드어텐션을 제안하고 서빙 엔진 vLLM을 공개했습니다 [1]. 기존 시스템은 캐시 메모리의 60~80%를 단편화로 낭비했는데 이를 4% 미만으로 줄였습니다 [2]. 이 기법은 이후 LLM 서빙의 사실상 표준이 됐습니다.
도입효과: 동일 지연시간 기준 처리량 2~4배(FasterTransformer·Orca 대비, SOSP 2023 논문 기준), 캐시 메모리 낭비 60~80%에서 4% 미만으로 [1][2]
케이스 2DeepSeek(중국) — 캐시를 93% 압축한 MLA
딥시크는 2024년 5월 V2 논문에서 KV 캐시를 잠재 벡터로 압축하는 MLA(Multi-head Latent Attention)를 공개했습니다 [3]. 캐시가 작아지면 같은 GPU로 더 긴 문맥과 더 많은 동시 요청을 처리할 수 있습니다 [3]. 저비용 추론 경쟁의 기술적 배경 중 하나입니다.
도입효과: KV 캐시 93.3% 감소, 최대 생성 처리량 5.76배(DeepSeek-V2 논문 기준) [3]
케이스 3Anthropic·Google·OpenAI(미국) — 프롬프트 캐싱 요금제
주요 API는 반복되는 프롬프트 앞부분의 캐시를 재사용하는 프롬프트 캐싱을 제공합니다 [4]. 앤트로픽은 캐시 읽기를 기본 입력 단가의 0.1배로 책정했고 [4], 구글 제미나이는 75% 할인 [5], OpenAI는 50% 할인을 적용합니다 [6]. 시스템 프롬프트가 긴 서비스일수록 절감 폭이 큽니다.
도입효과: 캐시 읽기 토큰 단가 앤트로픽 기본가의 0.1배(90% 인하), 구글 75%·OpenAI 50% 할인(각사 공식 문서·발표 기준) [4][5][6]
케이스 4스퀴즈비츠(한국) — 국내 스타트업의 실측 공개
AI 경량화 스타트업 스퀴즈비츠는 vLLM과 TensorRT-LLM의 KV 캐시 8비트 양자화 효과를 실측해 시리즈로 공개했습니다 [8]. 캐시 메모리를 절반으로 줄이면서 처리량 개선을 확인했습니다 [8]. 국내 서빙 현장에서도 캐시 최적화가 비용 절감의 핵심 지렛대임을 보여줍니다.
도입효과: KV 캐시 8비트 양자화 시 캐시 메모리 약 50% 절감, 디코드 중심 부하 처리량 최대 1.45배(TensorRT-LLM 실측 기준) [8]
주의할 점은?
오늘 바로 해보기
01. 개발자가 아니어도 개념 확인은 가능합니다. 긴 문서를 챗봇에 넣고 이어서 질문할 때 답변 시작이 빨라지는지 체감해 봅니다.
02. API를 쓴다면 앤트로픽 프롬프트 캐싱 문서에서 캐시 쓰기·읽기 단가 구조를 확인합니다 [4].
03. 자주 쓰는 시스템 프롬프트와 참고 문서를 프롬프트 앞부분에 고정 배치해 캐시 적중률을 높입니다 [4].
04. 서빙을 직접 한다면 vLLM 공식 블로그의 페이지드어텐션 그림으로 캐시 단편화 문제를 이해합니다 [2].
05. 스퀴즈비츠의 실측 시리즈로 캐시 양자화 같은 후속 최적화 기법을 살펴봅니다 [8].
한계와 진화
한계는 메모리와의 싸움입니다. 캐시 크기는 문맥 길이와 배치 크기에 비례해 커져서, 장문맥 서비스일수록 GPU 메모리가 병목이 됩니다 [1]. 캐시를 압축하는 양자화는 정확도 손실과의 균형 문제를 남깁니다 [8]. 캐시 재사용을 전제로 한 요금 설계는 프롬프트 구조를 바꾸면 할인이 사라지는 운영상 주의점도 만듭니다 [4].
진화는 캐시 중심 아키텍처입니다. 문샷AI의 키미는 KV 캐시 중심 분리형 서빙 문케이크(Mooncake)로 유효 요청 처리량을 59~498% 늘려 USENIX FAST 25 최우수 논문상을 받았습니다 [7]. 캐시를 어디에 두고 어떻게 재사용할지(오프로딩, 캐시 인지 라우팅)가 추론 인프라의 경쟁 축이 됐고, 컨텍스트 장기화가 계속되는 한 KV 캐시 관리 기술의 중요성은 더 커질 전망입니다.
참고 자료
- Efficient Memory Management for LLM Serving with PagedAttention — 논문·ACM SOSP 2023(arXiv)·2023 — https://arxiv.org/abs/2309.06180
- vLLM: Easy, Fast, and Cheap LLM Serving with PagedAttention — 공식 블로그·vLLM(UC Berkeley)·2023 — https://vllm.ai/blog/2023-06-20-vllm
- DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model — 논문·DeepSeek(arXiv)·2024 — https://arxiv.org/abs/2405.04434
- Prompt caching — 공식 문서·Anthropic·2026 접속 — https://platform.claude.com/docs/en/build-with-claude/prompt-caching
- Gemini 2.5 Models now support implicit caching — 공식 블로그·Google·2025 — https://developers.googleblog.com/gemini-2-5-models-now-support-implicit-caching/
- Prompt Caching in the API — 공식 발표·OpenAI·2024 — https://openai.com/index/api-prompt-caching/
- Mooncake: Trading More Storage for Less Computation — 논문·USENIX FAST 25(Best Paper)·2025 — https://www.usenix.org/conference/fast25/presentation/qin
- [vLLM vs TensorRT-LLM] #8. KV Cache Quantization — 기술블로그·스퀴즈비츠(SqueezeBits)·2024 — https://blog.squeezebits.com/vllm-vs-tensorrtllm-8-kv-cache-quantization-35079
대표 출처
논문 (2023) · UC Berkeley(Kwon 외), Efficient Memory Management for LLM Serving with PagedAttention이 페이지에 대한 의견을 남겨주세요
여러분의 의견은 다음 갱신에 반영됩니다.