CARD NEWS · 개발

KV Cache 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.

1/4
개발

KV Cache란?

LLM 추론 분야에서 쓰이는 Key-Value Cache(키-값 캐시)의 약자로, 언어 모델이 답을 생성할 때 앞 토큰들의 어텐션 계산 결과인 키와 값을 GPU 메모리에 저장해 두고 재사용하는 기법입니다. 매 토큰마다 전체 문맥을 다시 계산하는 낭비를 없애 생성 속도를 높입니다. 대신 문맥이 길어질수록 캐시가 메모리를 차지해, LLM 서빙 비용과 컨텍스트 길이 한계를 결정하는 핵심 변수가 됩니다. API 제공사의 프롬프트 캐싱 할인은 이 캐시를 재사용하는 상용화 형태입니다.

2/4
쉬운 풀이

케이브이 캐시(KV Cache)는 AI가 긴 글을 읽으며 만든 메모를 버리지 않고 쌓아 두는 임시 기억장치예

케이브이 캐시(KV Cache)는 AI가 긴 글을 읽으며 만든 메모를 버리지 않고 쌓아 두는 임시 기억장치예요. 문장을 만들 때마다 처음부터 다시 읽으면 느리니, 앞서 읽은 내용의 요점(키와 값)을 책갈피 메모로 남겨 두는 방식입니다. 메모 덕에 다음 단어 생성이 빨라지지만, 글이 길어질수록 메모 뭉치가 책상(GPU 메모리)을 가득 채우는 것이 문제입니다.

3/4
활용 사례

누가·언제 쓰나?

케이스 1: vLLM·UC버클리(미국) — 캐시 메모리 낭비를 4% 아래로 UC버클리 연구진은 2023년 KV 캐시를 페이지 단위로 관리하는 페이지드어텐션을 제안하고 서빙 엔진 vLLM을 공개했습니다 [1]. 기존 시스템은 캐시 메모리의 60~80%를 단편화로 낭비했는데 이를 4% 미만으로 줄였습니다 [2]. 이 기법은 이후 LLM 서빙의 사실상 표준이 됐습니다. 도입효과: 동일 지연시간 기

4/4
더 알아보기

ai.percent.ac
/word/kv-cache

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.