CARD NEWS · 기본

Throughput 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.

1/4
기본

Throughput란?

AI 모델 운영 분야에서 쓰이는 용어로, LLM 서비스가 단위 시간당 처리할 수 있는 토큰 양 또는 동시 요청 수를 가리키며, 보통 초당 토큰(TPS) 단위로 측정하는 성능 지표입니다.

2/4
쉬운 풀이

Throughput은 LLM(Large Language Model, 거대 언어 모델) 서비스가 1초 동안 만

Throughput은 LLM(Large Language Model, 거대 언어 모델) 서비스가 1초 동안 만들어낼 수 있는 글자(토큰) 수예요. 조별 과제에서 한 명이 답을 빠르게 쓰는 것과, 팀 전체가 시간당 몇 장의 보고서를 뽑는지를 다르게 세는 것과 같은 구분입니다. 보통 초당 토큰(TPS, Tokens per Second) 단위로 재고, 같은 모델이라도 서빙 소프트웨어와 GPU 종류에 따라 100배 이상 벌어집니다. 콜센터 로그 요약처럼 한꺼번에 많이 처리해야 하는 작업에서 운영팀이 가장 먼저 보는 숫자입니다.

3/4
활용 사례

누가·언제 쓰나?

**케이스 1: vLLM — KV 캐시 낭비를 줄여 throughput 2~4배** UC Berkeley vLLM 팀은 SOSP 2023 논문(arXiv 2309.06180)에서 기존 서빙 시스템이 KV 캐시 메모리의 60~80%를 단편화로 낭비한다는 점을 들어, PagedAttention(가상 메모리 방식 KV 캐시 페이지화)으로 낭비를 4% 미만까지 줄였다고 보고했습니다.[2] 같은 la

4/4
더 알아보기

ai.percent.ac
/word/throughput

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.