CARD NEWS · 기본

Throughput 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 화면을 캡처하거나 브라우저의 인쇄 기능으로 PDF를 저장해 공유할 수 있습니다.

1/4
기본

Throughput란?

AI 모델 운영 분야에서 쓰이는 용어로, LLM 서비스가 단위 시간당 처리할 수 있는 토큰 양 또는 동시 요청 수를 가리키며, 보통 초당 토큰(TPS) 단위로 측정하는 성능 지표입니다.

2/4
쉬운 풀이

이렇게 이해하면 쉬워요

Throughput은 LLM(Large Language Model, 거대 언어 모델) 서비스가 1초 동안 만들어낼 수 있는 글자(토큰) 수예요. 조별 과제에서 한 명이 답을 빠르게 쓰는 것과, 팀 전체가 시간당 몇 장의 보고서를 뽑는지를 다르게 세는 것과 같은 구분입니다. 보통 초당 토큰(TPS, Tokens per Second) 단위로 재고, 같은 모델이라도 서빙 소프트웨어와 GPU 종류에 따라 100배 이상 벌어집니다.

3/4
활용 사례

누가·언제 쓰나?

케이스 1: vLLM — KV 캐시 낭비를 줄여 throughput 2~4배 UC Berkeley vLLM 팀은 SOSP 2023 논문(arXiv 2309.06180)에서 기존 서빙 시스템이 KV 캐시 메모리의 60~80%를 단편화로 낭비한다는 점을 들어, PagedAttention(가상 메모리 방식 KV 캐시 페이지화)으로 낭비를 4% 미만까지 줄였다고 보고했습니다.[2] 같은…

4/4
더 알아보기

ai.percent.ac
/word/throughput

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 캡처하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 쓸 수 있습니다. CC BY-SA 4.0에 따라 출처(AI for Everyone by Percent · ai.percent.ac)와 라이선스를 표시하면 상업적으로도 이용할 수 있습니다. 내용을 바꿨다면 그 사실을 밝히고 같은 라이선스로 공유해 주세요.