CARD NEWS · 기본

Latency 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 화면을 캡처하거나 브라우저의 인쇄 기능으로 PDF를 저장해 공유할 수 있습니다.

1/4
기본

Latency란?

AI 모델 운영 분야에서 쓰이는 용어로, 사용자가 LLM에 질문을 보낸 시점부터 첫 응답 글자가 화면에 뜨기까지 걸리는 시간(보통 ms 단위)을 가리키는 성능 지표입니다.

2/4
쉬운 풀이

이렇게 이해하면 쉬워요

Latency는 LLM(Large Language Model, 거대 언어 모델)에 질문을 보낸 순간부터 첫 글자가 화면에 뜨기까지 걸리는 시간이에요. 카톡에서 "메시지 보냄"을 누르고 상대 화면에 글자가 뜨기까지 잠깐 도는 점선 같은 구간이라고 보면 됩니다. 보통 밀리초(ms) 단위로 재고, 챗 UI에서는 1초 이내가 "즉시 답한다"고 느끼는 기준선입니다.

3/4
활용 사례

누가·언제 쓰나?

[2][9] 케이스 4: 배치 추론 — Groq·Cerebras가 보여준 처리량 극한 배치 추론(콜센터 로그 일괄 요약, 문서 임베딩 등)에서는 단건 latency 대신 초당 토큰 처리량(TPS, Tokens per Second)이 핵심 지표가 됩니다.

4/4
더 알아보기

ai.percent.ac
/word/latency

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 캡처하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 쓸 수 있습니다. CC BY-SA 4.0에 따라 출처(AI for Everyone by Percent · ai.percent.ac)와 라이선스를 표시하면 상업적으로도 이용할 수 있습니다. 내용을 바꿨다면 그 사실을 밝히고 같은 라이선스로 공유해 주세요.