vLLM란?
LLM 추론·서빙 분야의 오픈소스 엔진으로, 같은 GPU에서 더 많은 요청을 처리하도록 메모리 관리를 최적화한 것이 핵심입니다. UC 버클리에서 시작했고, 운영체제의 가상 메모리에서 착안한 PagedAttention 기법으로 KV 캐시 낭비를 4% 미만으로 줄였습니다. 이름의 v도 가상(virtual)에서 왔습니다. 2023년 논문 기준 동급 지연시간에서 기존 서빙 시스템 대비 처리량을 2~4배 높였고, 지금은 사실상의 표준 오픈소스 추론 엔진으로 불립니다.