vLLM
브이엘엘엠
LLM 추론·서빙 분야의 오픈소스 엔진으로, 같은 GPU에서 더 많은 요청을 처리하도록 메모리 관리를 최적화한 것이 핵심입니다. UC 버클리에서 시작했고, 운영체제의 가상 메모리에서 착안한 PagedAttention 기법으로 KV 캐시 낭비를 4% 미만으로 줄였습니다. 이름의 v도 가상(virtual)에서 왔습니다. 2023년 논문 기준 동급 지연시간에서 기존 서빙 시스템 대비 처리량을 2~4배 높였고, 지금은 사실상의 표준 오픈소스 추론 엔진으로 불립니다.
쉽게 말하면?
브이엘엘엠(vLLM)은 LLM을 '서비스'로 돌릴 때 쓰는 고성능 엔진입니다. 챗봇처럼 여러 사람의 요청이 동시에 들어오는 상황에서, GPU 메모리를 페이지 단위로 잘게 나눠 쓰는 방식으로 낭비를 줄여요. 그 덕에 같은 장비로 더 많은 사용자를 감당합니다. 혼자 쓰는 로컬 실행기 Ollama와 달리, 조직이 여러 사용자에게 모델을 서빙할 때 고르는 도구입니다.
한 줄로 비유하면?
호텔 방을 통째로 선점하지 않고 필요한 만큼 잘게 나누어 배정해 공실을 없애는 객실 관리 시스템입니다.
어디에 쓰이나?
케이스 1LMSYS — Chatbot Arena 서빙 GPU를 절반으로
vLLM은 2023년 6월 공개 시점에 이미 두 달간 LMSYS의 Chatbot Arena와 Vicuna 데모를 서빙하고 있었습니다 [1]. 일평균 3만 건, 피크 6만 건의 요청을 처리했습니다 [1]. FastChat 백엔드로 통합돼 실전 검증을 마쳤습니다 [1].
도입효과: 동일 트래픽 서빙 GPU 수 50% 절감(기존 백엔드 대비, 2023년 공개 기준) [1]
케이스 2Amazon — 쇼핑 어시스턴트 Rufus의 추론 스택
Amazon은 쇼핑 AI 어시스턴트 Rufus의 추론에 vLLM을 채택했습니다 [4]. 2024년 프라임데이에 3개 리전, Trainium·Inferentia 칩 8만 개 이상 규모로 운영했습니다 [4]. 2025년에는 vLLM을 오케스트레이터로 쓰는 멀티 노드 추론 구조로 확장했습니다 [4].
도입효과: 분당 평균 300만 토큰 처리·첫 응답 P99 지연 1초 미만(2024년 프라임데이 기준) [4]
케이스 3PyTorch Foundation·Red Hat — 표준 엔진으로 편입
vLLM은 2025년 5월 PyTorch Foundation 호스티드 프로젝트로 편입됐습니다 [5]. 같은 달 Red Hat 주도로 vLLM을 코어로 쓰는 분산 추론 프로젝트 llm-d가 출범했습니다 [6]. Google Cloud·IBM Research·NVIDIA가 창립 기여자로 참여했습니다 [6].
도입효과: GitHub 스타 4만 6,500개(2025년 5월 편입 시점)→약 8만 2,700개(2026년 7월 기준)로 증가 [3][5]
케이스 4엔씨소프트(한국) — 자체 sLLM 서빙 실측 비교
엔씨소프트 NC Research는 자체 8B 모델의 프로덕션 서빙을 위해 A30 GPU 1장에서 vLLM과 TensorRT-LLM을 실측 비교했습니다 [7]. vLLM의 핵심 기법 계열인 In-flight Batching과 Paged Attention의 효과를 수치로 확인했습니다 [7]. 다만 고부하에서 vLLM의 지연시간이 더 크게 늘어난다는 결과도 함께 공개했습니다 [7].
도입효과: 동시 사용자 64명 조건 90% 지연시간 3,800ms→1,800ms(Dynamic Batching 대비 In-flight Batching·Paged Attention 적용 시, 2024년 실측) [7]
주의할 점은?
오늘 바로 해보기
01. 공식 퀵스타트 문서에서 요구 환경(Linux, 비교적 최신 GPU)을 확인합니다. 조건이 맞으면 pip install vllm 한 줄로 설치됩니다.
02. vllm serve 명령으로 1~2B급 소형 모델을 띄워 OpenAI 호환 API 서버가 열리는 것을 확인합니다.
03. 기존 OpenAI SDK 코드에서 base_url만 바꿔 로컬 vLLM 서버로 요청을 보내 봅니다.
04. 공식 공개 블로그에서 PagedAttention 설명을 읽고 '메모리 낭비 60~80%→4% 미만' 수치의 의미를 정리합니다 [1].
05. 도입 검토라면 엔씨소프트처럼 자사 모델·트래픽 조건에서 후보 엔진을 실측 비교하는 계획을 세웁니다 [7].
한계와 진화
한계는 진입 장벽과 운영 난도입니다. 공식 퀵스타트 기준 실행 환경이 Linux와 최신 세대 GPU로 제한돼, 일반 PC에서 가볍게 쓰는 용도와는 거리가 있습니다. 기능이 빠르게 쌓이면서 초기 아키텍처(V0)는 조합 복잡성과 CPU 오버헤드 문제를 안았고, 개발팀 스스로 근본 재설계가 필요했다고 인정했습니다 [8]. 엔진 선택도 만능이 아닙니다. 엔씨소프트 실측에서는 트래픽이 몰릴 때 vLLM의 상위 지연시간이 경쟁 엔진보다 크게 늘어, 모델·환경별 실측 후 선택하라는 결론이 나왔습니다 [7].
진화의 축은 재설계와 생태계입니다. 2025년 1월 공개된 V1 엔진은 코어를 다시 설계해 V0 대비 처리량을 최대 1.7배 올렸고, 같은 해 10월 릴리스에서 V0를 완전히 걷어냈습니다 [8]. 거버넌스는 PyTorch Foundation으로 이관됐고 [5], Red Hat 주도의 llm-d처럼 vLLM을 코어로 쓰는 분산 추론 프로젝트가 출범하며 [6] 쿠버네티스 규모의 서빙 표준으로 확장되고 있습니다. Red Hat은 vLLM을 '사실상의 표준 오픈소스 추론 서버'로 규정했습니다 [6].
참고 자료
- vLLM: Easy, Fast, and Cheap LLM Serving with PagedAttention — 공식 블로그·vLLM 팀(UC Berkeley)·2023 — https://blog.vllm.ai/2023/06/20/vllm.html
- Efficient Memory Management for Large Language Model Serving with PagedAttention — arXiv 논문(SOSP 2023)·Kwon 외·2023 — https://arxiv.org/abs/2309.06180
- vllm-project/vllm — GitHub·vLLM Project·2023~2026 — https://github.com/vllm-project/vllm
- Scaling Rufus with over 80,000 AWS Inferentia and AWS Trainium chips — 공식 기술블로그·AWS·2024 — https://aws.amazon.com/blogs/machine-learning/scaling-rufus-the-amazon-generative-ai-powered-conversational-shopping-assistant-with-over-80000-aws-inferentia-and-aws-trainium-chips-for-prime-day
- PyTorch Foundation Welcomes vLLM as a Hosted Project — 공식 블로그·PyTorch Foundation·2025 — https://pytorch.org/blog/pytorch-foundation-welcomes-vllm/
- Red Hat Launches the llm-d Community — 보도자료·Red Hat·2025 — https://www.redhat.com/en/about/press-releases/red-hat-launches-llm-d-community-powering-distributed-gen-ai-inference-scale
- TensorRT-LLM 및 vLLM을 활용한 sLLM 추론 최적화 — 공식 기술블로그·엔씨소프트 NC Research·2024 — https://ncsoft.github.io/ncresearch/512f982a1564b5441d432935a7098146226e20b7
- vLLM V1: A Major Upgrade to vLLM's Core Architecture — 공식 블로그·vLLM 팀·2025 — https://vllm.ai/blog/2025-01-27-v1-alpha-release
대표 출처
arXiv 논문 (2023) · UC Berkeley(Kwon 외), Efficient Memory Management for LLM Serving with PagedAttention이 페이지에 대한 의견을 남겨주세요
여러분의 의견은 다음 갱신에 반영됩니다.