모델·서비스

VLM

브이엘엠

인공지능 분야에서 쓰이는 Vision-Language Model(비전-언어 모델)의 약자로, 이미지와 텍스트를 함께 입력받아 텍스트로 답하는 멀티모달 모델입니다. 보통 이미지를 이해하는 비전 인코더, 두 표현을 정렬하는 프로젝터, 답을 생성하는 언어 모델을 이어 붙인 구조입니다. 2021년 OpenAI가 이미지-텍스트 쌍 4억 개로 학습한 CLIP으로 기반을 열었고, 2023년 GPT-4V 공개로 상용화가 본격화됐습니다. 문서 판독, 차트 해석, 화면을 보고 조작하는 에이전트의 눈 역할까지 활용 범위가 넓어지고 있습니다.

쉽게 말하면?

브이엘엠(VLM)은 Vision-Language Model, 즉 보는 능력과 말하는 능력을 합친 AI예요. 영수증 사진을 올리면 지출 내역을 표로 정리해 주는 기능이 대표적인 예입니다. 눈(비전 인코더)이 본 것을 뇌(언어 모델)가 말로 풀어내는 구조라고 생각하면 됩니다. 요즘 챗봇이 이미지를 읽는 것처럼 보이는 이유가 이 구조 덕분입니다.

한 줄로 비유하면?

글만 읽던 비서에게 안경을 씌워, 서류 더미 속 사진과 도표까지 읽고 브리핑하게 만든 것과 같습니다.

어디에 쓰이나?

케이스 1OpenAI(미국) — 시각 입력 상용화의 기점

OpenAI는 2021년 이미지-텍스트 쌍 4억 개로 학습한 CLIP을 공개해 VLM 연구의 기반을 만들었습니다 [1]. 2023년 9월에는 GPT-4V 시스템 카드를 공개하고 ChatGPT에 이미지 입력을 배포했습니다 [2]. 시각 입력 특유의 위험을 별도 문서로 평가한 뒤 출시한 점도 특징입니다 [2].
도입효과: CLIP 제로샷 분류가 ImageNet에서 별도 학습 없이 기존 ResNet-50 지도학습 정확도와 대등(2021년 논문 기준) [1]

케이스 2네이버(한국) — 한국어 시험으로 검증한 HyperCLOVA X Vision

네이버는 2024년 8월 HyperCLOVA X에 이미지 이해를 더한 HyperCLOVA X Vision을 공개했습니다 [3]. 30개 이상의 벤치마크에서 GPT-4o 계열과 비교 평가했습니다 [3]. 2025년 4월에는 비전 이해를 갖춘 경량 모델 HyperCLOVA X SEED 3B를 상업용 오픈소스로 공개했습니다 [4].
도입효과: 한국 검정고시 객관식 1,480문항 정답률 83.8%로 GPT-4o(77.8%) 상회(2024년 8월 발표 기준) [3]

케이스 3카카오(한국) — 경량 오픈소스 멀티모달 모델

카카오는 2025년 7월 경량 멀티모달 모델 Kanana-1.5-v-3b를 Apache 2.0 라이선스로 공개했습니다 [5]. 3B 크기로 이미지 이해와 지시 이행을 수행합니다 [5]. 국산 오픈소스 VLM이 해외 개발자에게 확산된 사례이기도 합니다 [6].
도입효과: 허깅페이스 누적 다운로드 160만 회(2026년 7월 보도 기준), 지시 이행 성능 국내 공개 유사 규모 모델 대비 128% 수준(회사 발표) [5][6]

케이스 4Alibaba(중국) — 문서·에이전트로 확장한 오픈소스 VLM

알리바바는 2025년 1월 Qwen2.5-VL을 3B·7B·72B 세 크기로 공개했습니다 [7]. 1시간이 넘는 비디오 이해, 문서 구조 파싱, 화면 조작 에이전트 기능을 내세웠습니다 [7]. 오픈소스 VLM이 문서 자동화의 기본 부품이 된 흐름을 보여줍니다.
도입효과: 1시간 이상 비디오 이해 지원, 3개 크기 동시 오픈소스 공개(2025년 1월 발표 기준) [7]

주의할 점은?

오늘 바로 해보기
01. 쓰는 챗봇에 영수증이나 명함 사진을 올리고 표로 정리해 달라고 요청합니다. VLM의 기본 동작입니다.
02. 같은 이미지를 두 개 서비스에 올려 결과를 비교합니다. 모델마다 읽어내는 정보가 다른 것을 확인합니다.
03. 이미지에 없는 것을 일부러 물어봅니다. 없는 물체를 지어내는 객체 환각이 나오는지 검증합니다 [8].
04. 표·차트가 많은 회사 문서 한 쪽을 캡처해 요약을 시켜 봅니다. 문서 업무 적용 가능성을 가늠합니다.
05. 숫자가 중요한 문서라면 결과를 원본과 대조하는 검수 단계를 워크플로에 넣습니다.

한계와 진화
한계로는 객체 환각이 확인돼 있습니다. 이미지에 없는 물체를 있다고 답하는 경향으로, 이를 측정하는 POPE 벤치마크가 EMNLP 2023에서 제안됐습니다 [8]. 시각 입력은 사람 식별이나 전문 판단 요구 같은 새 위험도 함께 들여와, OpenAI는 GPT-4V 배포 전 안전 평가를 별도 문서로 공개했습니다 [2]. 저해상도 이미지·손글씨·복잡한 표에서는 인식 정확도가 떨어질 수 있어 중요 수치는 원본 대조가 안전합니다.
진화는 세 갈래입니다.

  1. 소형화입니다. 네이버 SEED 3B처럼 상업용으로 풀리는 경량 모델이 늘고 있습니다 [4].
  2. 에이전트의 눈 역할입니다. Qwen2.5-VL처럼 화면을 보고 컴퓨터·폰을 조작하는 기능이 VLM 위에 올라갑니다 [7].
  3. 국산 모델의 해외 확산입니다. 카카오 Kanana-v의 다운로드 성장처럼 오픈소스 공개가 확산 경로가 되고 있습니다 [6].

참고 자료

  1. Learning Transferable Visual Models From Natural Language Supervision(CLIP) — 논문·OpenAI(arXiv)·2021 — https://arxiv.org/abs/2103.00020
  2. GPT-4V(ision) System Card — 공식 문서·OpenAI·2023 — https://openai.com/index/gpt-4v-system-card/
  3. Naver's HyperCLOVA X Vision proves a picture is worth a thousand words — 언론 보도·KED Global·2024 — https://www.kedglobal.com/artificial-intelligence/newsView/ked202408220016
  4. AI 생태계에 씨앗을 뿌리다: 상업용 오픈소스 AI, HyperCLOVA X SEED — 공식 기술블로그·네이버 클로바·2025 — https://clova.ai/tech-blog/ai-%EC%83%9D%ED%83%9C%EA%B3%84%EC%97%90-%EC%94%A8%EC%95%97%EC%9D%84-%EB%BF%8C%EB%A6%AC%EB%8B%A4-%EC%83%81%EC%97%85%EC%9A%A9-%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4-ai-hyperclova-x-seed
  5. 카카오, 경량 멀티모달·MoE 모델 오픈소스 공개 — 공식 발표·카카오·2025 — https://www.kakaocorp.com/page/detail/11632
  6. 카카오 Kanana-v 허깅페이스 누적 다운로드 160만 보도 — 언론 보도·다음뉴스·2026 — https://v.daum.net/v/20260709163729998
  7. Qwen2.5-VL — 공식 블로그·Alibaba Qwen·2025 — https://qwenlm.github.io/blog/qwen2.5-vl/
  8. Evaluating Object Hallucination in Large Vision-Language Models(POPE) — 논문·EMNLP 2023·2023 — https://aclanthology.org/2023.emnlp-main.20/

대표 출처

논문 (2021) · OpenAI(Radford 외), Learning Transferable Visual Models From Natural Language Supervision