CARD NEWS · 모델·서비스

VLM 4장 카드뉴스

SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.

1/4
모델·서비스

VLM란?

인공지능 분야에서 쓰이는 Vision-Language Model(비전-언어 모델)의 약자로, 이미지와 텍스트를 함께 입력받아 텍스트로 답하는 멀티모달 모델입니다. 보통 이미지를 이해하는 비전 인코더, 두 표현을 정렬하는 프로젝터, 답을 생성하는 언어 모델을 이어 붙인 구조입니다. 2021년 OpenAI가 이미지-텍스트 쌍 4억 개로 학습한 CLIP으로 기반을 열었고, 2023년 GPT-4V 공개로 상용화가 본격화됐습니다. 문서 판독, 차트 해석, 화면을 보고 조작하는 에이전트의 눈 역할까지 활용 범위가 넓어지고 있습니다.

2/4
쉬운 풀이

브이엘엠(VLM)은 Vision-Language Model, 즉 보는 능력과 말하는 능력을 합친 AI예요

브이엘엠(VLM)은 Vision-Language Model, 즉 보는 능력과 말하는 능력을 합친 AI예요. 영수증 사진을 올리면 지출 내역을 표로 정리해 주는 기능이 대표적인 예입니다. 눈(비전 인코더)이 본 것을 뇌(언어 모델)가 말로 풀어내는 구조라고 생각하면 됩니다. 요즘 챗봇이 이미지를 읽는 것처럼 보이는 이유가 이 구조 덕분입니다.

3/4
활용 사례

누가·언제 쓰나?

케이스 1: OpenAI(미국) — 시각 입력 상용화의 기점 OpenAI는 2021년 이미지-텍스트 쌍 4억 개로 학습한 CLIP을 공개해 VLM 연구의 기반을 만들었습니다 [1]. 2023년 9월에는 GPT-4V 시스템 카드를 공개하고 ChatGPT에 이미지 입력을 배포했습니다 [2]. 시각 입력 특유의 위험을 별도 문서로 평가한 뒤 출시한 점도 특징입니다 [2]. 도입효과: CLIP 제로

4/4
더 알아보기

ai.percent.ac
/word/vlm

AI for Everyone by Percent · CC BY-SA 4.0
← 원문 페이지

카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.