5

멀티모달
Multimodal
AI 모델 분야에서 쓰이는 용어로, 텍스트·이미지·음성·영상 같은 여러 형식(modality)을 한 모델이 함께 입력받거나 출력할 수 있도록 만든 인공지능 처리 방식입니다.
기본
VLM
브이엘엠
인공지능 분야에서 쓰이는 Vision-Language Model(비전-언어 모델)의 약자로, 이미지와 텍스트를 함께 입력받아 텍스트로 답하는 멀티모달 모델입니다. 보통 이미지를 이해하는 비전 인코더, 두 표현을 정렬하는 프로젝터, 답을 생성하는 언어 모델을 이어 붙인 구조입니다. 2021년 OpenAI가 이미지-텍스트 쌍 4억 개로 학습한 CLIP으로 기반을 열었고, 2023년 GPT-4V 공개로 상용화가 본격화됐습니다. 문서 판독, 차트 해석, 화면을 보고 조작하는 에이전트의 눈 역할까지 활용 범위가 넓어지고 있습니다.
모델·서비스
Qwen
큐웬
AI 모델 분야에서 중국 Alibaba가 공개한 오픈웨이트 LLM(Large Language Model, 거대 언어 모델) 시리즈로, 다국어·코딩·추론·멀티모달 기능을 갖춘 채로 가중치를 공개해 누구나 다운로드해 직접 운영할 수 있게 한 모델군입니다.
모델·서비스
Gemini 3 Pro
제미나이
AI 모델 분야에서 Google이 2025년에 공개한 Gemini 3 시리즈 플래그십 LLM(Large Language Model, 거대 언어 모델)으로, 추론·멀티모달·1M+ 컨텍스트 처리를 한 모델에 통합한 차세대 라인업입니다.
모델·서비스
GPT-5.5
지피티
AI 모델 분야에서 OpenAI가 2026년에 공개한 GPT(Generative Pre-trained Transformer, 생성형 사전 학습 변환기) 계열 5세대 후속 모델로, 추론·멀티모달·도구 호출이 통합된 플래그십 LLM입니다.
모델·서비스
검색 · AI for Everyone