2건
VLM
브이엘엠
인공지능 분야에서 쓰이는 Vision-Language Model(비전-언어 모델)의 약자로, 이미지와 텍스트를 함께 입력받아 텍스트로 답하는 멀티모달 모델입니다. 보통 이미지를 이해하는 비전 인코더, 두 표현을 정렬하는 프로젝터, 답을 생성하는 언어 모델을 이어 붙인 구조입니다. 2021년 OpenAI가 이미지-텍스트 쌍 4억 개로 학습한 CLIP으로 기반을 열었고, 2023년 GPT-4V 공개로 상용화가 본격화됐습니다. 문서 판독, 차트 해석, 화면을 보고 조작하는 에이전트의 눈 역할까지 활용 범위가 넓어지고 있습니다.
모델·서비스
Vercel
버셀
Next.js를 만든 미국 회사가 운영하는 웹 배포 플랫폼으로, GitHub에 코드를 올리면 자동으로 빌드·CDN 배포까지 끝나 비전공자도 1분 안에 사이트를 띄울 수 있게 해 주는 서비스입니다.
배포·인프라