3

VLM
브이엘엠
인공지능 분야에서 쓰이는 Vision-Language Model(비전-언어 모델)의 약자로, 이미지와 텍스트를 함께 입력받아 텍스트로 답하는 멀티모달 모델입니다. 보통 이미지를 이해하는 비전 인코더, 두 표현을 정렬하는 프로젝터, 답을 생성하는 언어 모델을 이어 붙인 구조입니다. 2021년 OpenAI가 이미지-텍스트 쌍 4억 개로 학습한 CLIP으로 기반을 열었고, 2023년 GPT-4V 공개로 상용화가 본격화됐습니다. 문서 판독, 차트 해석, 화면을 보고 조작하는 에이전트의 눈 역할까지 활용 범위가 넓어지고 있습니다.
모델·서비스
Guardrails
가드레일
보안·윤리·거버넌스 분야에서 쓰이는 용어로, 모델을 다시 학습시키지 않고 입력과 출력을 실행 시점에 통제해 위험한 응답을 걸러내는 외부 안전장치입니다. 유해 주제 회피, 정해진 대화 흐름 준수, 특정 형식 강제 같은 규칙을 모델과 별개로 설정합니다. 구현은 크게 두 갈래입니다. 규칙과 대화 흐름을 코드로 짜두는 프로그래머블 레일 방식과, 입력과 출력을 안전·위험으로 분류하는 모델 기반 세이프가드 방식으로 나뉩니다. 학습 단계의 정렬과 달리 운영 중에 언제든 고쳐 쓸 수 있는 점이 특징입니다.
보안·윤리
Reranking
리랭킹
검색이 1차로 넉넉히 뽑아 온 후보 문서를, 질문과의 관련도를 더 정교하게 다시 계산해 순서를 매기는 2차 정렬 단계입니다. 보통 질문과 문서를 한 쌍으로 함께 읽는 교차 인코더(cross-encoder)를 써서, 빠르지만 거친 1차 검색의 순위를 바로잡습니다. 계산이 무거워 전체가 아니라 상위 후보 수십 개에만 적용합니다. RAG에서 상위 몇 개만 LLM에 넘길 때 정답 문서를 위로 끌어올리는 역할을 합니다.
데이터·DB
검색 · AI for Everyone