멀티모달란?
AI 모델 분야에서 쓰이는 용어로, 텍스트·이미지·음성·영상 같은 여러 형식(modality)을 한 모델이 함께 입력받거나 출력할 수 있도록 만든 인공지능 처리 방식입니다.
CARD NEWS · 기본
SNS·수업 자료·발표 슬라이드에 붙여 쓰기 좋은 4장 세트입니다. 각 카드는 스크린샷·다운로드해 그대로 공유하실 수 있습니다.
AI 모델 분야에서 쓰이는 용어로, 텍스트·이미지·음성·영상 같은 여러 형식(modality)을 한 모델이 함께 입력받거나 출력할 수 있도록 만든 인공지능 처리 방식입니다.
멀티모달은 글·사진·소리·영상처럼 서로 다른 형태의 정보를 한 모델이 동시에 알아듣고 답하는 방식이에요. 사진을 카톡으로 보내며 "이게 뭐야?" 한 줄만 적어도 알아서 설명해 주는 친구처럼, 텍스트와 이미지를 따로따로 묻지 않아도 한 번에 처리해 줍니다. 강의 슬라이드 PDF에 표·그래프·필기가 섞여 있어도 그대로 올려놓고 "3쪽 차트 의미가 뭐야?"라고 물어볼 수 있고, 시험 직전에는 강의 녹음 mp3를 던지면서 "30분 안에 핵심 요점 5개로 정리해 줘"라고 부탁할 수도 있어요.
**케이스 1: OpenAI GPT-4o — 실시간 음성·영상 응답** OpenAI는 2024년 5월 13일 GPT-4o를 공개하면서 오디오 입력에 평균 320ms 만에 응답한다고 발표했습니다.[1] 단일 신경망이 텍스트·오디오·이미지를 끝단까지 함께 학습한 구조 덕분에, 기존 STT → LLM → TTS 3단 파이프라인이 한 번의 추론으로 줄었습니다.[1] API 가격도 GPT-4 Turb
카드를 스크린샷하거나 브라우저 인쇄 → PDF로 저장하면 인스타·수업 자료에 바로 쓸 수 있습니다. 출처 (AI for Everyone by Percent · ai.percent.ac)만 밝히면 상업적 이용도 가능합니다.