AI 트렌드

World Model

월드 모델

AI 트렌드 분야에서 쓰이는 용어로, 에이전트가 환경의 작동 방식과 미래 변화를 내부 표현으로 학습해 다음에 무슨 일이 일어날지 예측·시뮬레이션하는 모델입니다. 원류는 2018년 Ha와 Schmidhuber의 World Models 연구입니다. 이 연구는 환경의 압축된 표현을 비지도로 빠르게 학습할 수 있음을 보였습니다. 자율주행 기업 Wayve는 월드 모델을 환경과 그 미래 동역학의 표현을 학습해 주행 판단에 쓰는 것이라고 정의합니다. 최근에는 게임 환경 생성, 자율주행, 로보틱스로 응용이 넓어지고 있습니다.

쉽게 말하면?

월드 모델은 AI가 세상이 어떻게 굴러가는지 머릿속 시뮬레이터로 익혀 두는 모델이에요. 다음 순간에 무슨 일이 벌어질지 미리 예측하는 것이 핵심입니다. 운전 초보가 머릿속으로 저 차가 지금 끼어들면 어떻게 될지 미리 그려 보는 것과 비슷해요. AI도 이 내부 시뮬레이션 안에서 여러 번 연습한 뒤 실제 환경으로 옮겨 갈 수 있습니다. 요즘은 자율주행차가 다음 도로 상황을 예측하거나, 게임 같은 3D 환경을 만들어 그 안에서 로봇을 훈련시키는 데 쓰입니다.

한 줄로 비유하면?

입찰 전 시장 변화를 미리 돌려 보는 사업 시뮬레이션 모델입니다.

어디에 쓰이나?

케이스 1NVIDIA — Cosmos 월드 파운데이션 모델

NVIDIA는 2025년 1월 CES에서 피지컬 AI용 월드 파운데이션 모델 플랫폼 Cosmos를 공개했습니다 [2]. 텍스트·이미지·영상과 로봇 센서·모션 입력을 조합해 물리 기반 영상을 생성합니다 [2]. 1X·Agility·Uber·Wayve 등을 초기 도입사로 밝혔습니다 [2]. 로봇과 자율주행 학습용 데이터를 만드는 데 쓰는 사례입니다.
도입효과: 블랙웰 플랫폼으로 영상 2천만 시간을 14일에 처리·라벨 (CPU 파이프라인 3년 이상 대비) [2]

케이스 2Wayve — 자율주행 월드 모델 GAIA-1

영국 자율주행 기업 Wayve는 2023년 생성형 월드 모델 GAIA-1을 공개했습니다 [3]. 영상·텍스트·행동 입력으로 사실적인 주행 영상을 생성합니다 [3]. 공식 자료는 학습 가능한 파라미터가 90억 개를 넘고, 런던 주행 데이터 4,700시간으로 학습했다고 밝혔습니다 [3]. 자율주행이 다음 상황을 예측하도록 월드 모델을 쓴 사례입니다.
도입효과: 학습 파라미터 90억 개 이상, 주행 데이터 4,700시간 학습 (Wayve 공식, 이전 버전 10억 대비 확대) [3]

케이스 3Google DeepMind — Genie 2·3, 조작 가능한 3D 세계 생성

Google DeepMind는 2024년 12월 Genie 2를 공개했습니다 [4]. 조작 가능한 3D 환경을 끝없이 생성해 체화 에이전트를 훈련·평가하는 파운데이션 월드 모델입니다 [4]. 2025년 8월 후속 Genie 3는 실시간 상호작용을 지원했습니다 [5]. 에이전트를 가상 세계에서 훈련시키는 용도로 월드 모델을 쓴 사례입니다.
도입효과: Genie 3 실시간 24fps·720p로 수 분간 일관된 세계 유지 (Genie 2 10~20초 대비 확장) [5]

케이스 4KAIST — 안성진 교수 연구실의 월드 모델 연구 [한국]

KAIST 안성진 교수 연구실은 월드 모델 연구를 다수 발표했습니다 [8]. 대표적으로 ICLR 2025 논문 Dreamweaver는 언어 지도 없이 영상만으로 구성적 월드 모델을 학습합니다 [7]. 색·모양 같은 정적 개념과 움직임 같은 동적 개념을 재사용 가능한 개념 사전으로 묶습니다 [7]. 서로 다른 대상의 속성을 조합해 새로운 영상을 상상해 내는 구성적 상상을 목표로 합니다 [7].
도입효과: 언어 지도 없이 영상 기반 구성적 월드 모델 학습, 구성적 상상 제시 (한국연구재단 지원, 정량 벤치마크 비공개) [7]

주의할 점은?

오늘 바로 해보기
01. 월드 모델과 일반 생성 모델의 차이를 미래 예측 여부 한 줄로 구분해 적습니다.
02. Ha와 Schmidhuber의 World Models 초록을 열어, 모델이 만든 꿈속에서 에이전트를 훈련한다는 개념을 확인합니다 [1].
03. DeepMind Genie 3 데모 영상에서 생성 세계가 몇 분간 일관되게 유지되는지 봅니다 [5].
04. Wayve GAIA-1 소개에서 자율주행이 월드 모델을 어디에 쓰는지 정리합니다 [3].
05. 자사 업무 중 미래 상태 예측이 필요한 과제가 있는지 목록으로 적습니다.

월드 모델에는 아직 큰 한계가 있습니다. 생성 세계의 시간적 일관성이 짧습니다. Genie 2는 대부분 예시가 10~20초 유지에 그쳤습니다 [4]. 물리 추론도 사람에 크게 못 미칩니다. Meta는 새 물리 추론 벤치마크에서 사람이 85~95% 정확도를 보이는 반면 현재 영상 모델은 우연 수준에 가깝다고 밝혔습니다 [6]. 학습 비용도 막대합니다. V-JEPA 2는 100만 시간이 넘는 영상을 학습했고, Cosmos는 2천만 시간 규모의 영상을 큐레이션해 구축했습니다 [6][2]. 이 데이터를 CPU만으로 처리하면 3년 이상 걸린다고 NVIDIA는 밝혔습니다 [2]. 생성한 세계가 실제 물리를 얼마나 지키는지 검증하는 일도 남은 과제입니다 [6]. Wayve GAIA-1은 90억 파라미터로 4,700시간의 주행 데이터를 학습해야 했을 만큼 자원 요구가 큽니다 [3].

진화 방향은 두 갈래입니다.

  1. 실시간·장시간 상호작용 월드 모델입니다. DeepMind Genie 3는 첫 실시간 상호작용 월드 모델로 24fps·720p·수 분 일관성을 달성했습니다 [5].
  2. 피지컬 AI·로보틱스용 파운데이션 모델로의 확장입니다 [2]. 로봇 센서·모션 입력 기반 물리 영상 생성과 오픈 플랫폼화가 진행되고, 자율주행·휴머노이드 훈련 데이터 생성으로 넓어지고 있습니다 [2]. 원류인 Ha와 Schmidhuber는 이미 2018년에 모델이 만든 내부 시뮬레이션 안에서 에이전트를 훈련할 수 있음을 보였는데, 그 아이디어가 지금 로보틱스로 이어지고 있습니다 [1]. NVIDIA Cosmos는 초기 도입사로 자율주행·휴머노이드 기업들을 함께 공개하며 산업 적용을 넓히고 있습니다 [2]. 국내에서는 KAIST 안성진 교수 연구실이 트랜스포머를 대체하는 상태공간 계열과 구성적 월드 모델을 학술적으로 제시하며 흐름에 합류했습니다 [7][8]. 현재 시점에서는 실제 데이터가 부족한 로보틱스 학습의 보완재로 주목받고 있습니다.

참고 자료

  1. World Models — 학술 논문·arXiv(Ha & Schmidhuber)·2018 — https://arxiv.org/abs/1803.10122
  2. NVIDIA Launches Cosmos World Foundation Model Platform — 공식 보도자료·NVIDIA·2025 — https://nvidianews.nvidia.com/news/nvidia-launches-cosmos-world-foundation-model-platform-to-accelerate-physical-ai-development
  3. Scaling GAIA-1: 9-billion parameter generative world model for autonomous driving — 공식 블로그·Wayve·2023 — https://wayve.ai/thinking/scaling-gaia-1/
  4. Genie 2: A large-scale foundation world model — 공식 블로그·Google DeepMind·2024 — https://deepmind.google/blog/genie-2-a-large-scale-foundation-world-model/
  5. Genie 3: A new frontier for world models — 공식 블로그·Google DeepMind·2025 — https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/
  6. Introducing V-JEPA 2 world model and new benchmarks — 공식 블로그·Meta AI·2025 — https://ai.meta.com/blog/v-jepa-2-world-model-benchmarks/
  7. Dreamweaver: A Compositional World Model for Unsupervised Learning from Videos — 학술 논문·arXiv/ICLR 2025(KAIST 안성진 연구실)·2025 — https://arxiv.org/abs/2501.14174
  8. MLML Lab Publications — 대학 연구실·KAIST·2024~2025 — https://mlml.kaist.ac.kr/publications

대표 출처

Ha·Schmidhuber·NVIDIA·Wayve·DeepMind·KAIST 공식 (2018~2025) — 월드 모델 정의·사례·국내 연구