TL;DR: 월드 모델(World Models) 이야기를 많이 들으시겠죠? 아주 간단히 이야기하자면, 월드 모델ㄹ은 ‘세상이 어떻게 돌아가는지를 학습해서 다음에 어떤 일이 벌어질지 미리 그릴 줄 아는 AI’라고 하면 될 것 같습니다.
월드 모델을 구분하는 방법도 여러가지 있겠지만, ‘다음 순간을 예측하기 위해서 현재의 상황을 어떻게 기억해 두느냐’에 따라서 구분해 보는게 좋다고 생각합니다. 다음의 장면을 ‘그림’으로 그려두거나, ‘숫자’로 압축해 두거나, ‘객체와 공간의 구조’로 적어두거나 하는 세 가지 정도의 방법이 있는 것 같습니다. ‘그림’으로 그려두는 쪽은 ‘눈으로 확인할 수 있게 해 주는 시뮬레이션’ 영역에, ‘숫자’로 압축하는 쪽은 ‘빠른 예측이나 계획’ 업무에, ‘객체와 공간의 구조’로 적어두는 쪽은 ‘기하와 물리적인 관계가 중요한 작업’에 잘 맞는다는 것, 상식적으로 납득할 수 있겠죠.
AI는 이미 텍스트, 코드, 이미지라는 모달리티를 거쳐서 이제 너무나 빠르게 오디오와 비디오 모달리티를 통해서 우리의 일상 생활과 업무에 빼놓을 수 없는 도구가 되어가고 있습니다.
그렇기는 하지만, 실제 우리가 진짜 일하는 학교든, 사무실이든, 공장 같은 ‘물리적인 세계’로 넘어가면, 아무리 좋은 추론 모델이나 개인 비서 에이전트든, 이미지나 영상 처리 서비스라 하더라도, 막상 쓸만한 뭔가 있느냐 생각을 하게 되죠 - ‘물리적인 실제 세계에서 바로 다음 순간에 무슨 일이 벌어질 것인가 믿을 만하게 예측할 수 있느냐’, 바로 이 지점이 현재 AI의 아주 큰 약점이거든요.
'월드 모델(World Models)'은 ‘세계가 시간의 흐름에 따라 어떻게 변해가는지’, 그리고 ‘에이전트가 어떤 행동을 했다고 했을 때 그 때문에 무슨 일이 벌어질 수 있는지’를 AI가 이해하게끔 해 보려는 시도입니다. 즉, 로봇이 물건을 밀었을 때 그게 주르륵 미끄러지면서 움직일지 아니면 넘어질지, 이런 걸 미리 가늠해 볼 수 있게 해주는 거죠.
제가 생각하는, 현재 월드 모델을 둘러싼 문제 중에 하나는, 대다수의 사람들이 이해하기 쉽게 받아들일 수 있는 명확한 정의가 아직 없는 것 아니냐 하는 겁니다 - ‘시뮬레이터, ‘비디오 생성기(Video Generator)’ 같은 것들부터, 픽셀 대신 ‘압축된 표현 (Representation)’을 다루는 JEPA 같은 모델까지, 서로 꽤 다른 방법론들이 전부 ‘월드 모델’이라는 하나의 이름 아래 이야기되고 있으니까요.
물론, 이 분야를 잘 체계적으로 정리해 보려는 연구도 물론 있지만 - 이 글 끝에 참고자료로 링크를 달아두겠습니다 - 꽤 많은 범주들이 서로 크게 겹치는게 현실입니다.
그런 사이에도, 물론 소위 ‘월드 모델’이라고 하는 모델, 제품, 서비스 등 수많은 것들이 꾸준히 등장하고 있습니다.
지난 9월 1일에는 World Labs가 Atlas를, 그로부터 2주 뒤인 15일엔 Odyssey가 Odyssey-3를 공개했죠. 그런데 이것들을 살펴 본다고 해서 ‘월드 모델이 뭐냐’라는 걸 더 뚜렷하게 이해할 수 있느냐 하면 그렇지도 않습니다. 한쪽은 ‘사진 두세 장으로 실제 공간을 복원하는 모델’이고 다른 쪽은 ‘로봇 팔과 드론을 움직이겠다는 모델’인데, 둘 다 '자기회귀 디퓨전 트랜스포머(Autoregressive Diffusion Transformer)’라고 소개하고 있거든요.
또, 그러던 중에 9월 28일에는 리사 수의 AMD가 페이페이 리의 World Labs를 82억 달러에 인수한다는 발표가 나왔습니다. 창업한지 2년 차에 그때까지 받은 누적 투자액이 12억 달러 정도였던 회사를 반도체 기업이 통째로 데려가면서, 창업자 페이페이 리를 최고과학자 자리에 앉히기로 한 겁니다. 이건, ‘월드 모델’이 이제 하나의 연구 주제가 아니라 ‘인프라 전략의 일부’로서 다뤄지기 시작했다는 신호이기도 합니다.
이 반대편엔, 얀 르쿤 박사의 AMI Labs가 있습니다. 올해 3월 10억 3천만 달러를 모으고도 ‘우리는 제품이 아니라 기초 연구에서 출발하겠다’고 했었는데요. 그 때 이 회사의 CEO 알렉상드르 르브룅이 “지금부터 반년만 지나면 VC들로부터 투자를 받으려고 너도나도 ‘내가 월드 모델’이라는 주장을 할 것이다”라고 했었는데, 말 그대로 딱 반년이 지난 지금, 정확히 그런 상황인 것 같습니다.
그렇다면, 지금 이 시점에 필요한 건 뉴스 하나 더 전달하고 읽는 것보다, ‘월드 모델’이라는 이름으로 나오는 수많은 소식을 갈라서 읽고 이해할 수 있는 ‘프레임’이겠죠.
‘월드 모델’이라고 부르는 이것들은, 대체 어떻게 만들어지는 걸까요?
오늘 이 글에서는, 구글 딥마인드의 Dreamer 4와 Genie 3에서 출발해서, 메타의 JEPA, 엔비디아의 Cosmos-Predict2.5, 그리고 World Labs의 Atlas까지 하나씩 따라가 보고, 그 다음엔 이런 아이디어들이 실제 제품과 현장에서는 어떤 모습으로 나타날 수 있을지 살펴보려고 합니다 - 자율주행 시뮬레이션에 쓰이는 웨이모(Waymo)의 월드 모델, 마인크래프트 안에서 연습하는 에이전트들, 그리고 로보틱스를 위한 '객체 중심 모델' 같은 것들 말이죠.
이렇게, 생김새도 목적도 제각각인 방법론들을, 비교적 한 눈에 들어오면서 또 실제로 써먹는데 도움이 될 수 있게 설명해 보려고 합니다. 그래서, 각각의 접근방법이 뭘 하려고 하는 거고, 뭘 할 수 있고, 모자란 부분이 뭔지, 또 지금 만들고 계신 서비스나 제품에 어떤 게 맞을지 직접 판단하시는데 도움이 될 수 있게끔요:
월드 모델이 다루는 것, 결국 '세계가 어떻게 변해가는가'
월드 모델을 어떻게 나눌 것인가로 바로 들어가기 전에, 다시 한 번 이것들이 공통적으로 어떤 패턴을 갖고 어떤 기능을 하는지부터 짚고 가는 게 좋겠습니다.
월드 모델은, 세계, 그리고 그 세계를 움직이는 규칙과 맞물려서 돌아갑니다.
생각해 보면, ‘세계’는 어느 한 상태에 오래 머물러 있질 않죠 - 시간에 따라 변해가는 상태들의 연속이니까요. 역학의 눈으로 보면 물체는 멈춰 있거나 움직이고 있는데, 이 과정을 이를테면 1초에 한 장씩 찍은 스냅숏이 줄줄이 이어지는 장면으로 상상해 볼 수 있습니다. 매 단계마다 그 물체의 새로운 상태가 하나씩 생겨나는 거죠. 과학 쪽에서 생각해 봐도 마찬가지입니다. 화학물질은 반응을 일으키면서 자기의 상태를 바꾸고, 세포도 변하고, 생명 시스템도 주변 환경에 끊임없이 반응하니까요. 이게 우리가 사는 '변화하는 물리 세계'입니다. 흥미롭게도, 디지털 세계에서도 상태가 하나씩 바뀌어 가기는 마찬가지예요 - 코드를 실행하기 전과 후에, 또 한 줄 한 줄 넘어갈 때마다 시스템의 상태가 달라지는 것처럼 말이죠.
'월드 모델'은 바로 이 전이(Transition) 뒤에 숨어 있는 규칙을 배우려고 하는 겁니다. ‘지금 세계가 어떻게 보이는지’만이 아니라, '다음에 무슨 일이 일어날 수 있고 또 왜 그런지'까지요.
이 규칙이 어디서 나오는지는 환경에 따라 다릅니다. 물리학일 수도 있고, 화학이나 생물학, 사람의 행동, 코딩일 수도 있고, 이 전부가 한꺼번에 얽혀 있기도 하죠. 하지만 전체적인 흐름은 어느 쪽이든 똑같습니다:
세계에는 '상태'가 있습니다. 바로 그 순간에 무엇이 어디에 어떤 모습으로 있는지, 다음에 벌어질 일을 결정하는 조건 전부를 말하죠.
에이전트가 보는 건 그중 일부, '관측(Observation)'입니다. 카메라 이미지나 센서 값처럼 상태의 한 단면만 담긴 정보인 거죠.
월드 모델은 이 관측만으로 지금 상태가 어떤지 추정하고, 또 그게 어떻게 변해갈지 내다봅니다.
에이전트는 그 예측을 바탕으로 행동을 합니다.
그 행동이 물리 법칙에 따라 세계를 바꿔놓으면, 새로운 상태가 만들어지고 에이전트는 그걸 다시 관측하게 됩니다 - 그렇게 두 번째 줄로 돌아가는 거죠.
다시 말해서, 월드 모델이 하려는 일은 ‘세계가 어떻게 변해가는지를 알아내고 그걸로 앞일을 내다보는’ 겁니다. 픽셀의 더미 속에 묻혀 있는 방대한 시각적·물리적 경험을, 훨씬 작고 쓸모 있는 형태로 추려내는 일이죠 - 어디부터 어디까지가 한 덩어리의 물체인지, 그게 어떻게 움직이는지, 어떤 일이 어떤 결과로 이어지는지, 또 어떤 일은 애초에 일어날 수 없는지를요.
이 숙제를 어떻게 풀 것인가를 두고, 페이페이 리 박사가 자신의 Substack 글에서 정리한 구분이 하나 있습니다. 월드 모델이 하는 일을 크게 세 갈래로 나눠 본 건데요:
렌더(Render), 그러니까 '세계가 어떻게 보이는지'를 그려내는 일입니다. 비디오 생성 모델이 여기 들어가는데요, 다만 이렇게 그려낸 그림은 겉보기엔 그럴듯하면서도, 정작 구조가 맞지 않거나 물리 법칙을 어기고 있을 수 있습니다.
시뮬레이트(Simulate), '세계가 실제로 어떻게 생겼고 또 어떻게 움직이는지'를 표현하는 일이죠. 기하와 물리, 움직임이 전부 여기 들어갑니다. 로봇을 훈련시키거나, 자율주행차를 테스트하거나, 건물을 설계하는 데 쓸 수 있고요.
플랜(Plan), '그래서 어떤 행동을 할 것인가'를 정하는 일입니다. 모델이 지금 보고 있는 것과 주어진 목표, 이 둘을 놓고 판단하는 거죠.
이 셋 중에서 나머지 둘을 이어주는 건, '시뮬레이션'입니다.
어떤 모델이 물체의 생김새와 물리적인 성질, 그리고 힘을 받으면 어떻게 되는지까지 이해하고 있다고 해 보죠. 그렇다면 그 물체를 다른 각도에서 보여줄 수도 있어야 하고, 또 움직였을 때 무슨 일이 벌어질지 내다볼 수도 있어야 하고, 로봇이 그걸 어떻게 다뤄야 할지 계획할 수도 있어야 합니다.
월드 모델이 갖춰야 할 핵심적 속성
이런 일을 해내려면 월드 모델에게 다음 세 가지의 속성이 필요합니다. 앞에서 본 것처럼 에이전트에게 들어오는 건 상태의 한 단면 뿐이고, 그마저도 여러 갈래로 제각각 들어오기 때문이죠:
옴니모달(Omnimodal)이어야 합니다. 에이전트가 세계를 읽어들이는 통로는 한 가지가 아니죠. 카메라로 보고, 마이크로 듣고, 관절의 각도나 힘을 재는 센서가 따로 있고, 사람이 내리는 지시는 또 언어로 들어옵니다. 그런데 이것들은 서로 전혀 다른 생김새의 데이터예요. 픽셀 격자, 파형, 숫자 몇 개, 문장. 월드 모델은 이 제각각인 것들을 같은 장면에 대한 설명으로 읽어내고 하나로 엮을 수 있어야 합니다. 소리로 들린 '쿵' 하는 충격과 화면에서 물체가 흔들린 장면이 같은 사건이라는 걸 알아야 한다는 거죠.
비동기적(Asynchronous)이어야 합니다. 카메라는 1초에 서른 장을 보내는데 관절 센서는 수백 번씩 값을 올리고, 사람의 지시는 몇 분에 한 번 들어올 수도 있습니다. 게다가 신호가 도착하는 데 걸리는 시간도 제각각이죠. 이걸 전부 가지런히 맞춰놓고 한 묶음씩 처리하겠다고 하면, 가장 느린 신호가 전체의 속도를 끌어내립니다. 그러니 월드 모델은 들어오는 대로 받아 처리하면서, 아직 오지 않은 정보가 있어도 지금까지 들어온 것만으로 상태를 갱신해 나가야 합니다.
국소적(Local)입니다. 세계 전체를 내려다보는 시점 같은 건 에이전트에게 주어지지 않습니다. 로봇은 자기 카메라에 잡히는 범위만 보고, 모퉁이 너머나 자기 등 뒤에서 벌어지는 일은 알지 못하죠. 그러니 월드 모델은 '지금 보이는 것'에서 출발해 보이지 않는 부분까지 미루어 짐작해야 합니다. 방금 전까지 보이던 물체가 가려졌다고 해서 사라진 게 아니라는 것, 바로 이런 걸 알아야 한다는 뜻이에요.
지금은, 이 세 갈래의 일을 서로 다른 월드 모델이 나눠서 맡고 있습니다. 렌더러는 이미 널리 쓰는 반면, 시뮬레이터와 플래너는 아직 갈 길이 멉니다. 장기적인 목표라면 이 셋을 하나의 모델로 합치는 것이겠죠 - 세계를 만들어내고, 그걸 정확하게 시뮬레이션하면서, 동시에 그 안에서 행동까지 하는 모델이요.
그렇다면 그런 모델은 어떻게 만들 수 있을까요?
유형별로 월드 모델이 어떤 원리로 작동하는지부터 하나씩 풀어보겠습니다.
월드 모델 아키텍처, AI는 세계를 어떻게 표현하고 예측하는가
월드 모델은 지금 상황이 어떤지를 나름의 방식으로 표현할 수 있어야 하고, 또 그게 다음에 어떻게 될지도 예측할 수 있어야 합니다. 에이전트가 쓰는 월드 모델이라면 여기에 하나가 더 붙죠. 자기가 할 행동까지 넣어서 따져봐야 하니까요.
그런데 월드 모델을 가르는 기준으로 다들 쓰는 분류 체계는 아직 없습니다. 어느 각도에서 나눠 봐도 한 모델이 여러 칸에 걸쳐버리거든요.
그래도 제가 보기엔, 기준을 하나로 좁히면 꽤 정리가 되는 것 같습니다. 모델이 다음을 예측하려고 지금 상황을 무엇으로 기억해 두느냐 - 그려둔 장면인가, 압축한 숫자인가, 아니면 객체와 공간의 명시적인 구조인가 하는 거죠.
하나씩 보겠습니다:
그려둔 장면 - 모델이 다음에 보일 장면을 직접 그려내고, 그 그림을 발판 삼아 한 칸씩 앞으로 나아가는 방식입니다. 다음 이미지일 수도, 비디오의 한 프레임일 수도, 토큰의 연속일 수도 있고요. 사람의 눈에 들어올 장면을 그대로 그려내서 미래를 보여주는 겁니다.
압축한 숫자 - 장면을 통째로 그려내는 대신, 지금 세계에서 중요한 정보만 골라 내부 표현으로 압축해 두고 그 표현이 어떻게 변해갈지를 예측하는 방식입니다. 이렇게 압축된 상태는 모델에게는 의미가 있지만, 사람이 들여다봐서 무슨 뜻인지 알아볼 수 있다는 보장은 없습니다.
명시적인 구조 - 모델이 세계를 알아볼 수 있는 개체와 그 사이의 관계로 표현하는 방식이죠. 어떤 객체가 있고, 그 객체의 성질은 무엇이고, 어디에 어떤 형태로 놓여 있고, 또 서로 어떻게 맞물리는지를 적어두는 겁니다. 세계가 변해가는 동안에도 이 구조를 그대로 가지고 갑니다.

월드 모델에 대한 세 가지 접근 방법론. Image Credit: 튜링포스트
이 기준으로 보면 큰 갈래는 셋이죠. 하지만 실제로는 그 세 갈래 안에서 총 일곱 가지의 흐름이 나온다고 볼 수 있습니다:
장면을 그려두는 갈래에서는 ‘그리는 방법’으로 차이가 납니다. 앞 장면을 보고 다음 조각을 하나씩 이어 붙이는 방법이 있고, 지저분한 노이즈에서 시작해서 점점 선명하게 다듬어 가는 방법이 있죠.
구조로 적어두는 접근 방법에서는 무엇을 적을지 결정해야 하는데, 공간을 칸칸이 쪼개서 적는 쪽과 물건을 하나씩 세어서 적는 쪽으로 갈립니다.
압축해 두는 방법으로 접근한다면 그 압축한 걸 어디에 쓸지 결정해야 하는데, 쓰임새는 셋입니다. 압축한 상태에서 원래 장면을 다시 그려내야 하는 쪽이 있고, 그럴 것 없이 지금 무슨 일이 벌어지는지만 알면 되는 쪽이 있고, 아예 어떤 행동이 이득인지만 따지면 되는 쪽이 있죠. 쓰임새가 달라지면 무엇을 남기고 무엇을 버릴지가 달라집니다. 장면을 되살려야 한다면 지워도 되는 게 거의 없지만, 이득만 따질 거라면 압축한 결과가 실제 장면과 전혀 닮지 않아도 그만이니까요.

일곱가지로 구분한 월드 모델의 아키텍처. Image Credit: 튜링포스트
물론, 이 세 갈래의 경계가 칼로 자른 듯 뚜렷한 건 아닙니다. 뒤에서 보겠지만 World Labs의 Atlas는 다음 장면을 그려내면서 그 작업을 공간 좌표 위에서 하기 때문에 첫 번째와 세 번째에 동시에 걸쳐 있고요. Dreamer도 압축한 상태로 상상을 하면서 필요하면 그걸 장면으로 되살려낼 수 있으니 어느 한쪽이라고 못 박기 어렵습니다. 그러니 어느 칸에 넣을지를 따지기보다, 어느 쪽에 가까운 모델인지를 가늠하는 용도로 보시면 되겠습니다.
그럼 이제 유형별로 하나씩 보겠습니다.
'장면'을 그려두는 월드 모델: '다음 프레임엔 무슨 일이 일어날까'
이 계열의 모델은, 환경이 변해갈 때 에이전트가 보게 될 ‘장면’을 예측하는데요, 예측한 결과가 이미지나 비디오로 나오니까 사람이 눈으로 직접 확인할 수 있고 그래서 학습으로 만들어낸 시뮬레이터로 쓰기에 좋습니다.
기본적인 흐름은 '과거에 본 장면 + 조건으로 넣어주는 정보 → 앞으로 보게 될 장면'인데, 여기서 조건으로 넣어주는 정보에는 에이전트가 하려는 행동이나 카메라가 움직이는 궤적(Trajectory), 또는 말로 내리는 지시 같은 것들이 들어갈 수 있고요.
이 계열에는 전형적인 두 가지의 방식이 있습니다.
비주얼 토큰 모델
이 유형은 대체로 이런 순서로 작동합니다:
먼저 토크나이저가 이미지를 비주얼 코드 묶음으로 압축하고, 그 다음 시퀀스 모델이 그동안의 상호작용 이력을 보면서 다음에 올 코드를 예측하고, 마지막으로 디코더가 그 코드를 다시 이미지로 되돌리는 겁니다.
물론 실제 사용하는 모델들은 이 뼈대를 그대로 쓰지는 않고 각각의 니즈에 맞게 손을 봅니다.
여기서 이야기할 만한 사례가 둘 있는데, IRIS(Imagination with auto-Regression over an Inner Speech)와 구글 딥마인드의 Dreamer 4입니다. 둘 다 자기 안에 있는 월드 모델 속에서 게임이 돌아가는 원리를 배우는 강화학습 에이전트인데, IRIS는 아타리(Atari)를, Dreamer는 마인크래프트를 대상으로 합니다. 먼저 행동을 할 때마다 게임이 어떻게 변하는지 예측하는 법을 익히고, 그 다음 에이전트가 이 ‘상상된’ 게임 속에서 연습하게 하는 방식입니다.
IRIS는 프레임을 띄엄띄엄 끊어진 비주얼 토큰으로 표현해 두고, GPT를 닮은 트랜스포머로 하나씩 이어가면서 다음 토큰을 예측합니다.
Dreamer 4는 같은 뼈대에서 출발은 하는데, 두 군데를 다르게 설계했습니다.
하나는 인과적 비디오 토크나이저(Causal Video Tokenizer)와 상호작용형 동역학 트랜스포머(Interactive Dynamics Transformer)를 붙여놓은 겁니다. 앞서 본 IRIS는 프레임을 띄엄띄엄 끊어진 토큰으로 바꿔놓지만, Dreamer 4의 토크나이저는 끊김 없는 잠재 상태(Latent State)로 압축합니다. 토큰처럼 칸칸이 나뉘지 않으니 미세한 변화까지 담을 수 있는 거죠. 여기에 '인과적'이라는 말이 붙은 건 과거 프레임만 보고 압축한다는 뜻인데, 미래를 미리 훔쳐보지 않아야 실시간으로 돌릴 수 있으니까요. 그래서 사용자가 마우스를 움직이거나 키를 누르면, 트랜스포머가 그 행동을 받아 다음에 무엇이 바뀌는지 바로 예측해 냅니다.
다른 하나는 숏컷 포싱(Shortcut Forcing)이라는 학습 목표입니다. 디퓨전 계열 모델은 보통 노이즈에서 출발해 수십 번을 다듬어야 장면 하나가 나오는데, 이러면 한 프레임 만드는 데 시간이 너무 걸려서 게임처럼 실시간으로 반응해야 하는 일에는 못 씁니다. 숏컷 포싱은 그 횟수를 네 번까지 줄이는 훈련 방식이고, 덕분에 GPU 한 장으로도 실시간 상호작용이 가능해졌습니다.
이 둘이 맞물리면서 Dreamer 4는 꽤 상징적인 기록을 하나 세웠는데요. 훈련하는 동안 실제 게임에 한 번도 접속하지 않고, 오직 자기가 상상한 세계 안에서만 연습해서 다이아몬드를 캐냈습니다. 마인크래프트에서 다이아몬드를 캐려면 나무를 베고 도구를 만들고 땅을 파 내려가는 과정을 거쳐야 해서 2만 번이 넘는 행동이 필요한데, 그 긴 과정을 상상만으로 끝까지 해낸 거죠.

Image Credit: Dreamer 4 논문
다만 이 유형에는 꽤 심각한 병목이 하나 있는데, 바로 토크나이저입니다. 이미지를 압축하는 과정에서 작지만 결정적인 물체나 그 움직임을 흘려버리면, 모델은 그 물체를 제대로 예측하는 데 필요한 정보를 영영 받지 못하게 되니까요. 압축 단계에서 사라진 건 뒤에 아무리 좋은 트랜스포머를 붙여도 되살릴 방법이 없습니다.
디퓨전과 플로우 모델
이 유형은 장면을 한 번에 완성하지 않고 여러 차례 다듬어 가면서 만들어냅니다.
디퓨전(Diffusion)의 발상은 이렇습니다. 깨끗한 이미지에 노이즈를 조금씩 덧씌우다 보면 결국 아무것도 알아볼 수 없는 지저분한 화면만 남는데, 이 과정 자체는 만들기가 아주 쉽습니다. 그냥 잡티를 뿌리면 되니까요. 그래서 모델에게는 이걸 거꾸로 되돌리는 법만 가르칩니다. 지저분해진 화면을 보고 '바로 직전에는 이것보다 조금 덜 지저분했겠지'를 알아맞히게 하는 거죠.
재미있는 건 이렇게 배운 걸 실제로 쓸 때입니다. 이번엔 원본 이미지 없이, 그냥 아무 의미 없는 노이즈를 하나 만들어서 모델에게 넘깁니다. 모델은 그게 무엇을 지저분하게 만든 결과인지 모르면서도 배운 대로 한 겹을 걷어내고, 그 결과를 다시 받아 또 한 겹을 걷어냅니다. 이걸 수십 번 반복하면 원래 아무것도 없던 자리에서 장면 하나가 떠오르는 거죠.
플로우(Flow) 기반 방법은 조금 다르게 접근합니다. 노이즈에서 실제 이미지로 가는 길을 미리 하나 정해놓고, 모델에게는 그 길 위 어느 지점에서든 '여기서 어느 쪽으로 가야 하나'만 배우게 하는 거죠. 디퓨전이 밟아가는 경로는 굽어 있어서 잘게 쪼개 가야 하지만, 길을 직선으로 잡아두면 속도가 일정해서 몇 걸음 크게 뛰어도 목적지에 닿습니다. 그래서 디퓨전이 보통 수십 단계를 쓰는 작업을 몇 단계 만에 끝낼 수 있고요. 참고로 이 둘은 서로 대치하는 방법은 아닌데, 디퓨전은 플로우 매칭이라는 더 넓은 틀 안에서 경로 하나를 고른 경우에 해당하고 그중 직선을 고른 것이 뒤에 나올 Atlas가 쓰는 정류 플로우(Rectified Flow)입니다.
그리고 둘 다 이 작업을 픽셀 위에서 직접 하지 않고 ‘압축된 시각 표현’ 위에서 할 수 있는데요, 1920×1080짜리 화면을 통째로 다듬는 것보다 훨씬 적은 계산으로 끝나니까요.
여기서 한 가지 눈여겨볼 점이 있습니다. 출발점으로 쓰는 노이즈가 달라지면 같은 조건을 주더라도 다른 결과가 나온다는 건데요, 컵을 미는 장면에서 어떤 때는 컵이 미끄러지고 어떤 때는 넘어지는 식이죠. 결함처럼 보일 수 있지만 오히려 반대입니다. 현실에서도 다음에 벌어질 일이 하나로 정해져 있지 않으니까, 모델이 그 불확실함을 그대로 담아내고 있는 셈이거든요.
그럼 이 방식이 실제 제품으로 나온 사례를 보겠습니다.
먼저 구글 딥마인드의 Genie 3인데요, 앞서 만들어 놓은 프레임들과 사용자가 방금 한 행동을 함께 보고 다음 프레임을 예측하면서 상호작용할 수 있는 세계를 만들어 냅니다. 이걸 '행동 조건부 자기회귀 생성(Action-Conditioned Autoregressive Generation)'이라고 부르는데, 예측한 프레임 하나하나가 다시 다음 예측에 쓰일 이력이 되는 구조입니다. 이 이력이 쌓여 있는 덕분에 물체나 장소가 화면 밖으로 나갔다가 되돌아와도 그대로 남아 있고, 그래서 미리 만들어 둔 3D 장면 없이도 세계가 유지됩니다.
2026년 2월에 공개된 Waymo World Model은 Genie 3를 자율주행 시뮬레이션에 맞게 다듬은 건데요, 차가 어떤 주행 동작을 할지, 장면이 어떻게 배치돼 있는지, 그리고 말로 내린 지시를 조건으로 삼아서 카메라에 잡힐 영상과 라이다가 읽어낼 거리 데이터를 함께 만들어 냅니다. 그래서 엔지니어는 날씨를 바꿔보거나, 흔치 않은 장애물을 끼워 넣어보거나, 다른 경로를 시험해 보면서 실제 도로에서는 좀처럼 만나기 힘든 상황을 Waymo Driver가 어떻게 넘기는지 평가해 볼 수 있습니다.

Image Credit: Waymo 월드 모델 시뮬레이션
사전학습된 비디오 디퓨전 모델은 요즘 나오는 여러 World Action Model(WAM, 월드 행동 모델)의 뼈대 노릇도 하는데, 로봇이 할 행동과 앞으로 보게 될 비디오 프레임을 한꺼번에 만들어내는 모델들입니다. 이쪽은 다음 편에서 따로 다루겠습니다.
이제 플로우 매칭을 쓰는 쪽을 보죠. Cosmos-Predict2.5는 로보틱스와 자율주행, 그 밖의 피지컬 AI 시스템을 겨냥한 엔비디아의 비디오 월드 모델인데요, 텍스트나 이미지, 또는 비디오를 넣어주면 그 장면이 이어질 법한 모습을 그려냅니다. 차가 움직일 때 주변 교통이 어떻게 변할지, 또 로봇이 작업하는 동안 물체가 어떻게 반응할지 같은 것들이죠.
어떤 순서로 돌아가는지 보면 이렇습니다. 먼저 인과적 VAE가 비디오를 작은 토큰으로 압축해 두면, 디퓨전 트랜스포머(Diffusion Transformer)가 플로우 매칭으로 그 노이즈 섞인 토큰을 깔끔한 미래 장면으로 바꿔놓습니다. 여기에 Cosmos-Reason1이 사람이 내린 지시를 읽어서 크로스 어텐션으로 생성을 이끌어 주고, 함께 넣어준 이미지나 비디오 프레임이 장면의 출발점을 잡아줍니다.

Image Credit: Cosmos-Predict2.5 논문
다만 이 유형이 안고 있는 가장 큰 한계는, 만들어낸 미래가 보기엔 그럴듯한데 물리적으로는 틀려 있을 수 있다는 겁니다. 특히 장면이 길어질수록 더 그렇고요. 여기에 오차가 하나 더 쌓이는데, 장면 속 물체를 엉뚱한 자리에 놓아버리는 경우입니다.
'숫자'로 압축해 두는 월드 모델: '미래를 일일이 그려보지 않고 예측'하기
두 번째 계열은 아예 다른 생각을 바탕에 깔고 있습니다.
로봇이 컵을 옮겨야 한다고 해 보죠. 손을 움직이기 전에 먼저 그 움직임이 어떤 결과를 낳을지 가늠해 봐야 하는데, 잠재 동역학 모델은 그 결과를 하나하나 상세한 그림으로 그려보지 않고도 ‘압축된 내부 표현’만으로도 여러 가지 가능성을 따져보게 해 줍니다.
인코더가 카메라 이미지나 그 밖에 에이전트가 받아들인 정보를 숫자로 된 특징(Feature)으로 바꿉니다.
전이 모델이 지금의 표현과 해 보려는 행동을 받아서, 다음에 올 표현을 예측합니다.
그 예측을 다시 전이 모델에 집어넣으면 상상된 상태가 하나씩 이어집니다.
그런데 압축해서 얻는 효율만으로는 부족합니다. 다음에 무슨 일이 일어날지 제대로 맞히려면 올바른 정보에서 오는 정확성도 함께 있어야 하는데, 아래 세 가지 접근방법은 이걸 얻어내려고 저마다 다른 학습 신호를 쓰는 거라고 보시면 됩니다.
재구성형 잠재 동역학, RSSM과 Dreamer
재구성형 모델은, 원래 장면을 되살려낼 수 있는 내부 상태를 학습합니다.
여기서 디코더가 아주 직관적인 점검 수단이 되어 주는데요, 압축해 둔 상태 안에 에이전트가 실제로 본 걸 다시 그려내기에 충분한 정보가 들어 있는지를 바로 확인할 수 있으니까요.
PlaNet과 DreamerV1–V3에서 동역학을 담당하는 핵심은 순환 상태공간 모델(Recurrent State-Space Model, RSSM)인데, 이 상태는 서로 맞물린 두 부분으로 되어 있습니다.
순환 메모리가 이전 상태와 이전 행동에서 얻은 정보를 앞으로 실어 나릅니다.
확률적 잠재 상태가 학습된 확률분포를 통해서 지금 상황에 대한 정보를 담아둡니다.
로봇이 새 이미지를 받으면 모델은 그걸 자기 메모리와 합쳐서 상태 추정치를 갱신합니다. 반면에 미래를 상상할 때는 새 이미지가 없으니, 지금 가진 상태와 해 보려는 행동만 가지고 다음 상태를 예측하고요.
훈련할 때는 이 두 갈래가 서로 어긋나지 않도록 맞춰 나갑니다. 이미지를 보고 잡은 상태가 예측 쪽에게 '원래 이걸 예상했어야 한다'고 가르쳐 주고, 그동안 디코더는 원래 장면을 되살려냅니다. 그리고 KL 다이버전스 항이 두 잠재 분포가 서로 가까워지도록 유도하고요.
이 월드 모델은 장면이 어떻게 변할지만 내다보는 게 아니라, 어떤 행동에 보상이 따라올지 그리고 에피소드가 거기서 끝날지 이어질지까지 함께 예측합니다. 그러면 역할을 둘로 나눌 수 있게 되는데요, 액터가 상상 속에서 이런저런 행동을 던져보면 크리틱이 그 행동을 골랐을 때 앞으로 받을 보상이 얼마나 될지 매겨주는 식입니다. 덕분에 에이전트는 머릿속으로 그려본 상태를 하나하나 그림으로 풀어보지 않고도, 어느 행동이 더 큰 보상으로 이어지는지 가려낼 수 있습니다.
정리하면 역할이 이렇게 나뉩니다. 훈련할 때는 원래 장면을 되살려내 보면서 압축이 제대로 됐는지 확인하고, 정작 상상은 그 압축된 표현 위에서만 진행되는 거죠.
픽셀 대신 표현을 예측하기, JEPA
JEPA(조인트 임베딩 예측 아키텍처, Joint-Embedding Predictive Architecture)는 예측형 월드 모델 연구에서 가장 큰 영향을 끼친 아이디어 중 하나입니다. 전제는 단순한데요, 픽셀을 하나하나 되살리는 대신 거기 있어야 할 것의 추상적인 표현을 예측하자는 겁니다.

비디오 프레임의 한쪽이 가려져 있다고 해 보죠. 생성형 모델이라면 그 가려진 자리를 원래 그림 그대로 다시 그려내야 합니다. 벽지의 결이 어땠는지, 그림자가 어디까지 드리웠는지까지 전부요. 맞히기도 어렵고, 사실 다음에 무슨 일이 일어날지 알아내는 데는 별 도움도 안 되는 것들인데 말이죠.
JEPA는 이 일을 아예 하지 않습니다. 그림을 그리는 대신 '그 자리에 무엇이 있는지'만 알아맞히면 된다고 보는 거죠. 구조는 이렇습니다. 인코더 하나가 눈에 보이는 부분을 숫자 묶음으로 바꾸고, 또 하나가 가려진 부분을 숫자 묶음으로 바꿔둡니다. 그러면 예측기가 보이는 쪽만 가지고 "가려진 쪽은 이런 숫자일 것"을 맞혀 보고, 실제 숫자와 얼마나 가까운지로 점수를 받습니다.
이렇게 하면 그림을 복원할 일이 없으니 쓸모없는 건 전부 버릴 수 있습니다. 남는 건 물체가 무엇이고 어떻게 움직이고 서로 어떤 관계인지처럼, 조명이 바뀌든 배경이 달라지든 그대로인 것들이죠. 그래서 JEPA가 배워낸 표현은 작으면서도 여기저기 쓸 데가 많습니다. 무언가를 알아보는 데도 쓰고, 다음을 내다보는 데도 쓰고, 행동을 함께 넣어주는 변형이라면 계획을 세우는 데까지 쓰고요.
다만 잃는 것도 있습니다. 그림으로 풀어낸 결과물이 없으니, 모델이 제대로 맞혔는지 우리가 눈으로 확인할 방법이 없다는 거죠.
과제 지향 잠재 동역학
한편 과제 지향 모델은 내부 상태를 다른 기준으로 만듭니다. 장면을 되살리거나 뜻을 맞히는 쪽이 아니라, 지금 이 행동을 하면 얼마나 이득인지 따지는 데 필요한 것만 남기는 거죠. 그래서 이 모델이 예측하는 것도 장면이 아니라 보상입니다. 이 행동으로 당장 받는 보상이 얼마인지, 그리고 여기서부터 끝까지 갔을 때 받게 될 보상을 다 더하면 얼마인지를요.
이걸 가장 잘 보여주는 사례가 MuZero인데요, 세 가지 함수를 이어 붙인 구조입니다.
표현 함수(Representation Function)가 그동안 본 것들을 받아서 하나의 은닉 상태로 압축합니다.
동역학 함수(Dynamics Function)가 그 은닉 상태와 행동을 받아서, 다음 은닉 상태와 당장 받을 보상을 예측합니다.
예측 함수(Prediction Function)가 그 상태에서 정책과 가치를 추정합니다. 어떤 행동이 유망해 보이는지, 또 앞으로 받을 보상이 얼마나 될지를 따지는 거죠.
MuZero는 트리 탐색을 써서 이 세 함수를 거듭 적용해 가며 서로 다른 행동 순서를 훑어봅니다. 그리고 훈련할 때는 보상과 가치, 정책 예측이 각각 맞았는지를 학습 타겟과 맞춰보며 점검하고요. 여기서 눈여겨볼 건, 상상해 낸 상태가 그 세 가지 예측만 받쳐주면 그만이고 실제 환경을 닮을 이유는 전혀 없다는 점입니다.

또 다른 변형으로 ICLR 2026에서 발표된 Newt가 있습니다. 언어를 조건으로 받는 방식과 시연을 보고 먼저 익히는 사전학습, 그리고 여러 과제를 한꺼번에 다루는 강화학습으로 이 아키텍처를 한 걸음 더 밀고 갔는데요, 가능한 행동을 평가하는 데 쓰는 압축된 동역학 모델이라는 중심 구조는 그대로 남아 있습니다.
'구조'로 적어두는 월드 모델: 공간 모델과 객체 중심 모델
이 마지막 계열이 셋 중에 가장 앞서 나간 것처럼 보일 수도 있겠습니다. 앞의 둘과 달리, 공간이 어떻게 짜여 있는지 또는 개별 개체가 무엇인지를 표현 안에 아예 명시적으로 적어두니까요.
그런데 이렇게 구조를 활용하게 되면, ‘세계에 대한 가정’도 함께 따라 들어옵니다 - 바로, 눈에 들어오는 건 전부 어딘가 특정한 위치에서 온 것이고, 물체는 시야에서 사라져도 없어지지 않고 그 자리에 계속 있고, 앞으로 무슨 일이 벌어질지는 개체들 사이의 관계에 달려 있다는 가정이죠.
재미있는 건 공간을 기록하는 방식과 개체를 기록하는 방식이 서로의 빈자리를 메워준다는 점입니다. 공간 격자는 물건을 하나하나 떼어내지 않고도 방 하나를 통째로 담아낼 수 있고, 반대로 객체 중심 모델은 3D 기하를 붙이지 않고도 개별적인 물건을 따로 세어둘 수 있으니까요.
공간과 기하를 아는 모델: World Labs의 Atlas
공간의 구조를 기록해 두는 방법은 여러 가지입니다.
깊이 맵(Depth Map)은 카메라에서 얼마나 떨어져 있는지를 적어두고요. 점유 격자(Occupancy Grid)는 공간을 작은 칸으로 쪼갠 뒤에 각 칸이 무언가로 차 있는지를 예측하는데, 때로는 그게 무엇인지 의미의 범주까지 함께 짚어줍니다. 점 구름(Point Cloud)과 메시(Mesh), 가우시안 스플랫(Gaussian Splat)도 장면을 담아두거나 그려내는 또 다른 방법들이고요.
가장 따끈한 사례를 보겠습니다. 페이페이 리가 공동 창업한 World Labs가 2026년 9월에 내놓은 Atlas인데요, 이 회사는 Atlas를 '공유 공간 맥락(Shared Spatial Context)을 갖춘 자기회귀 디퓨전 트랜스포머'라고 설명합니다.
핵심 아이디어는 사진 한 장을 그냥 이미지로 보지 않고, 그 사진이 '어디서 어느 쪽을 보고 찍힌 것인지'까지 함께 묶어서 다루는 겁니다. 보통의 이미지 모델에게 사진은 그냥 픽셀 덩어리라 공간 어디쯤인지는 알 수 없는데, Atlas에는 사진마다 카메라 위치와 방향이 꼬리표처럼 붙어 들어옵니다.
꼬리표가 붙으면 사진들끼리 서로 어떤 관계인지 계산할 수 있게 됩니다. 이게 '공유 공간 맥락'인데요, 예를 들어 어떤 방을 서로 반대편 모서리에서 찍은 사진 두 장을 넣어준다고 해 보죠. 사람은 두 사진을 보고 같은 방이라는 걸 알지만, 꼬리표가 없으면 모델은 그걸 알 길이 없습니다. 반면 Atlas는 두 카메라의 위치와 방향을 알고 있으니 두 사진이 같은 공간의 다른 쪽을 찍은 거라는 것을 계산해 낼 수 있고, 그래서 방 한가운데에 카메라를 놓았다면 어떤 장면이 보였을지까지 만들어냅니다. 그 자리에서 찍은 사진은 애초에 없었는데도요.
여기엔 세 가지 요소가 함께 맞물려 돌아갑니다.
트랜스포머가 멀티모달 맥락을 처리합니다. 텍스트와 이미지, 카메라 포즈, 깊이 맵이 전부 여기로 들어오고, 비디오는 이미지가 줄줄이 이어진 형태로 들어옵니다.
자기회귀가 출력의 순서를 잡습니다. Atlas는 앞서 나온 것들을 조건 삼아 시퀀스 요소를 하나씩 만들어내고, 그래서 이미 만들어낸 시점이 다음 예측의 맥락이 되어 줍니다.
정류 플로우(Rectified Flow)가 시각적인 내용물을 채웁니다. 생성 단계마다 모델이 맥락을 참고해서 노이즈를 조금씩 시각 표현으로 바꿔 가는데, 이 작업은 압축된 잠재 공간에서 이뤄지고 그 결과를 디코딩해서 출력으로 내보냅니다.
그러니까 두 가지가 동시에 돌아가는 셈입니다. 자기회귀가 시퀀스를 어떻게 펼쳐 갈지 정하고, 플로우가 각 시각 출력의 내용을 채우는 거죠. 그리고 카메라 기하가 그 예측들이 공간에서 어긋나지 않게 잡아줍니다.
Atlas는 깊이 맵도 함께 다뤄서 이미지의 픽셀 하나하나가 3차원 공간의 어느 지점인지를 짚어줍니다. 이렇게 만들어낸 여러 시점의 장면과 깊이 추정치를 합치면 공간을 점의 집합으로 되살릴 수 있고, 이걸 다시 가우시안 스플랫으로 바꾸면 사람이 직접 걸어 들어가 둘러볼 수 있는 장면이 됩니다. 사진이 몇 장 안 들어왔을 때는 안 보이는 구석을 모델이 그럴듯하게 지어내는데, 사진이 더 들어올수록 지어낼 수 있는 폭이 줄어들면서 실제에 가까워지고요.
이렇게 두 가지가 섞여 있다 보니 Atlas는 아키텍처 그룹 둘에 걸쳐 있습니다. 장면을 만들어내는 건 첫 번째 계열이 하는 일인데, 그 작업을 공간 좌표 위에서 한다는 점은 세 번째 계열의 방식이니까요.

Image Credit: Atlas, World Labs 블로그 포스트
객체 중심 모델
이쪽도 꽤 흥미롭습니다.
객체 중심 모델은 장면 하나를 물건 단위로 쪼개놓습니다. 컵 하나, 탁자 하나, 로봇 팔 하나를 각각 따로 담아두는 식이죠. 이때 쓰는 그릇을 '슬롯(Slot)'이라고 부르는데, 물건 하나를 담으라고 비워둔 자리라고 보시면 됩니다. 시간이 흐르면 동역학 모델이 이 슬롯들을 하나씩 갱신해 가고, 물건들끼리 부딪히거나 밀어내는 일까지 함께 다룹니다.
기초가 되는 사례가 SlotFormer입니다. 비디오에서 물건들을 먼저 뽑아낸 다음, 트랜스포머로 이것들이 앞으로 어떻게 될지 예측하죠. 예측한 슬롯은 다시 그림으로 풀어낼 수도 있고, 그림 없이 그대로 추론이나 계획에 쓸 수도 있습니다. 여기서 어텐션이 중요한 몫을 하는데요, 물건 하나가 혼자 변하는 것뿐 아니라 물건끼리 주고받는 영향까지 담아낼 수 있게 해 주거든요.
2026년 2월에 개정 논문이 나온 OC-STORM은 여기에 분할(Segmentation) 네트워크를 붙였습니다. 화면에서 물건의 경계를 잘라내는 역할을 따로 맡긴 거죠. 그래서 사람이 물건을 표시해 둔 프레임 몇 장만 넣어주면, 판단에 정말 중요한 물건이 무엇이고 그것들이 서로 어떻게 얽히는지를 가려냅니다.

Image Credit: OC-STORM 논문
이런 구조는 과제가 물건 하나하나에 달려 있을 때 빛을 봅니다. 어느 물건이 움직였는지, 그게 무엇에 닿았는지, 다음엔 어디로 가야 하는지 같은 걸 따져야 하는 일들이죠.
문제는 그 물건들을 매번 틀림없이 가려내는 일 자체가 쉽지 않다는 겁니다. 물건끼리 겹쳐 있거나, 각도가 바뀌면서 생김새가 달라지거나, 하나가 다른 것 뒤로 숨어버리면 어느 게 어느 건지 놓치기 쉬우니까요. 그리고 한 번 잘못 짚으면 그 뒤의 예측이 전부 어긋납니다.
맺으며
오늘 살펴본 걸 정리하면 이렇습니다.
‘장면을 그려두는 방식의 모델’은 앞으로 눈에 보일 광경을 직접 예측해 주니까, 시뮬레이션을 돌리거나 가상의 환경을 만들어내는 일에 잘 맞습니다.
‘숫자로 압축해 두는 방식의 모델’은 작은 내부 상태만 거쳐서 예측하니까, 수천 번씩 돌려봐야 하는 계획 수립이나 의사결정에 훨씬 효율적이고요.
‘구조로 적어두는 방식의 모델’은 공간과 기하, 물건을 그대로 기록해 두니까, 물건끼리 부딪히고 맞물리는 걸 정확히 따져야 하는 문제에서 힘을 씁니다.
그럼 이 많은 계열과 하위 유형의 아키텍처들 중에서, 지금 여러분이 고민하고 계신 일에 맞는 걸 어떻게 고를까요? 실용적인 기준으로 정리해 보면 이렇습니다.
사람이 직접 눈으로 보고 판단해야 한다면 ‘장면을 그려두는 모델’을 고르세요.
수많은 가능성을 빠르게 따져봐야 한다면 ‘잠재 동역학 모델’입니다.
기하와 3D 일관성이 빠질 수 없는 조건이라면 ‘공간 모델’이 잘 맞고요.
물건들 사이에서 벌어지는 일이 가장 중요하다면 ‘객체 중심 모델’이 더 나은 선택입니다.
정말 따질 게 '어떤 행동이 최선의 결과로 이어지나' 하나뿐이라면 ‘과제 지향 잠재 모델’을 고르시면 됩니다.
다만, 진짜 흥미로운 모델들은 한 칸에 딱 떨어지게 들어가지 않습니다. 지금 나와 있는 어떤 모델도 그렇지 않고요. World Labs의 Atlas만 해도 만들어낸 장면과 명시적인 공간 구조를 함께 쓰고 있죠.
그리고 지금의 큰 방향도 이 강점들을 섞는 방향으로 진행되고 있습니다. 머릿속에 그려볼 수 있을 만큼은 그려내고, 빠르게 따져볼 수 있을 만큼은 압축하고, 물리 세계에서 발이 떨어지지 않을 만큼은 구조를 쥐고 있는 것.
이 세 가지 장점을 하나의 몸체에 담는 쪽으로 발전하고 있다는 점을 잊지 말고 월드 모델의 변화를 지켜봐야겠습니다.
보너스: 참고자료
A Functional Taxonomy of World Models — Dr.Fei-Fei Li post | World Labs post
A Definition and Roadmap for World Models
Dreamer 4 Paper Training Agents Inside of Scalable World Models
Cosmos-Predict2.5 Paper | GitHub | NVIDIA Blog post

튜링 포스트 코리아의 인사이트가 담긴 컨텐츠를 마음껏 읽어보세요!
프리미엄 플랜으로 업그레이드하시면 튜링 포스트 코리아의 모든 컨텐츠를 제한없이 보실 수 있고, 튜링 포스트 코리아의 컨텐츠 제작에 큰 도움이 됩니다. 감사합니다!
주간 AI 뉴스레터
AI 유니콘 기업들에 대한 심층 분석 기사
AI 기술, 산업, 정책 전문가 인터뷰
AI 기술 및 산업에 대한 심층 분석 시리즈
분석 기사 요청 및 튜링 포스트 코리아 기고 기회 제공
읽어주셔서 감사합니다. 친구와 동료 분들에게도 뉴스레터 추천해 주세요!



