SUNGSOO KIM’S BLOGWORLD MODELS / PHYSICAL AI
WORLD MODELS · RESEARCH SYNTHESIS · 2025–2026

From Predictive Representations
to Reliable Decisions

월드 모델은 어떤 미래를 기억하고,
어떤 행동을 더 잘 선택하게 만드는가?

13 PAPERS · 한국어 기술 해설 · PUBLISHED 2026-10-07 KST
예측 표현에서 신뢰 가능한 결정까지관측 이력은 상태와 불확실성으로 요약된다. 후보 행동과 월드 모델은 여러 미래를 만들고, 목표와 위험을 평가하여 실제 행동을 실행한다. 새 관측이 상태를 갱신한다. 물리 일관성, 개입 정확성, 실제 결정 효용을 별도로 검증한다.OBSERVATION관측과 상호작용 이력영상 · 센서 · 행동STATE / BELIEF상태와 불확실성무엇을 보존할 것인가?WORLD MODEL행동별 미래 예측후보 행동 → 여러 rolloutEVALUATION목표·위험 평가정확도가 결정에 유효한가?DECISION행동 선택·실행실제 환경에서 결과 확인FEEDBACK새 관측·재계획오차 수정 · 필요시 정보 탐색SEPARATE EVIDENCE AXES시각 품질 ≠ 물리 일관성 ≠ 개입 정확성 ≠ 실제 결정 효용
개념 종합 · 예측은 실제 피드백을 통해 검증되어야 하며, 네 평가 축은 서로 대체할 수 없다.

이는 특정 논문의 실증 아키텍처가 아닌 문헌을 종합한 폐루프 개념도다. 상태 추론, 행동별 예측, 평가, 실행, 재관측이 연결된다.

작은 화면에서는 다이어그램을 좌우로 이동해 볼 수 있다.

좋은 예측의 의미는 사용 목적에서 정해진다. 이 글은 월드 모델의 표현·생성·제어를 연결하고, 그 연결이 실제 의사결정에 유효한지를 묻는다.

PART 01 · Definition

월드 모델은 무엇을 모델링하는가?

Definition

로봇이 컵을 보고 이름을 맞히는 능력과, 컵을 밀었을 때 어디로 움직일지 예상하는 능력은 다르다. 이 글에서 World Model은 관측 이력을 내부 상태로 압축하고, 환경의 변화와 행동 결과를 예측하는 모델로 정의한다. 계획·정책학습·시뮬레이션은 이 예측을 사용하는 방식이다.

최근 문헌의 용례는 더 넓다. 미래 영상 생성기, 행동 없는 표현 예측기, 행동 조건부 신경 시뮬레이터, 합성 데이터 엔진이 모두 이 이름 아래 논의된다. 따라서 모델의 명칭보다 입력, 예측 대상, 제어 가능성, 검증된 사용 목적을 먼저 확인해야 한다. [8]

zt = fθ(o≤t, a<t)  ;  pθ(zt+1 | zt, at)

o는 관측, a는 행동, z는 학습된 상태 표현이다. 상태를 하나의 벡터로 나타내는 것은 구현 선택이며, 불확실한 환경에서는 여러 가능한 상태에 대한 믿음 분포가 더 적절할 수 있다. 행동 없는 영상 사전학습은 관측 규칙성을 배우는 기반이지만, 그 자체가 임의의 개입에 대한 정확성을 보장하지는 않는다.

PART 02 · Problem Definition

어떤 예측이 좋은 결정을 만드는가?

Problem Definition

핵심 문제는 제한된 관측과 상호작용 데이터에서 학습한 모델이 새로운 환경·목표·정책 아래에서도 유용한 행동 비교를 제공하게 만드는 것이다. 부분관측 의사결정 문제(POMDP)에서는 참 상태 s가 직접 보이지 않으며, 에이전트는 이력으로부터 bt(s)=P(st=s|이력)를 추정한다. 학습 표현 z는 이 믿음을 근사하거나 의사결정에 필요한 정보를 보존하는 역할을 한다.

하위 문제실패의 형태컵을 옮기는 예
상태 추론가려진 대상·속성 누락컵 뒤 장애물과 미끄러운 바닥 추정
동역학 학습행동 변화에 둔감한 예측밀기 힘에 따른 이동량 구분
계획·정책학습예측은 자연스럽지만 선택은 실패낙하 위험이 낮은 행동 선택
신뢰성 관리낯선 상황에도 과신재질을 확인하는 탐색 행동 수행

2026년의 planning sufficiency 연구는 물리 메커니즘을 식별하는 데 필요한 정보, 반응을 예측하는 데 필요한 정보, 좋은 결정을 내리는 데 필요한 정보를 구분한다. 필요한 정밀도는 목표와 후보 집합, 후보를 찾는 계획기에 따라 달라진다. [10]

Regret(q) = Jq(a*) − Jq(âθ)

이 식은 설명을 위한 일반 정식화다. J는 실제 환경 효용, a*는 비교 범위의 최적 행동, â는 모델이 선택한 행동이다. 낮은 예측 오차와 낮은 의사결정 regret은 동일한 목표가 아니다. 예를 들어 컵의 표면 무늬는 잘못 생성해도 낙하하는 행동을 제외할 수 있지만, 접촉 시점의 작은 오차는 성공과 실패를 바꿀 수 있다.

PART 03 · Core Concepts

상태·행동·상상·불확실성의 연결

Core Concepts
개념기능읽을 때의 질문
Latent state관측의 압축된 내부 표현작업 성공을 가르는 차이가 남아 있는가?
Action conditioning행동에 따른 미래 분기다른 행동이 실제로 다른 결과를 만드는가?
Rollout예측을 반복한 미래 궤적시간이 길어질 때 오류가 어떻게 변하는가?
Imagination모델 생성 경험으로 학습·탐색생성 경험의 편향을 정책이 이용하는가?
MPC짧은 계획 후 실행·재관측실제 피드백으로 오차를 줄이는가?
Epistemic uncertainty학습 데이터·지식의 부족새 데이터를 얻으면 감소하는가?
Aleatoric uncertainty관측·전이의 내재적 변동여러 가능한 결과를 분포로 표현하는가?

불확실성의 두 성분은 설계상 구분해야 하지만 실제 신경 모델에서 정확히 분해하기는 어렵다. 앙상블의 의견 차이도 지식 부족의 완전한 척도는 아니다. 알려지지 않은 환경에서 자신 있게 틀리는지를 별도로 평가해야 한다.

행동 조건부 상관관계 P(o′|a,h)와 개입 분포 P(o′|do(a),h)는 데이터 수집의 교란과 가정에 따라 달라질 수 있다. 예를 들어 숙련자가 위험한 장면에서만 강하게 제동했다면, 단순 관측은 강한 제동과 사고 위험을 잘못 연결할 수 있다. 행동 라벨을 입력했다는 사실만으로 인과 식별을 주장할 수 없는 이유다.

OneWorld는 같은 초기 장면의 여러 행동 분기가 서로 양립 가능한 물리 속성을 공유하도록 학습하는 방향을 제시한다. 중요한 구분은 단일 rollout의 그럴듯함과 여러 개입 사이의 물리적 양립 가능성이다. [9]

PART 04 · Introduction

2025–2026 연구를 읽는 세 개의 축

Introduction

본 검토는 2025-01-01부터 2026-10-07 KST까지 공개된 대표 연구 13편을 다룬다. 체계적 문헌고찰의 전수 검색·배제 절차를 수행한 결과는 아니다. 기술보고서, 연구 프리프린트, 평가 관점논문을 구분하며, 기업의 제품 발표를 동료심사 논문과 동급의 실증으로 계산하지 않는다.

축대표 연구핵심 변화
경험의 확장Cosmos · Cosmos-Predict2.5 · Dreamer 4영상 생성과 모델 내부 학습으로 경험 비용 완화
표현의 선택V-JEPA 2 · LeWorldModel · Criterion-aligned loss행동과 성공에 필요한 정보를 효율적으로 보존
증거의 정밀화Physics-IQ · WorldLens · decision-centric evaluation시각 품질·물리·개입·결정 효용을 분리

최근의 보완 축은 지속성과 구조다. World Observer는 시야 밖 상태의 변화, 4Director는 명시적 기하에 따른 제어, OneWorld는 행동 분기 사이의 일관성을 다룬다. 서로 다른 과제이므로 단일 순위표로 우열을 묶기 어렵다. [9], [11], [13]

PART 05 · Motivation and Background

왜 모델 안에서 경험하려 하는가?

Motivation and Background

첫 동기는 실제 상호작용의 비용이다. 로봇 실험은 장비 복구, 초기화, 센서 보정, 작업자 시간의 제약을 받는다. 학습된 모델로 가능한 행동을 미리 비교하면 실제 실험을 정보가 큰 지점에 집중할 수 있다. 그러나 잘못된 모델은 비용을 절감하는 대신 잘못된 확신을 축적할 수도 있다.

둘째는 영상과 행동 데이터의 불균형이다. V-JEPA 2는 대규모 비디오 표현 학습을 로봇 상호작용 데이터 후학습과 연결했다. 논문은 62시간 미만의 DROID 로봇 영상 기반 후학습을 보고한다. 여기서 unlabeled는 작업별 의미·보상 라벨의 부재와 관련되며, 행동 조건부 단계가 행동 정보 없이 수행된다고 해석하면 안 된다. [3]

셋째는 재사용이다. Cosmos는 데이터 정제, 토크나이저, 기반 모델, 후학습을 묶은 플랫폼을 제시한다. Cosmos-Predict2.5는 flow 기반 구조로 텍스트·이미지·비디오 조건 생성을 통합한다. 기반 모델을 응용에 맞게 조정하는 접근의 가치는 실제 후속 작업의 성능으로 검증해야 한다. [1], [5]

넷째는 빠른 정책 개선이다. Dreamer 4는 오프라인 데이터에서 학습한 모델 안에서 행동을 학습하며, Minecraft의 다이아몬드 획득을 보고한다. 게임에서의 성공은 현실 로봇의 일반적 신뢰성 증명으로 확장할 수 없다. [4]

PART 06 · Challenges

예측이 행동으로 옮겨질 때 드러나는 간극

Challenges
난제왜 발생하는가필요한 검증
물리 정확성영상 손실은 물리 제약과 다름접촉·중력·재질별 통제 실험
장기 오차예측 입력의 반복 사용과 분포 이동길이별 오류와 실제 폐루프 성공률
시야 밖 지속성현재 화면 중심의 상태 유지재진입 후 객체 상태·정체성 확인
표현 붕괴·정보 손실압축·학습 안정성·정밀도 간 긴장물리량 읽기와 행동 선택 동시 평가
정책의 모델 악용최적화가 모델 오류를 찾아냄환경 실행과 adversarial candidate 탐색
실시간성후보 수 × rollout 길이 × 샘플 비용동일 장비·지연 예산 비교

Physics-IQ는 평가 당시 영상 모델에서 시각적 사실성과 물리 이해의 차이를 드러냈다. WorldLens는 여섯 주행 월드 모델을 여러 평가 축으로 비교하며 단일 모델의 전면적 우위를 확인하지 못했다고 보고한다. 이 결과를 모든 후속 모델의 한계로 고정해서는 안 된다. [2], [7]

LeWorldModel은 잠재공간 학습 안정성과 효율을 다룬다. 논문이 보고한 약 15M 매개변수와 최대 48배 계획 속도 향상은 해당 비교 설정의 결과이며, 임의의 하드웨어·과제에서 동일한 배율을 보장하지 않는다. [6]

PART 07 · Research Questions

반증 가능한 질문으로 바꾸기

Research Questions

다음 질문과 실험은 문헌의 문제의식을 연구 설계로 재구성한 제안이다. 서로 다른 모델을 비교할 때는 관측 정보, 행동 라벨, 학습 예산과 추론 시간을 통제해야 한다.

연구 질문통제 실험핵심 지표
RQ1. 무엇을 보존해야 하는가?표현 차원·성공 기준 감독만 변경행동 순위 일치도·regret
RQ2. 행동 데이터는 얼마나 필요한가?행동 라벨 비율·개입 범위 변경미관측 행동 예측·성공률
RQ3. 같은 세계를 상상하는가?같은 장면에서 여러 힘·방향 적용공유 물리 파라미터의 설명 가능성
RQ4. 기억이 실제로 유효한가?가림 시간과 이동 물체 수 변경재진입 상태 오차·계획 성공률
RQ5. 언제 관측해야 하는가?관측 비용·실패 비용 변경정보 획득량·총 작업 비용
RQ6. 새 목표로 전이되는가?동역학 유지, 목표·보상 교체목표 외삽 regret
RQ7. 모델을 최적화해도 믿을 수 있는가?계획 탐색 강도를 단계적으로 증가모델 예측–현실 효용 격차

특히 학습 목표, 계획 비용, 성공 판정의 정합성을 분리해 분석할 필요가 있다. 내부 표현에서 물리량을 선형적으로 읽을 수 있다는 사실과, 계획기의 거리 함수가 성공 후보를 우선한다는 사실은 다르다. Criterion-aligned loss 논문도 읽기 정확도 개선만으로 성공률 개선을 보장할 수 없음을 보여준다. [12]

PART 08 · Approaches (Methods)

생성·표현·학습·기하의 조합

Approaches (Methods)
계열메커니즘대표 연구추가로 검증할 점
생성형 영상diffusion/flow로 미래 관측 생성Cosmos, Predict2.5 [1,5]행동 제어와 물리적 타당성
잠재 예측픽셀 복원 없이 미래 embedding 예측V-JEPA 2, LeWM [3,6]결정에 필요한 정밀도
상상 기반 RL모델 경험으로 정책·가치함수 학습Dreamer 4 [4]모델 악용과 환경 내 성능
공유 메커니즘행동 분기에 공통 물리 잠재변수OneWorld [9]개입 간 일관성과 일반화
기하 조건 생성고정 객체 기하와 시간별 변환4Director [13]기하 제어와 물리 예측의 차이
지속적 관측 표현actor와 observer 영상 공동 생성World Observer [11]관측 범위·입력 조건
성공 기준 정렬훈련 때 물리량 보조 감독Criterion-aligned loss [12]새 과제·모델·seed에서 재현

표의 계열은 배타적이지 않다. 생성 디코더와 잠재 동역학을 결합하거나, 잠재 모델에서 정책을 학습할 수 있다. 이 글의 핵심은 특정 아키텍처를 승자로 선언하는 것이 아니라 어떤 실패 원인을 어느 구성 요소가 해결하는지 비교하는 것이다.

잠재 모델과 MPC. 현재 관측을 인코딩하고 후보 행동을 rollout한 뒤 목표까지의 예측 비용으로 순위를 매긴다. 첫 행동만 실행하고 새 관측으로 다시 계획하면 오류를 계속 보정할 수 있다.

a*t:t+H−1 = arg maxa Epθ[ Σk=0H−1 γkr(zt+k, at+k) ]

이 식은 모델 기반 제어의 일반 설명이며, 모든 논문이 명시적 보상이나 같은 계획기를 쓰는 것은 아니다. 이미지 목표 기반 모델은 목표 embedding까지의 거리를 비용으로 사용할 수 있다. V-JEPA 2-AC의 실제 로봇 계획과 Dreamer 4의 모델 내부 정책학습은 예측을 활용하는 서로 다른 방식이다. [3], [4]

성공 기준을 표현 학습에 반영. 설명용 목적함수는 다음처럼 쓸 수 있다. q는 성공 판정에 필요한 물리량이고 g는 훈련용 읽기 head다. 감독량을 얻는 비용과 기준 자체의 적절성도 실험 조건에 포함해야 한다.

L = Lprediction + λ‖g(z) − q‖²

기하와 지속성. 4Director는 객체의 canonical mesh와 프레임별 강체 변환을 영상 제어 조건으로 사용한다. 이는 자유로운 힘·접촉의 물리 시뮬레이션과는 다른 문제다. World Observer는 actor 시야 바깥 영역을 panoramic observer로 함께 생성하지만, 현재는 파노라마 조건 입력과 제한된 observer 예산이라는 제약을 가진다. [11], [13]

PART 09 · Key Applications

실증과 응용 제안을 분리해서 읽기

Key Applications
응용현재 문헌의 근거아직 남은 범위
로봇 조작V-JEPA 2-AC의 두 연구실 Franka 집기·놓기 [3]새 로봇·복잡 접촉·장기 작업 일반화
가상환경 학습Dreamer 4의 오프라인 Minecraft 과제 [4]현실로의 직접 전이
주행 모델 평가WorldLens의 영상·기하·폐루프 평가 [7]전체 운행 범위의 신뢰성 보장
합성 경험Cosmos 계열의 응용별 생성·후학습 [1,5]실제 데이터 대비 순효용
영상 제어4Director의 객체·카메라 제어 [13]역학적으로 올바른 행동 결과
지속적 가상환경World Observer의 시야 밖 변화 유지 [11]무제한 세계 기억과 실제 센서 추적

저자 보고 결과. V-JEPA 2-AC의 zero-shot 배치는 해당 새 실험 환경에서 작업별 추가 학습 없이 계획했다는 의미로 읽어야 한다. 로봇 상호작용 사전지식이 전혀 없었다는 뜻은 아니다. [3]

확장 제안 — 자율 과학실험. 후보 실험별 결과 분포와 불확실성 감소를 예측하여 다음 실험을 고르는 구조가 가능하다. 그러나 반응 경로·측정 지연·실험 장비 상태를 제대로 모델링해야 하며, 영상 월드 모델의 성과를 화학·생물학 실험 효용으로 직접 대체할 수 없다.

확장 제안 — 다중로봇 협업. 객체·공간 점유·작업 선후관계를 공유하고 각 로봇의 행동 결과를 조합하는 연구를 제안한다. 통신 지연, 관측 불일치, 다른 로봇의 정책 변화가 새로운 불확실성을 만든다. 단일 에이전트 결과와 협업 시스템의 검증을 구분해야 한다.

PART 10 · Open Problems

아직 풀리지 않은 연구 문제

Open Problems

1. 관측에서 개입으로의 식별. 같은 영상에 여러 물리 설명이 가능할 때 무엇을 추가로 측정하거나 실행해야 하는가? 데이터 규모 확대만으로 해결되는 부분과 능동 개입이 필요한 부분을 구분해야 한다.

2. 장기 상태의 정체성. 물체가 시야를 떠났다가 돌아왔을 때 외형뿐 아니라 위치·속도·상호작용 이력을 보존해야 한다. World Observer는 이를 위한 구조를 제안하지만 전체 세계를 제한 없이 관찰하는 모델은 아니다. [11]

3. 목표 특화와 범용성. 현재 목표에 불필요해 삭제한 정보가 다음 목표에서는 필수일 수 있다. 목표에 맞춘 후보 탐색과 재사용 가능한 행동 조건부 예측을 어떻게 나눌지가 열린 문제다. [10]

4. 검증 지표의 허점. 물리량 probe, 영상 유사도, 정책 순위, 성공률을 하나의 숫자로 환산하면 증거의 종류를 잃을 수 있다. Decision-centric position의 L0–L7 역시 보편적 단일 성능척도보다 증거의 구조로 읽어야 한다. [8]

5. 감독의 현실적 비용. 성공 기준이 접촉·파지 같은 술어이거나 물체 위치가 직접 측정되지 않을 때 어떤 감독을 줄 것인가? Criterion-aligned loss 연구는 이런 경우와 실제 로봇의 측정 문제를 후속 과제로 남긴다. [12]

6. 모델 악용과 불확실성 보정. 모델이 생성한 경험만으로 평가하면 자기 일관성을 현실 정확성으로 착각할 수 있다. 정책이 찾은 고보상 행동을 독립 환경에서 검증하고, 분포가 바뀔 때 신뢰도도 다시 측정해야 한다.

PART 11 · Future Directions

예측의 규모에서 검증 가능한 효용으로

Future Directions

다음은 검토 논문을 바탕으로 구성한 창의적 연구 제안이며, 확립된 성능 결과나 특정 기관의 확정 사업 계획이 아니다.

제안 A — Temporal Scene Graph × Continuous Dynamics. 객체 정체성, 관계, 사건 이력, 관측 시각은 temporal graph에 저장하고 위치·속도·접촉은 연속 잠재 동역학으로 예측한다. 그래프 사실마다 출처 관측과 유효시간, 불확실성을 남겨 오래된 사실을 확정 상태로 사용하는 오류를 줄인다. 동일 계산 예산에서 장기 가림 후 재식별과 과제 성공률이 개선되는지가 반증 가능한 가설이다.

제안 B — 불확실성에 따른 관측·재계획. 위험한 구간에서 rollout을 길게 늘리는 대신 카메라 이동이나 작은 접촉 탐색으로 정보를 얻는다. 실패 비용, 관측 비용, 시간 예산을 함께 최소화하며 과신율과 실제 손실을 평가한다.

제안 C — 정책 순위 보존을 중심으로 평가. 모델이 선호한 행동과 독립 환경이 선호한 행동을 비교한다. 순위 상관만 높아도 치명적 최상위 선택 오류는 남을 수 있으므로 top-choice regret과 실패 유형을 함께 보고한다.

제안 D — 실패 중심 능동학습. 모델 예측과 실측이 크게 어긋난 접촉·재질·가림·지연 상황을 우선 수집한다. 데이터 수 자체보다 추가 경험 한 단위당 실제 실패율 감소를 측정한다. 실패 수집을 편향 없이 평가할 별도 검증 집합도 유지한다.

연구 단계실험 설계진전의 판단 기준
표현 정합성성공 기준 감독·그래프 기억 각각 ablation실제 성공률·seed 간 재현성
개입 일관성동일 장면의 다중 힘·방향·목표공유 물리 설명과 행동 선택 오류
불확실성 활용낯선 재질·동적 장애물·가림과신 감소·총 작업 비용
시스템 검증새 환경·새 로봇·새 목표에서 폐루프 실행regret·실패율·지연시간·데이터 비용

Sources & Research Notes

아래 날짜는 arXiv 제출 이력에 표시된 최초일과 최신 개정일이다. 게시일은 2026-10-07 KST다. 학회 표기가 확인되지 않은 문헌의 동료심사 여부는 단정하지 않는다. 서지 확인과 논문 저자의 보고 결과를 독립 재현으로 표현하지 않는다.

  1. Cosmos World Foundation Model Platform for Physical AI최초 2025-01-07 · 최신 2025-07-09 · v3 · 기술보고서 / arXiv플랫폼과 응용별 후학습https://arxiv.org/abs/2501.03575
  2. Do generative video models understand physical principles?최초 2025-01-14 · 최신 2025-02-27 · v3 · 연구논문 / arXivPhysics-IQ의 물리 이해 평가https://arxiv.org/abs/2501.09038
  3. V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning최초 2025-06-11 · 최신 v1 · 별도 개정 없음 · 연구논문 / arXiv표현 예측과 로봇 계획https://arxiv.org/abs/2506.09985
  4. Training Agents Inside of Scalable World Models최초 2025-09-29 · 최신 v1 · 별도 개정 없음 · 연구논문 / arXivDreamer 4의 imagination learninghttps://arxiv.org/abs/2509.24527
  5. World Simulation with Video Foundation Models for Physical AI최초 2025-10-28 · 최신 2026-02-24 · v2 · 기술보고서 / arXivCosmos-Predict2.5와 Transfer2.5https://arxiv.org/abs/2511.00062
  6. LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels최초 2026-03-13 · 최신 2026-06-03 · v3 · 연구논문 / arXiv안정적인 end-to-end JEPAhttps://arxiv.org/abs/2603.19312
  7. Is Your Driving World Model an All-Around Player?최초 2026-05-11 · 최신 v1 · 별도 개정 없음 · CVPR 2026 VideoWorldModel Workshop 표기WorldLens의 다차원 평가https://arxiv.org/abs/2605.10858
  8. How Should World Models Be Evaluated for Embodied Decision-Making? A Decision-Making-Centric Position최초 2026-06-13 · 최신 2026-06-28 · v2 · 관점논문 / arXiv의사결정 효용과 주장–증거 정합성https://arxiv.org/abs/2606.15032
  9. OneWorld: Learning Consistent Physics Across Actions in World Models최초 2026-09-25 · 최신 v1 · 당일 개정 재확인 제한 · 프리프린트 / arXiv행동 간 공유 물리 메커니즘https://arxiv.org/abs/2609.30946
  10. What Must a World Model Distinguish for Planning?최초 2026-09-26 · 최신 v1 · 별도 개정 없음 · 프리프린트 / arXivmechanism / response / decision sufficiencyhttps://arxiv.org/abs/2609.33030
  11. World Observer: Joint Actor-Observer Generation for Persistent World Modeling최초 2026-10-01 · 최신 v1 · 별도 개정 없음 · 프리프린트 / arXiv시야 밖 동역학과 지속적 상태https://arxiv.org/abs/2610.02162
  12. Supervise What Decides Success: Criterion-Aligned Auxiliary Losses for Latent World-Model Planning최초 2026-10-01 · 최신 v1 · 별도 개정 없음 · 프리프린트 · Under review 표기성공 기준에 정렬된 보조 손실https://arxiv.org/abs/2610.01224
  13. 4Director: Controlling Video World Models with Rigid 3D Geometry최초 2026-10-01 · 최신 v1 · 별도 개정 없음 · 프리프린트 / arXiv명시적 4D 기하를 통한 영상 제어https://arxiv.org/abs/2610.02160

열람 범위: 핵심 최신 논문 및 V-JEPA 2·Dreamer 4는 HTML 본문의 방법·한계도 확인했다. OneWorld는 2026-10-06 확인한 원문 초록과 10-07의 arXiv 검색 결과를 사용했으며, 당일 원문 재열람 오류로 최신 개정 여부는 확인하지 못했다. 해당 결과는 정량 비교에서 제외했다. 다른 문헌은 원문 서지·초록에서 확인되는 범위로 주장을 한정했다. 인용은 모두 요약·재서술이며, 제안과 해석은 본문에 별도 표시했다.