AI Research Blog·Programmable World Model2026 · 09 · 14
World Models·Executable State·Generative Rendering

세계는 영상이 아니라
상태로 기억되어야 한다

Programmable World Model — separating executable world-state evolution from generative observation rendering

01 · WORLD PROGRAMMING 자연어 → 실행 규칙 on_hit:hp -= damage on_hp_zero:down win:all_enemies_defeated CANONICAL STATE 02 · STATE COMPILER 3D OBB → 화면 제어 IDENTITYSEMANTICDIRECTION 03 · GENERATIVE RENDERER 제약 → 시각적 세계 VIDEO PRIOR FILLS SHAPE · LIGHT · MOTION PERSIST 기억 규칙 검증
Central Thesis

최근 비디오 세계모델은 장면을 그럴듯하게 만들어 낸다. 그러나 그럴듯한 다음 프레임을 만드는 능력과 세계에서 무엇이 참인지를 지속적으로 기억하는 능력은 같은 문제가 아니다.

Programmable World Model(PWM)은 이 둘을 분리한다. 세계의 상태 변화는 명시적이고 실행 가능한 엔진이 관리하고, 비디오 모델은 그 상태를 시각적으로 실현하는 생성형 렌더러로 사용한다. 사용자는 자연어로 규칙을 정의하고, 에이전트는 이를 실행 프로그램으로 바꾸며, 엔진은 화면 밖 개체와 HP·inventory·faction 같은 비시각 속성까지 보존한다. 그런 다음 state-augmented 3D oriented bounding box(OBB)가 세계 상태를 비디오 생성기가 이해할 수 있는 공간 제어 신호로 번역한다.

“생성형 세계는 시각 생성 자체에 무엇이 참인지 기억시키기보다, 상태는 실행 가능하고 검증 가능하게 유지하고 외형은 생성적으로 완성하게 할 수 있다.”논문의 결론을 웹 읽기용으로 압축한 해석
Part I · §1-§3

영상 생성에서 ‘세계 엔진’으로

논문이 문제 삼는 것은 화질이 아니라 세계의 사실성이다. 누가 살아 있는지, 문이 왜 열렸는지, 화면 밖의 대상이 여전히 존재하는지를 모델이 어떻게 보존할 것인가가 핵심이다.

§1 · Problem

그럴듯한 관찰은 권위 있는 세계 상태가 아니다

기존 interactive video world model은 시각 이력과 사용자 행동을 바탕으로 다음 관찰을 생성한다. 이 방식은 현실감과 반응성을 높였지만, 논문은 세 가지 구조적 한계를 지적한다.

Entity Control

카메라·행동·고수준 프롬프트는 제어할 수 있어도 특정 개체를 주소처럼 직접 지정하고 조작하기 어렵다.

Persistent State

현재 화면과 독립된 전역 상태가 없으면 off-screen entity, inventory, task progress, interaction history 같은 사실을 권위 있게 유지하기 어렵다.

Executable Rules

“문을 열어라”라는 결과 프롬프트는 “어떤 조건에서 문이 열리는가”라는 반복 실행 가능한 규칙과 다르다.

따라서 핵심 질문은 “더 좋은 비디오를 어떻게 만들까?”가 아니라 “프로그래밍 가능한 상태 변화와 시각 생성 사이의 인터페이스를 무엇으로 둘 것인가?”이다.

§2 · Related Work

state를 예측하는 것과 state를 실행하는 것은 다르다

계열대표 예상태 처리논문이 보는 한계 / 차이
Observation-centricLingBot-World, YUME, WorldPlay, ReLIC 등주로 pixel generation과 visual memory에 의존시각적 일관성을 높일 수 있지만 세계 사실이 실행 가능한 canonical state로 조직되지는 않는다.
State-awareStatePlay영상과 game-state variable을 함께 예측state도 모델이 예측하므로 상태 오류가 직접 세계 업데이트 오류가 될 수 있다.
Authoritative shared stateMASStyped shared state를 사용하지만 learned Logic Engine이 전이권위 상태는 명시적이지만 전이 자체가 학습된 dynamics에 의존한다.
Programmable World Model본 논문외부 lightweight engine이 명시적 규칙으로 canonical state를 갱신state를 직접 편집·프로그래밍·검증할 수 있고, video model은 renderer 역할에 집중한다.
Part II · §4-§6

얼마나 명시적으로 표현할 것인가

표현이 약하면 제어가 흐려지고, 너무 강하면 추론 시점에 애니메이션과 물리 시뮬레이션 전체를 직접 해결해야 한다. PWM은 그 사이에 3D OBB를 둔다.

§4 · Representation Spectrum

Prompt에서 완전한 3D scene까지, 제어에는 비용이 붙는다

WEAK / EASY / SMALLSTRONG / HARD / LARGEPrompt2D Box / Mask3D OBBCoarse ProxyFull 3DPWM'S INTERMEDIATE ABSTRACTION

텍스트는 쉽게 작성되지만 world-space geometry를 강제하지 못한다. 2D box와 mask는 이미지 공간에 묶여 카메라가 바뀌면 의미가 흔들린다. 반대로 complete 3D scene, articulated model, dynamic 3D geometry, G-buffer는 정교한 제어를 제공하지만 데이터 감독과 추론 시 구조 생성 비용이 커진다.

§5 · Train–Inference Asymmetry

훈련에서는 ‘이미 일어난 움직임’을 읽고, 추론에서는 ‘아직 일어나지 않은 움직임’을 만들어야 한다

\[\text{Training: realized dynamics}\;\longrightarrow\;\text{structural representation}\]
\[\text{Inference: state transition}\;\longrightarrow\;\text{structural representation}\;\longrightarrow\;\text{generated dynamics}\]

논문의 중요한 통찰은 표현의 복잡도가 단순히 “정밀할수록 좋다”로 정해지지 않는다는 데 있다. 훈련 데이터에서는 실제 동작이 이미 존재하므로 pose·geometry를 추출하면 된다. 그러나 추론에서는 “캐릭터가 쓰러진다” 같은 고수준 상태 변화에서 limb motion과 deformation까지 새로 만들어야 한다. 표현이 지나치게 세밀해질수록 시스템은 사실상 animation·motion generation·physics simulation 문제를 떠안는다.

§6 · State-Augmented 3D OBB

명시적으로 유지할 것은 persistence와 world-space structure다

PWM은 각 개체를 position·extent·orientation을 갖는 3D oriented bounding box로 표현하고 persistent identity, semantic category, dynamic state, appearance 정보를 결합한다. OBB는 view-independent이며 카메라가 움직여도 world coordinate에서 재투영할 수 있다.

반면 shape, texture, material, articulation, local deformation, illumination, secondary motion은 생성형 렌더러에 맡긴다. 이 선택은 “무엇이 바뀌었는지”는 명시적으로 고정하되 “그 변화가 픽셀 수준에서 어떻게 보일지”는 pretrained video prior가 완성하도록 경계를 설정한다.

Part III · §7-§11

프로그램 → 상태 → 제어 → 영상

PWM의 핵심은 비디오 생성기에 더 많은 기억을 넣는 것이 아니라, 세계의 규칙과 상태를 별도의 실행 계층으로 끌어내고 결정론적 compiler로 다시 픽셀 조건에 연결하는 데 있다.

§7 · Formal Loop

상호작용 루프를 네 단계로 분해한다

\[s_t \xrightarrow[\;a_t\;]{F} s_{t+1} \xrightarrow[\;C_{t+1}\;]{P} M^{\mathrm{ctrl}}_{t+1} \xrightarrow{G} I_{t+1}\]

\(F\)는 lightweight engine이 수행하는 상태 전이, \(P\)는 target camera 아래에서 세계 상태를 camera-aligned spatial control로 투영하는 deterministic state compiler, \(G\)는 그 조건을 받아 다음 visual observation을 생성하는 renderer다. 즉, state transition과 image synthesis가 서로 다른 책임으로 분리된다.

§8 · Agent-Orchestrated Box World

자연어를 ‘게임 설명’이 아니라 실행 가능한 world program으로 바꾼다

\[s_t=(E_t,A_t,Q_t;R_t)\]

여기서 \(E_t\)는 persistent entities와 3D poses, \(A_t\)는 semantic·functional attributes, \(Q_t\)는 inter-entity relations, \(R_t\)는 executable world rules다. 초기 이미지 \(I_0\)에서 off-the-shelf 3D detector가 visible entity와 OBB를 추출해 \(E_0\)를 구성하고, VLM 기반 orchestrator가 사용자의 자연어 설명을 바탕으로 속성·관계·지원 행동·규칙·trigger·objective를 작성한다.

World Facts

identity, 3D pose, HP, inventory, faction, hostility, ownership처럼 화면에 직접 보이지 않아도 미래 전이에 영향을 주는 상태를 엔진에 저장한다.

World Rules

행동의 유효성을 검사하고, 효과를 적용하고, 연쇄 event를 해소한다. 예: on_hit → HP 감소, HP=0 → down, 모든 적 패배 → win.

\[s_{t+1}=F(s_t,a_t)\]
§9 · Control Compilation

canonical state를 identity·semantic·direction map으로 컴파일한다

compiler는 world state 자체를 바꾸지 않는다. target camera \(C_{t+1}\) 아래에서 visually relevant state만 골라 투영한다.

\[M^{\mathrm{ctrl}}_{t+1}=P(s_{t+1},C_{t+1})\]
Identity Map

persistent entity id마다 고정 identity slot을 부여한다. 가려졌다가 다시 나타나는 개체도 동일 instance로 연결되도록 한다.

Semantic Map

canonical state의 category label을 pretrained text encoder embedding으로 변환하고 projected OBB 영역에 rasterize한다.

Direction Map

world-space velocity를 camera coordinate로 회전한 뒤 forward/backward/left/right/static/up/down의 7개 상태로 양자화한다.

이 설계에서 direction은 image-space displacement가 아니라 entity 자체의 world-space velocity에서 계산된다. 따라서 카메라가 움직여 정지 물체가 화면에서 이동해 보여도 객체 상태는 static으로 유지된다. 최종 제어는 다음과 같이 결합된다.

\[M^{\mathrm{ctrl}}_{t+1}=\mathrm{Concat}(M^{\mathrm{id}}_{t+1},M^{\mathrm{sem}}_{t+1},M^{\mathrm{dir}}_{t+1})\]
§10 · Generative Renderer

카메라는 backbone이, 개체 상태는 Structured Spatial ControlNet이 맡는다

renderer는 LingBot-World-v1을 기반으로 한다. 기존 camera-conditioning pathway는 target camera trajectory를 담당하고, 새 Structured Spatial ControlNet은 projected-box controls를 처리한다. pretrained main branch와 camera path는 freeze하고 새 spatial-control branch만 학습한다.

\[h_{\mathrm{main}}^{(\ell)} \leftarrow h_{\mathrm{main}}^{(\ell)}+r^{(\ell)}\]
\[I_{1:T}=G_{\theta,\phi}(I_0,C,M^{\mathrm{ctrl}}_{1:T})\]

여기서 \(\theta\)는 frozen backbone, \(\phi\)는 trainable spatial-control branch다. geometry·identity·semantic·motion constraint는 외부에서 들어오지만 object shape, texture, material, articulation, lighting, secondary motion은 video prior가 생성한다.

§11 · Architecture View

세계모델을 ‘추론 모델’이 아니라 컴파일러가 낀 실행 시스템으로 볼 수 있다

WORLD PROGRAMMINGCONTROL COMPILATIONGENERATIVE RENDERINGCoding AgentNL SPEC → RULES + ATTRIBUTESVALIDATE ACTIONAPPLY RULESRESOLVE EVENTSState Compiler3D OBB + TARGET CAMERAID · SEM · DIR MAPSVideo Backbone + ControlNetCAMERA + STRUCTURED CONTROLSTEMPORAL HISTORYSPATIAL MEMORYCOMPLETED CHUNKS UPDATE MEMORY; ENGINE REMAINS AUTHORITY
Part IV · §12-§14

긴 시간과 데이터의 문제

명시적 state가 논리적 기억을 맡더라도, 화면의 appearance를 오래 유지하려면 visual memory가 필요하다. 또한 OBB·identity·semantic·motion annotation을 대규모로 확보해야 한다.

§12 · Chunk-Autoregressive Rendering

논리 상태와 시각 기억은 서로 다른 층에서 유지된다

고정 길이 chunk 내부의 denoising은 bidirectional이지만 chunk 간 정보는 causal하게 전달된다. 첫 chunk는 \(I_0\)에서 시작하고, 이후 chunk는 temporal history와 geometry-aligned spatial memory를 추가 조건으로 받는다.

\[I^{(n)}=G_{\theta,\phi,\psi}\!\left(C^{(n)},M^{\mathrm{ctrl},(n)},H^{(n)}_{\mathrm{temp}},H^{(n)}_{\mathrm{spa}}\right),\quad n\ge 2\]
Temporal History

recent·mid-range·long-range latent를 서로 다른 해상도로 보존한다. initial observation \(I_0\)는 persistent anchor로 유지한다. 학습 시 history를 noise·feature corruption·partial dropping으로 열화시켜 autoregressive 오류에 대한 내성을 학습한다.

Spatial Memory

완료된 RGB frame을 estimated depth와 camera parameter로 world-space memory에 lift한다. 새 시점에 필요한 과거 관찰을 검색하고 target view로 reproject해 spatial latent token으로 넣는다.

§13 · Automatic Data Engine

in-the-wild video에서 renderer용 구조 감독을 자동 복구한다

  1. ViPE: camera intrinsics, camera pose, metric depth를 추정해 shared world coordinate를 만든다.
  2. Qwen3-VL: global caption과 discrete/countable object category를 발견해 semantic vocabulary를 만든다.
  3. SAM3: video instance segmentation과 tracking으로 mask, 2D box, semantic label, persistent track identity를 얻는다.
  4. WildDet3D: RGB·depth·intrinsics·2D box를 이용해 per-frame 3D OBB를 추정한다.
  5. World-space trajectory: camera pose로 OBB를 world coordinates에 정렬하고 track별 trajectory를 구성한다.
  6. Motion quantization: consecutive box center displacement에서 camera motion을 제거하고 7개 direction state로 양자화한다.
  7. Rasterization: projected OBB와 z-buffer로 identity·semantic·direction conditioning map을 생성한다.

즉 학습 데이터의 핵심은 “영상 자체”가 아니라 영상에서 복구한 camera geometry + persistent identity + semantics + world-space motion이다.

§14 · Training Data

게임 영상은 구조가 분명한 세계 상태를 학습하기 위한 출발점이다

훈련 데이터는 HUD를 제거한 Cyberpunk 2077, Forza Horizon 6, Grand Theft Auto V gameplay video로 구성된다. Cyberpunk 2077은 first-person, Forza Horizon 6와 GTA V는 다양한 camera viewpoint의 third-person footage를 사용하며, 앞서 설명한 Data Engine으로 paired video-control training data로 변환한다.

Part V · §15-§19

CombatStateBench: 영상이 엔진의 사실을 따르는가

PWM은 visual plausibility와 world-state faithfulness를 구분해 평가한다. 핵심 숫자는 화질보다 count와 state에 있다.

§15 · Benchmark

50개 combat clip에서 상태-영상 일치도를 측정한다

CombatStateBench는 50개 clip으로 구성된다. 초기 프레임에서 3D layout, entity, OBB, semantic attribute, camera parameter를 복구하고, AI agent가 game rule에 따라 짧은 combat scenario의 box-based world-state sequence를 자율적으로 전개한다. 카메라·개체 운동을 다양화하고, 처음 화면 밖에 있던 개체의 진입도 포함한다. death event가 발생하면 해당 상태는 이후 scene에 지속된다.

automatic verifier는 initial-frame reprojection, metric depth consistency, box geometry, ground contact, temporal continuity, prescribed camera/entity motion, state-transition persistence를 검사하며 모든 검사를 통과한 sequence만 평가에 사용한다.

§16 · Baselines & Judge

기존 모델은 prompt switching으로 상태 변화를 전달한다

baseline은 LingBot-World-V2YUME다. 두 모델은 external instance-level state interface를 제공하지 않으므로, 연구진은 native conditioning pathway를 유지하면서 state transition이 생길 때마다 텍스트 조건을 {environment description}. {action description}. 형태로 바꾸는 prompt-switching 방식으로 비교한다.

VLM judge는 Qwen3.6-27B다. judge는 생성된 RGB frame만 보고 ground-truth box, character identity, expected count, death location 같은 privileged annotation은 받지 않는다.

§17 · Metrics

Count Accuracy와 State Accuracy는 일부러 ‘관대한’ 전역 지표다

Count Accuracy는 clip당 무작위 8 frame, 총 400 frame에서 visible alive character 수가 engine count와 정확히 일치하는지 본다.

\[\mathrm{CountAcc}=\frac{1}{N}\sum_{i=1}^{N}\mathbf{1}[\hat n_i=n_i^{\mathrm{eng}}]\]

State Accuracy는 50개 death event 각각에서 transition 이후 3 frame을 뽑아, 적어도 한 frame에서 dead character가 시각적으로 나타나는지 검사한다.

\[\mathrm{StateAcc}=\frac{\text{visually realized death events}}{\text{total death events}}\]

논문은 이 지표들이 특정 instance가 정확히 죽었는지나 death location이 맞는지를 요구하지 않는 coarse global metric이라고 명시한다. 즉 결과가 높아도 instance-level correspondence 전체를 검증한 것은 아니다.

§18 · Quantitative Results

world-state consistency에서 격차가 크게 벌어진다

Table 1 · Video quality and world-state evaluation on 50 CombatStateBench clips · %

MethodImagingSubject Cons.Background Cons.Temporal StabilityCount AccuracyState Accuracy
LingBot-World-V267.4681.8791.8996.8540.758.00
YUME64.1092.3593.6398.7632.0058.00
PWM (Ours)67.6294.7496.9899.0094.0098.00

Count Accuracy: 400 sampled frames (8 per clip). State Accuracy: 50 death events, 3 post-transition frames per event. VBench metrics are also reported as percentages.

94%
Count Accuracy
+53.25pp vs LingBot-World-V2
98%
State Accuracy
+90pp vs LingBot-World-V2
94.74
Subject Consistency
best among compared methods
99.00
Temporal Stability
VBench temporal-flickering score

PWM은 Imaging Quality에서도 67.62로 가장 높고, Subject Consistency 94.74, Background Consistency 96.98, Temporal Stability 99.00을 기록한다. 논문의 가장 강한 결과는 그러나 world-state metrics다. Count Accuracy는 LingBot-World-V2보다 53.25 percentage point, YUME보다 62.00 point 높고, State Accuracy는 각각 90.00, 40.00 point 높다.

§19 · Qualitative Results

카메라가 돌아가도 화면 밖 세계가 사라지지 않는다

Figure 4에서 prompt-switching baseline은 action에 그럴듯하게 반응해도 살아 있어야 할 character가 사라지거나, killed character가 계속 움직이거나, event 없이 visible count가 바뀌는 실패를 보인다. PWM은 engine-maintained state를 더 안정적으로 반영한다.

Figure 5의 추가 사례는 다섯 종류의 범위를 보여준다. (a) novel minotaur scene에서 dynamic camera와 entity motion, (b) 큰 각도의 camera rotation 뒤 initial view 뒤쪽의 세 character가 다시 나타나는 상황, (c) racing genre, (d) human과 vehicle의 heterogeneous rendering, (e) 많은 NPC가 점진적으로 진입하는 897-frame autoregressive sequence다. 논문은 이 사례들이 camera motion, spatial layout, entity state를 일관되게 따르는 정성 증거라고 제시한다.

Part VI · §20-§22

이 결과가 실제로 말하는 것

PWM의 새로움은 “더 큰 video model”이 아니다. 권위 있는 사실을 생성 모델 밖으로 꺼내고, 그 사실을 다시 시각 생성에 컴파일하는 시스템 경계에 있다.

§20 · Interpretation

state는 실행하고, appearance는 생성한다

PWM이 제안하는 세계모델은 하나의 거대한 신경망이 모든 것을 암묵적으로 기억하는 구조와 다르다. world truth는 canonical state에, world appearance는 generative prior에 둔다. 이 분리는 HP·inventory·relation·objective처럼 픽셀에서 직접 보이지 않는 사실을 명시적으로 유지할 수 있게 하고, 자연어로 규칙을 수정해도 시각 생성 backbone을 다시 학습할 필요가 없게 한다.

특히 deterministic compiler가 camera projection과 entity-to-pixel correspondence를 해결한다는 점이 중요하다. 이것은 구조 정보와 영상 생성 사이를 “자연어 prompt”가 아니라 계산 가능한 중간 표현으로 연결한다.

§21 · What Is Not Proven

강한 수치가 곧 완전한 물리 세계 시뮬레이터를 의미하지는 않는다

논문의 실험 범위를 벗어나지 않고 읽으면 몇 가지 경계가 분명하다.

  • CombatStateBench는 50개 combat clip에 집중하며, 핵심 state metric도 visible alive count와 death-state realization이라는 제한된 속성을 본다.
  • Count/State Accuracy는 의도적으로 permissive한 global metric이다. 특정 instance의 정확한 identity correspondence, 정확한 death location, 복잡한 causal interaction을 직접 채점하지 않는다.
  • baseline은 external instance-level state interface가 없기 때문에 prompt switching으로 비교된다. 따라서 결과는 “명시적 state interface가 있는 시스템 vs 없는 시스템”의 구조 차이까지 포함한다.
  • world program을 만드는 coding agent의 정확도·안전성·rule synthesis failure rate는 별도 정량 평가가 제시되지 않는다.
  • 3D OBB는 coarse structure다. 세밀한 충돌, articulated contact, 물리 법칙 준수 자체를 보장하는 representation은 아니다.
  • 897-frame 사례는 긴 rollout 가능성을 보여주는 정성 예시이지, 모든 장기 조건에서의 오류 누적률을 정량적으로 입증한 것은 아니다.

따라서 이 논문의 가장 안전한 결론은 “명시적 상태와 렌더링의 분리가 모든 세계모델 문제를 해결했다”가 아니라, state consistency라는 특정 난제를 강하게 개선하는 유효한 시스템 분해를 제시했다는 것이다.

§22 · Research Directions

다음 단계는 더 큰 비디오 모델보다 더 풍부한 ‘실행 가능한 세계 사실’일 수 있다

Richer State Semantics

inventory, ownership, quest graph, social relation, object affordance, long-term objective처럼 비시각 변수를 더 넓은 typed schema로 확장할 수 있다.

Verifiable Rule Systems

coding agent가 생성한 rule을 schema/type checker, invariant, rollback, audit log와 연결하면 자연어 프로그래밍의 오류를 더 직접적으로 다룰 수 있다.

Hybrid Physics

OBB를 유지하되 contact·collision·rigid-body constraint처럼 반드시 명시적으로 지켜야 하는 물리만 lightweight simulator로 옮기는 하이브리드가 가능하다.

Harder Benchmarks

instance identity, object permanence, multi-step causal chains, hidden state, multiplayer consistency, non-combat tasks를 포함하는 benchmark가 필요하다.

이 절의 항목들은 논문의 구조와 실험 범위에서 도출한 후속 연구 제안이며, 원 논문이 직접 검증한 결과는 아니다.

Part VII · §23-§24

한 문장으로 정리하면

PWM은 world model의 중심을 “미래 픽셀 예측”에서 “실행 가능하고 검증 가능한 세계 상태 + 생성형 관찰”의 결합으로 이동시킨다.

§23 · Key Takeaways

논문을 다 읽고 남겨야 할 일곱 문장

  1. interactive video generation이 곧 persistent world modeling은 아니다.
  2. PWM은 world-state evolution과 visual observation generation을 분리한다.
  3. coding agent는 자연어를 entity state와 executable rule을 포함한 world program으로 변환한다.
  4. state-augmented 3D OBB는 explicit control과 inference tractability 사이의 중간 표현이다.
  5. deterministic compiler는 OBB를 target camera에 맞춘 identity·semantic·direction map으로 바꾼다.
  6. CombatStateBench에서 PWM은 Count Accuracy 94%, State Accuracy 98%를 기록해 두 baseline보다 큰 폭으로 높다.
  7. 이 연구의 가장 중요한 설계 명제는 “세계의 사실은 실행·검증하고, 외형은 생성한다”는 분리 원칙이다.
§24 · Source Links

원문과 구현

References

원 논문이 인용한 연구

아래는 논문의 References 24편을 웹 읽기용으로 정리한 목록이다.

[01]
Qwen3-VL Technical Report
Bai et al. · arXiv:2511.21631 · 2025
[02]
Genie 3: A New Frontier for World Models
Ball et al. · 2025
[03]
MASS: Multiplayer World Models with Authoritative Shared State
Cai et al. · 2026
[04]
SAM 3: Segment Anything with Concepts
Carion et al. · 2025
[05]
Infinite Worlds with Versatile Interactions
Gao et al. · arXiv:2607.07534 · 2026
[06]
Coarse-to-Real: Generative Rendering for Populated Dynamic Scenes
Gomez-Nogales et al. · arXiv:2601.22301 · 2026
[07]
LTX-Video: Realtime Video Latent Diffusion
HaCohen et al. · arXiv:2501.00103 · 2024
[08]
ReLIC: Interactive Video World Model with Long-Horizon Memory
Hong et al. · 2025
[09]
ViPE: Video Pose Engine for 3D Geometric Perception
Huang et al. · arXiv:2508.10934 · 2025
[10]
WildDet3D: Scaling Promptable 3D Detection in the Wild
Huang et al. · 2026
[11]
Generative World Renderer
Huang et al. · arXiv:2604.02329 · 2026
[12]
DiffusionRenderer: Neural Inverse and Forward Rendering with Video Diffusion Models
Liang et al. · CVPR · 2025
[13]
Generative World Renderer at the Speed of Play
Lin et al. · 2026
[14]
StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation
Lin et al. · 2026
[15]
YUME: An Interactive World Generation Model
Mao et al. · arXiv:2507.17744 · 2025
[16]
WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling
Sun et al. · arXiv:2512.14614 · 2025
[17]
AlayaWorld: Interactive Long-Horizon World Modeling — Full Technical Report
Alaya Team et al. · arXiv:2607.18367 · 2026
[18]
Advancing Open-Source World Models
R. Team et al. · arXiv:2601.20540 · 2026
[19]
Wan: Open and Advanced Large-Scale Video Generative Models
Wan et al. · arXiv:2503.20314 · 2025
[20]
Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory
Wang et al. · 2026
[21]
VLIPP: Towards Physically Plausible Video Generation with Vision and Language Informed Physical Prior
Yang et al. · ICCV · 2025
[22]
WorldKV: Efficient World Memory with World Retrieval and Compression
Yi et al. · 2026
[23]
RenderFormer: Transformer-Based Neural Rendering of Triangle Meshes with Global Illumination
Zeng et al. · SIGGRAPH · 2025
[24]
VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness
Zheng et al. · arXiv:2503.21755 · 2025