AI Research Blog·World Models × VLA2026 · 09 · 16
Physical AI Architecture·Prediction vs Action·Mission Assurance

행동하는 모델과
미래를 상상하는 모델

World Models vs Vision-Language-Action Models: Prediction, Action, and Safety in Physical AI

VLA · WHAT SHOULD I DO?Vision+ LanguageVLA PolicyActionWORLD MODEL · WHAT WILL HAPPEN IF I DO IT?State +Candidate ActionWorld ModelFuture States+ UncertaintyMISSION PHYSICAL AISafety KernelRisk → Authority → Execute
Central Distinction

World Model과 Vision–Language–Action(VLA) 모델은 모두 피지컬 AI의 핵심 구성요소지만 같은 일을 하지 않는다. VLA가 “지금 무엇을 할 것인가”를 직접 생성한다면, World Model은 “그 행동을 하면 앞으로 어떤 일이 일어날 것인가”를 예측한다.

자동차에 비유하면 VLA는 운전행동을 선택하는 정책에 가깝고, World Model은 “지금 차선을 바꾸면 앞차와의 거리와 충돌위험이 어떻게 변할까”를 내부적으로 시험하는 예측모델에 가깝다. 이 비유는 역할을 이해하는 데 유용하지만, 실제 시스템에서는 두 기능이 하나의 모델 안에 부분적으로 결합될 수도 있다.

국가미션형 Physical AI에서는 VLA와 World Model을 경쟁기술로 보는 것보다 행동 후보 생성과 미래 결과 예측이라는 상호보완적 기능으로 분리해 보는 편이 더 정확하다.Conceptual synthesis grounded in the Mission-Oriented Physical AI source
Part I · §1-§2

같은 세계를 다루지만 질문이 다르다

둘 다 현실을 관찰하고 행동과 연결되지만, VLA는 policy에, World Model은 dynamics prediction과 planning에 더 가깝다.

§1 · Shared Ground

유사점: 현실세계·행동·일반화 문제를 함께 가진다

첫째, 둘 다 단순한 텍스트 AI가 아니라 현실세계 상태를 다뤄야 한다. 물체 위치, 공간관계, 사람, 장비상태, 위험구역 같은 정보가 행동결정에 들어간다.

둘째, 둘 다 행동과 연결된다. VLA는 action을 직접 출력하고, World Model은 여러 action의 결과를 예측하여 어떤 action을 선택할지 돕는다.

셋째, 둘 다 훈련에 없던 환경·날씨·장비·시점·물체에서 일반화가 깨질 수 있으며 Sim-to-Real 간극의 영향을 받는다. Mission-Oriented Physical AI 원문 역시 VLA의 개방세계 일반화와 세계모델의 실제 물리 동역학 예측을 별도 난제로 제시한다.

넷째, 국가미션처럼 실패비용이 큰 환경에서는 어느 하나를 단독으로 신뢰하기 어렵다. 원문이 제안하는 Foundation Model + Knowledge/Rules + Physics Model + Verified Controller 구조는 유연한 생성모델과 예측가능한 안전·제어 계층을 분리한다.

§2 · Side-by-Side

핵심 차이를 한 표로 보면

관점VLAWorld Model
핵심 질문무엇을 할 것인가?하면 어떤 일이 일어날 것인가?
주요 입력Vision + Language현재 상태 + 행동
주요 출력Action / robot command미래 상태 또는 미래 상태의 분포
주 역할행동정책예측·시뮬레이션·계획
시간 관점현재 행동 중심여러 step의 미래 중심
물리 인과성직접 보장되지 않을 수 있음정확한 개입결과 예측에 매우 중요
불확실성행동 확신도 등을 표현할 수 있음미래 상태 uncertainty가 핵심
안전 사용법행동후보 생성행동 전 위험예측
대표 실패지시를 잘못 해석하거나 위험행동 생성미래를 잘못 예측하면서 과신
Part II · §3-§4

VLA: 언어적 목적을 물리적 행동으로 변환한다

VLA의 강점은 open-vocabulary perception과 자연어 지시를 action policy에 직접 연결하는 데 있다.

§3 · Vision–Language–Action

Vision + Language → Action

\[\text{Vision}+\text{Language}\rightarrow\text{Action}\]

Source factMission-Oriented Physical AI 원문은 2025년 이후 VLA가 영상과 언어지시를 입력받아 직접 robot action을 생성하면서 task-specific policy를 보다 범용적인 robot agent로 확장하는 흐름을 설명한다.

예를 들어 카메라가 테이블 위 빨간 컵을 보고 사용자가 “빨간 컵을 오른쪽 선반에 올려라”라고 말하면, VLA는 팔의 이동방향, gripper의 개폐 시점, trajectory에 해당하는 action을 생성한다.

따라서 VLA의 핵심 강점은 “언어적 목적을 실제 행동으로 바꾸는 것”이다.

§4 · Correlation Is Not Physics

행동을 잘 생성한다고 물리법칙을 이해하는 것은 아니다

VLA는 대규모 demonstration에서 “이 장면 + 이 지시 → 이 행동”의 패턴을 학습할 수 있다. 그러나 이 성공만으로 질량, 마찰, 충돌, 변형, 반사실적 결과를 안정적으로 이해한다고 결론내릴 수는 없다.

원문이 인용하는 Physical AI 연구도 이미지 패턴 인식과 질량·마찰·충돌·변형·인과관계를 이해하는 능력은 구분해야 한다고 강조한다.

Part III · §5-§6

World Model: 행동하기 전에 미래를 내부적으로 시험한다

World Model은 현재 상태와 후보 행동으로부터 가능한 미래와 불확실성을 예측하여 planning과 risk comparison에 사용한다.

§5 · State–Action–Future

현재 상태와 행동에서 미래 상태분포로

현재 상태를 \(s_t\), 행동을 \(a_t\)라고 두면 World Model의 역할은 다음처럼 표현할 수 있다.

\[p(s_{t+1:t+H}\mid s_t,a_{t:t+H-1})\]

Source factMission-Oriented Physical AI 원문은 World Model이 단일 미래가 아니라 가능한 미래의 분포와 uncertainty를 예측해야 하며, 위험도가 높을 때 행동을 거부하거나 추가 관측을 요구할 수 있어야 한다고 설명한다.

로봇이 무거운 상자를 밀려고 한다면 World Model은 상자가 얼마나 움직일지, 미끄러질지, 넘어질지, 사람과 충돌할 가능성이 있는지, 바닥 마찰이 달라졌을 때 결과가 어떻게 바뀌는지를 예측하는 데 쓰일 수 있다.

따라서 World Model은 직관적으로 “행동하기 전에 머릿속에서 먼저 실행해 보는 모델”로 이해할 수 있다.

§6 · Intervention & Counterfactual

미래 영상을 만드는 것보다 행동결과를 비교하는 것이 중요하다

World Model의 중요한 질문은 “다음 화면이 어떻게 보이는가”만이 아니다. 힘을 10N에서 20N으로 바꾸면, 속도를 절반으로 줄이면, 바닥 마찰이 낮아지면, 로봇 한 대가 고장나면 결과가 어떻게 달라지는지를 예측해야 한다.

Analysis국가미션형 Physical AI에서 이 능력은 observation prediction보다 intervention과 counterfactual을 이용한 위험비교에 더 직접적인 가치를 가진다.

Part IV · §7-§9

안전은 VLA의 설명이나 World Model의 예측만으로 보장되지 않는다

행동 생성, 미래 예측, 허용 여부 판단, 실제 제어를 분리해야 위험인식과 안전행동 사이의 간극을 줄일 수 있다.

§7 · VLA-Only Risk

위험을 말로 인식해도 안전하게 행동하지 않을 수 있다

원문이 인용하는 AGENTSAFE의 핵심 경고는 간단하다.

\[\text{hazard recognition}\not\Rightarrow\text{safe action}\]

모델이 “앞에 사람이 있으므로 위험하다”고 언어적으로 설명한다고 해서 실제 action policy가 반드시 정지하는 것은 아니다. 따라서 안전성은 최종 결과뿐 아니라 지각–계획–실행 전 과정에서 평가해야 한다.

이 때문에 Mission-Oriented Physical AI에서는 VLA를 최종 권한자로 두기보다 행동후보를 제안하는 계층으로 보는 설계가 더 보수적이다.

§8 · World-Model-Only Limit

예측모델만으로 임무를 수행할 수는 없다

반대로 World Model만 있다고 로봇이 자연어 목표를 해석하고, 객체를 찾고, 어떤 skill을 사용할지 선택하고, motor command를 생성하는 문제가 자동으로 해결되지는 않는다.

즉 World Model과 VLA는 경쟁기술이라기보다 prediction과 policy라는 서로 다른 기능을 담당하는 상호보완적 기술이다.

§9 · Integrated Stack

행동후보 → 미래예측 → 위험판정 → 검증된 실행

Mission / Human intent ↓ VLA / Planner ↓ Candidate Actions ↓ World Model ↓ Predicted Future + Uncertainty ↓ Risk / Outcome Evaluation ↓ Safety Kernel ↓ Verified Controller ↓ Physical Action

쉽게 말하면 VLA는 행동을 제안하고, World Model은 그 행동의 미래를 상상하며, Safety Kernel은 그 미래가 허용 가능한지 판단하고, Controller가 실제로 행동한다.

이 역할분담은 원문이 제안한 Mission–Deliberative–Skill–Safety–Assurance 계층구조와 같은 방향이다.

Part V · §10-§12

국가미션에서는 World Model의 비중이 더 커진다

일반 manipulation에서는 task success가 핵심일 수 있지만, 재난·원전·우주·인프라 임무에서는 행동이 가져올 장기 결과와 최악조건을 사전에 비교해야 한다.

§10 · From Task to Mission

“컵을 옮겼는가?”와 “문을 열어도 되는가?”는 다른 문제다

일반 manipulation benchmark에서는 “컵을 옮겼는가?”가 핵심일 수 있다. 국가 재난 대응에서는 “이 문을 열면 화염이나 독성가스가 확산되는가?”, “이 드론 경로에서 통신이 끊길 가능성은 얼마인가?”, “UGV 하나가 고장나면 나머지 로봇으로 임무를 재구성할 수 있는가?”가 더 중요할 수 있다.

이런 질문에서는 action generation보다 future consequence prediction과 uncertainty-aware planning의 비중이 커진다.

§11 · Mission-Oriented Roles

VLA = 행동 인터페이스, World Model = 예측·계획, Safety = 실행권한 통제

VLA

언어와 시각을 행동으로 연결한다. 개방어휘 지시와 복합 장면에 대한 행동후보 생성에 강점을 가진다.

World Model

상태와 행동이 미래에 미치는 결과와 uncertainty를 예측한다. planning과 risk comparison의 기반이 된다.

Safety / Assurance

법률·권한·충돌·위험조건에 따라 행동을 차단하거나 축소하고, 실행근거를 기록한다.

Verified Controller

허용된 action을 실제 actuator command로 실행하면서 속도·힘·접근금지 등 hard constraint를 지킨다.

§12 · One-Sentence Summary

한 문장으로 정리하면

VLA는 “세계를 보고 지시를 이해해 무엇을 할지 결정하는 모델”이고, World Model은 “그 행동을 했을 때 세계가 어떻게 변할지를 내부적으로 시뮬레이션하는 모델”이다.
\[\boxed{\text{VLA}\approx\text{Perception-to-Action}}\]
\[\boxed{\text{World Model}\approx\text{State + Action-to-Future}}\]

국가미션형 Physical AI에서 더 중요한 것은 둘 중 하나를 선택하는 것이 아니라 다음과 같은 통합이다.

\[\boxed{\text{VLA}+\text{Causal World Model}+\text{Mission Planner}+\text{Safety Kernel}+\text{Assurance}}\]

궁극적으로는 “더 큰 VLA를 로봇에 탑재하는 것”보다 행동생성·미래예측·권한통제·검증가능한 실행을 하나의 임무체계로 결합하는 것이 국가미션형 Physical AI의 핵심이다.

References

근거 문헌

이 글은 Mission-Oriented Physical AI 원문의 비교·분석을 웹 문서로 재구성했으며, 아래 문헌은 해당 원문에서 직접 연결한 근거다.

[01]
Li et al. · 2025
Vision과 language instruction을 robot action에 연결하는 VLA 흐름을 정리한다.
[02]
Xiang et al. · 2025/2026
Physical AI를 perception, physical reasoning, world modeling, embodied interaction의 연결로 분석하고 물리적 인과이해의 간극을 강조한다.
[03]
Kirchner et al. · 2026
World Model의 uncertainty representation과 control 결합을 Physical AI의 핵심 문제로 다룬다.
[04]
Ying et al. · 2025
hazard recognition이 safe action을 자동으로 보장하지 않는다는 안전성 간극을 분석한다.