“범용 피지컬 AI 플랫폼”은 하나의 거대한 VLA 모델과 같은 말이 아니다. 2025~2026년 연구를 함께 보면 범용성의 단위가 모델에서 시스템으로 이동한다. 다양한 몸체와 환경을 연결하는 foundation policy, 행동 결과를 미리 상상하는 world model, embodiment adapter, real-time controller, lifelong learning, 독립 safety layer가 하나의 폐루프로 결합되어야 한다.
현재 학계에는 “General-Purpose Physical AI Platform”이라는 단일 표준용어가 정착되어 있지 않다. 관련 연구는 Physical AI, Embodied AI, Robot Foundation Model, Vision-Language-Action Model, World Model, Behavior Foundation Model 등으로 분산되어 있다. 이 글은 2025년 이후의 대표 연구를 한데 묶어 플랫폼 관점의 통합 정의와 연구의제로 재구성한다.
범용성의 목표는 “하나의 로봇”이 아니라 재사용 가능한 지능 기반이다
Task success 하나를 높이는 것이 아니라 task·environment·embodiment를 가로질러 지능을 재사용하면서 adaptation·latency·risk 비용을 낮추는 것이 플랫폼의 문제다.
General-Purpose Physical AI Platform
Synthesis범용 피지컬 AI 플랫폼은 특정 로봇이나 특정 작업에 종속되지 않고, 다양한 embodiment·작업·환경·사용자 명령을 공통 지능 코어와 표준화된 인터페이스로 연결해 관찰–예측–계획–행동–검증–학습을 반복하는 Physical AI 실행 기반으로 정의할 수 있다.
VLA / Foundation Policy
Vision과 Language를 행동으로 연결하는 generalist policy layer다.
World Model
행동을 실행하기 전에 가능한 미래상태와 위험을 예측한다.
Embodiment + Control
공통 지능을 로봇별 kinematics·actuator·control loop로 변환한다.
Learning + Safety
현장경험을 축적하되 검증·uncertainty·human override를 통해 위험을 통제한다.
VLA는 플랫폼의 핵심 policy layer일 수 있지만 플랫폼 전체는 아니다. 새로운 body로의 adaptation, predictive world modeling, real-time control, safety validation, data lifecycle까지 포함되어야 한다.
새로운 몸체에서도 적은 비용으로 안전하게 재사용되는가
진짜 질문은 “자연어 명령에서 action을 생성할 수 있는가?”보다 강하다. 한 환경·한 로봇·한 작업에서 얻은 능력을 새로운 환경·새로운 물체·새로운 작업·다른 로봇 몸체에도 최소한의 데이터와 통합작업으로 옮길 수 있는가가 핵심이다.
여기서 목표는 robot embodiment \(b\), 목표 \(g\), observation history \(o_{\le t}\)에 대해 적절한 action을 고르는 것뿐 아니라, world model로 행동의 미래결과도 예측하는 것이다.
따라서 플랫폼의 목적은 success rate만 최대화하는 것이 아니라 adaptation cost, latency, risk를 동시에 줄이는 문제로 볼 수 있다.
특히 2026년 The Embodiment Gap in Robot Foundation Models는 benchmark generalization과 실제 target robot deployment 사이에 별도의 통합비용이 남을 수 있음을 강조한다. “일반화 점수가 높다”와 “범용 플랫폼이다”는 같은 명제가 아니다.
2025~2026: Model Generality에서 Platform Generality로
GR00T N1, Gemini Robotics, π0.5는 generalist robot policy의 가능성을 보여줬다. 그 다음 단계는 cross-embodiment adaptation, world prediction, latency, safety, lifelong deployment를 하나의 운영층으로 결합하는 것이다.
범용 플랫폼을 이루는 열 개의 연구축
| 개념 | 의미 | 대표 연구 흐름 |
|---|---|---|
| Robot Foundation Model | 대규모 heterogeneous robot data에서 재사용 가능한 지능을 학습 | GR00T N1 |
| Vision-Language-Action | Vision + Language를 직접 Action으로 연결 | Gemini Robotics, π0.5 |
| Embodied Reasoning | 공간·시간·물체·affordance를 행동 가능한 형태로 추론 | Gemini Robotics-ER 계열 |
| World Model | 행동 뒤의 미래상태와 위험을 예측 | Physical-AI World Model |
| Cross-Embodiment Learning | 서로 다른 robot body 간 지식 공유 | X-VLA, Embodiment Gap |
| Behavior Foundation Model | humanoid whole-body primitive와 behavioral prior를 사전학습 | BFM survey |
| Long-Horizon Skill Composition | 짧은 skill들을 장기목표에 맞게 조합 | π0.5, VLA-Arena |
| Sim-to-Real / Real-to-Sim | simulation과 현실 사이의 domain gap 완화 | Physical AI literature |
| Efficient Edge Inference | 저지연·경량 action generation | OpenVLA-OFT, SmolVLA |
| Safety & Assurance | 위험 명령·오동작·불확실성을 실행 전후 통제 | AGENTSAFE, VLA-Arena |
행동을 고르는 능력과 행동의 결과를 상상하는 능력
VLA
현재 perception과 language goal을 받아 “무엇을 할 것인가?”를 결정한다.
World Model
현재 state와 candidate action을 받아 “그 행동 뒤에 세계가 어떻게 변할 것인가?”를 예측한다.
범용 플랫폼은 두 역할을 결합해야 한다. 행동 생성과 미래결과 예측을 분리하면 candidate action을 실행 전에 평가하고 위험한 경로를 차단할 수 있다.
Generalist robot model의 가능성이 구체화됐다
GR00T N1
GR00T N1은 humanoid를 위한 open foundation model로 소개되며, vision-language module과 diffusion-transformer action module을 결합하고 real robot trajectory, human video, synthetic data를 함께 사용한다. 다양한 embodiment를 고려한 generalist humanoid foundation model의 대표 사례다.
Gemini Robotics
Gemini Robotics는 VLA와 embodied reasoning을 결합하고 object·position·environment·open-vocabulary instruction에 대한 일반화를 다룬다. 추가 fine-tuning을 통해 새로운 embodiment에 적응하는 방향도 포함한다.
π0.5
π0.5는 여러 robot data와 semantic prediction, web data 등을 co-training하여 open-world generalization을 강화한다. 학습하지 않은 새로운 가정 환경에서 kitchen·bedroom cleaning과 같은 long-horizon manipulation을 수행했다고 보고한다.
Analysis이후의 연구질문은 Model Generality → Platform Generality로 이동한다. 모델 하나의 범용성보다 deployment·adaptation·control·safety까지 포함한 시스템 범용성이 중요해진다.
물리세계의 오류는 다시 생성하기 어렵다
언어모델의 잘못된 문장은 다시 생성할 수 있지만, 로봇의 잘못된 action은 물체 파손, 충돌, 작업 실패, 인명위험으로 이어질 수 있다. Physical AI에서는 sensing, morphology, mechanics, control이 지능의 성능과 안전성에 직접 관여한다.
Nature Machine Intelligence의 2025 robotics roadmap은 diverse task/environment data, robot-platform transfer, human–robot collaboration, explainability, lifelong learning, safe deployment, sustainability를 장기 핵심과제로 제시한다.
범용성을 무너뜨리는 것은 모델 크기가 아니라 경계조건이다
Embodiment gap, memorization, long-horizon compounding, predictive uncertainty, latency, safety가 실제 플랫폼의 일반화를 제한한다.
공통 의미공간과 실행 가능한 제어공간은 다르다
robot arm, humanoid, mobile manipulator는 joint 수, actuator, gripper, sensor, control frequency가 모두 다르다. 의미적·시각적 지식을 공유해도 target robot에서 바로 실행 가능한 controller가 생기는 것은 아니다.
따라서 범용성의 핵심은 모든 body를 억지로 하나의 action space로 정규화하는 것이 아니라, 공통 인지·추론을 공유하고 몸체 특이성은 명시적인 adapter에서 흡수하는 것이다.
짧은 조작 성공과 open-world generalization은 다르다
VLA-Arena는 manipulation task를 Safety, Distractor, Extrapolation, Long Horizon 등의 관점으로 평가하며, 현 VLA가 memorization over generalization, safety constraint 무시, long-horizon skill composition의 약점을 보일 수 있음을 드러낸다.
“컵을 잡아라”와 “주방을 정리하고 식탁을 차린 뒤 위험한 물체를 치워라”는 다른 문제다. 후자는 hierarchical planning과 skill composition을 필요로 한다.
VLA가 action을 생성해도 물리결과를 충분히 이해한다는 뜻은 아니다
World-model 연구에서 long-horizon prediction은 compounding error, planner exploitation, uncertainty calibration, physical constraint enforcement, rollout horizon 문제를 동반한다. 실제 플랫폼은 semantic competence와 physical causality 사이의 간극을 줄여야 한다.
Token generation만으로 robot control loop를 닫을 수는 없다
OpenVLA-OFT는 parallel decoding, action chunking, continuous action representation 등을 결합해 LIBERO에서 OpenVLA의 평균 success rate를 76.5%에서 97.1%로 높이고, action-generation throughput을 26배 높였다고 보고한다.
SmolVLA는 perception/action prediction과 action execution을 비동기화하는 방향과 consumer GPU·CPU 배치를 목표로 한다. 이 흐름은 foundation reasoning과 low-level control을 시간계층적으로 분리해야 함을 보여준다.
위험을 인지한다고 안전하게 행동하는 것은 아니다
AGENTSAFE는 hazardous instruction을 이용해 perception–planning–execution 전 과정을 평가한다. CVPR 2026 버전은 45개 adversarial scenario와 1,350개 hazardous task를 포함한다.
위험성을 언어적으로 설명할 수 있는 모델이 실제 action 단계에서 안전제약을 지킨다는 보장은 없다. 따라서 safety는 prompt-level instruction이 아니라 독립 verification과 action gating을 필요로 한다.
범용 Physical AI를 평가하려면 성공률 밖의 질문이 필요하다
새로운 robot body에 적응하는 비용, world-model uncertainty, long-horizon composition, safe continual learning, runtime hierarchy가 별도 연구축으로 분리되어야 한다.
핵심 연구질문
| RQ | 연구질문 |
|---|---|
| RQ1 · Generality | 하나의 policy가 얼마나 많은 task/environment를 추가학습 없이 처리할 수 있는가? |
| RQ2 · Embodiment | 서로 다른 robot kinematics와 action spaces를 어떻게 하나의 representation으로 연결할 것인가? |
| RQ3 · Adaptation | 새 robot에 필요한 demonstration·fine-tuning·engineering 비용을 얼마나 줄일 수 있는가? |
| RQ4 · World Model | action 전에 미래결과와 failure probability를 얼마나 정확하고 calibrated하게 예측할 수 있는가? |
| RQ5 · Long Horizon | learned primitives를 새로운 복합작업으로 composition할 수 있는가? |
| RQ6 · Continual Learning | 현장에서 새 skill을 배우면서 기존 skill과 safety constraint를 보존할 수 있는가? |
| RQ7 · Safety | VLA의 action을 독립 safety layer가 실시간으로 검증·차단할 수 있는가? |
| RQ8 · Data | real, simulation, video, human demonstration, synthetic data를 어떤 비율과 representation으로 통합할 것인가? |
| RQ9 · Evaluation | benchmark score가 아니라 adaptation effort까지 포함해 “범용성”을 어떻게 측정할 것인가? |
| RQ10 · Runtime | foundation-model reasoning과 50–1000 Hz 수준의 control을 어떻게 시간계층적으로 결합할 것인가? |
Analysis특히 RQ9가 중요하다. 높은 성공률 뒤에 숨은 integration effort를 드러내야 진짜 플랫폼 범용성을 평가할 수 있다.
한 모델을 키우는 대신 데이터·추론·행동·몸체를 분업시킨다
Heterogeneous pre-training, co-training, dual-system runtime, cross-embodiment prompting, optimized action heads, world-model planning, behavior foundation model이 서로 다른 병목을 맡는다.
Real robot만으로는 foundation scale을 만들기 어렵다
GR00T N1 계열의 방향은 expensive robot trajectory를 인간 video와 synthetic data로 보완한다. 플랫폼 수준에서는 데이터 source의 차이를 감추지 않고 provenance와 domain gap을 관리해야 한다.
Open-world semantics와 fast motor generation을 분리한다
π0.5는 robot action data뿐 아니라 semantic subtask prediction, object detection, image, language, web knowledge 등을 hybrid example로 co-training한다. GR00T N1과 같은 dual-system 방향은 느린 semantic reasoning과 빠른 motor generation을 분리한다.
범용 플랫폼은 reasoning frequency와 control frequency를 동일하게 만들기보다 시간계층적으로 분리하는 편이 자연스럽다.
공통 backbone에 body-specific context를 주입한다
X-VLA는 데이터 source/embodiment에 대응하는 learnable soft prompt를 사용해 하나의 Transformer backbone에서 heterogeneous robot data를 처리한다. 여러 simulation과 real robot에서 평가되며, 명시적 embodiment conditioning의 한 예를 제공한다.
Foundation model과 actuator 사이에 고속 실행층이 필요하다
OpenVLA-OFT의 parallel decoding·action chunking·continuous action representation, SmolVLA의 asynchronous inference는 VLA가 실제 플랫폼이 되기 위해 action head와 runtime scheduler가 별도 연구대상이 되어야 함을 보여준다.
Imagine → Evaluate → Act
world model은 state abstraction, temporal dynamics, uncertainty, structural prior, observation modality, decision coupling을 함께 다뤄야 한다. 단순 next-frame prediction이 아니라 decision-relevant physical simulation이 목표다.
Humanoid에서는 whole-body prior가 별도 foundation layer가 된다
Humanoid robotics에서는 VLA뿐 아니라 locomotion, balance, whole-body manipulation을 위한 Behavior Foundation Model이 중요하다. 대규모 pre-training으로 reusable primitive와 behavioral prior를 확보하고 downstream task에서 zero/few-shot adaptation하는 연구방향이 정리되고 있다.
응용은 넓어지지만 범용성의 증거는 아직 manipulation에 가장 강하다
제조·물류·가정·돌봄·재난·드론까지 확장 가능하지만 2025~2026년 foundation-model 실증의 중심은 manipulation과 humanoid다.
플랫폼이 겨냥하는 일곱 응용영역
Manipulation
open-vocabulary instruction 기반 pick-place, 정리, 조립, cleaning.
Humanoid
사람 중심 환경에서 generalist whole-body intelligence를 활용.
Manufacturing / Logistics
새 SKU·fixture·assembly sequence에 빠르게 적응.
Home / Service
미지의 집과 물체에서 long-horizon open-world task 수행.
Healthcare / Care
human-aware planning, explainability, strict safety 요구.
Hazard / Disaster
위험인지와 독립 safety assurance가 동시에 필요.
Driving / Drone
navigation, driving, aerial robotics의 predictive control에 world model 적용.
Cross-Domain Platform
동일 cognitive core를 여러 embodiment family에 재사용.
Caution응용범위가 넓다고 해서 모든 분야에서 동일 수준의 generality가 실증됐다는 뜻은 아니다. 현재 foundation-model 기반 강한 실증은 manipulation과 humanoid에 가장 집중되어 있다.
Shared Cognitive Core와 Robot-Specific Control의 경계
모든 robot을 동일 action space로 변환하면 physical structure를 잃을 수 있고, 반대로 모든 robot마다 별도 policy를 만들면 foundation model의 경제성이 사라진다.
Causality, uncertainty, continual learning, benchmark
- Physical causality: semantic prior가 강해도 contact·friction·force·deformation·dynamics를 충분히 이해한다는 보장은 없다.
- Uncertainty-aware action: action 하나보다 “이 행동의 결과를 얼마나 확신하는가”를 알아야 deferral이 가능하다.
- Safe continual learning: 현장학습이 policy를 바꾸면 기존 safety certification의 유효성이 흔들릴 수 있다.
- Generality benchmark: 쉬운 분포의 success rate보다 perturbation·extrapolation·long horizon·safety·adaptation cost를 함께 봐야 한다.
“계속 학습하는 로봇”과 “항상 인증 가능한 로봇” 사이의 긴장이 아직 풀리지 않았다.
차세대 목표는 “더 큰 VLA”가 아니라 Physical AI Operating Platform이다
행동 생성, 미래예측, body adaptation, low-level control, fleet learning, safety kernel을 계층화하고 범용성을 adaptation cost까지 포함해 측정해야 한다.
다층 Physical AI Operating Platform
Proposed synthesis이 구조는 특정 한 논문의 architecture가 아니라 2025~2026년 연구흐름을 플랫폼 관점에서 종합한 reference architecture다.
행동 전 상상하고 평가한 뒤 실행한다
후보 action을 즉시 실행하기보다 world model이 future state와 uncertainty를 rollout하고, risk estimator가 위험을 평가한 뒤 action을 승인하는 구조가 중요해진다.
Robot intelligence와 hardware 사이에 강한 경계를 만든다
현재 로봇 분야에는 컴퓨터의 ISA나 OS API처럼 충분히 강한 intelligence–hardware abstraction boundary가 없다. X-VLA와 Embodiment Gap 연구는 body-specific conditioning과 explicit adaptation interface의 필요성을 강화한다.
Success rate보다 adaptation cost를 함께 본다
Proposed metric범용성을 다음처럼 평가하는 것이 유용하다.
새 robot에서도 95% success를 내지만 수개월의 integration이 필요하다면, 플랫폼 수준의 범용성은 낮다고 볼 수 있다. 범용성은 성능뿐 아니라 이식비용을 포함하는 시스템 속성이다.
하나의 점수보다 여러 축으로 표현한다
task generalization이 높아도 embodiment generalization이나 safety generalization이 낮을 수 있다. 따라서 “범용”이라는 단어는 최소한 여러 축으로 해체해 보고해야 한다.
Deployment 이후에도 경험을 검증하고 다시 배포한다
장기적으로 플랫폼은 고정된 model release가 아니라 continuous physical learning system에 가까워질 것이다. 다만 verification과 rollback이 학습속도만큼 중요하다.
“안전하게 행동하라”는 prompt만으로는 충분하지 않다
AGENTSAFE와 VLA-Arena의 failure mode를 고려하면 safety는 foundation policy 안에 암묵적으로 포함시키는 것만으로 부족하다. 독립 safety kernel, state/action verification, human override가 플랫폼의 별도 통제면(control plane)이 되어야 한다.
2025~2026 대표 연구
| 연구 | 핵심 의미 | 출처 |
|---|---|---|
| GR00T N1 | Generalist humanoid foundation model, dual-system architecture | arXiv |
| Gemini Robotics | VLA + embodied reasoning + novel embodiment adaptation | arXiv |
| π0.5 | Open-world, long-horizon generalization | arXiv |
| OpenVLA-OFT | Action chunking, parallel decoding, reported 26× throughput | arXiv |
| SmolVLA | Lightweight / edge-deployable VLA | arXiv |
| Behavior Foundation Model Survey | Humanoid whole-body foundation policies | arXiv |
| VLA Survey | Architecture·data·training·evaluation taxonomy | arXiv |
| X-VLA | Cross-embodiment soft prompting | arXiv |
| Physical AI Survey | Perception → reasoning → modeling → interaction | arXiv |
| VLA-Arena | Generalization·safety·long-horizon benchmark | Project |
| AGENTSAFE | Hazardous embodied-agent safety | arXiv |
| Embodiment Gap | Robot foundation model deployment/adaptation gap | arXiv |
| World Models for Physical AI | Uncertainty-aware prediction, planning, control | Springer |
| A Roadmap for AI in Robotics | Transfer, lifelong learning, safety roadmap | Nature MI |
범용 플랫폼의 핵심은 “하나의 모델”이 아니라 경계를 잘 설계하는 것이다
장기적으로 가장 설득력 있는 방향은 모든 로봇을 하나의 거대 policy로 동일하게 제어하는 것이 아니다. 공통 인지·추론·예측 능력은 공유하고, 몸체의 차이는 explicit embodiment layer에서 흡수하며, action은 world model과 safety kernel을 거쳐 실행하는 구조다.
Sources
2025년 이후의 Physical AI, VLA, Robot Foundation Model, World Model, cross-embodiment, safety 관련 대표 문헌과 프로젝트다.