AI Research Blog·Physical AI Strategy 2028–20322026 · 09 · 17
2028–2032 Technology Strategy·Physical AI·ETRI Target Architecture

가장 큰 VLA가 아니라
로봇 지능의 개방형 운영기반을 만든다

Open Physical AI Fabric 2032: Core Technologies, KPIs, Benchmarks, and Target Architecture

MISSION / HUMAN INTENTAGENTIC MISSION PLANNERCAUSAL WORLD MODELGENERALIST VLA + SAFETY KERNELEMBODIMENT ABSTRACTIONREAL-TIME PHYSICAL AI RUNTIME임무·사람의 의도·운용 제약Mission → Task → Skill → Action행동 결과·위험·불확실성 예측행동 생성 + 독립 안전검증공통 지능 ↔ 로봇별 Adapter / HALEdge · 6G · Cloud · Fleet ExecutionREAL2SIM2REAL · MEMORY · DATA · PROVENANCESAFETY · ASSURANCE · HUMAN AUTHORITYROBOT AROBOT BHUMANOID CAMR D
Strategic Thesis

2028~2032 범용 피지컬 AI의 경쟁력은 하나의 거대한 VLA 모델에서 결정되지 않는다. 다양한 로봇·환경·임무에 공통으로 재사용되는 지능 코어와 embodiment adapter, world model, 실시간 제어, 지속학습, 안전검증, 엣지–클라우드 실행환경을 하나의 플랫폼으로 묶는 능력이 핵심이다.

이 글의 15개 KPI는 기존 논문이 이미 달성한 수치가 아니라 2028 중간목표와 2032 최종목표로 제안하는 연구개발 KPI이다. 해외·국내 benchmark는 목표수치의 직접 비교표가 아니라 기술방향과 현재 기준점을 잡기 위한 reference point로 사용한다.

ETRI의 목표는 “가장 큰 로봇 모델”이 아니라 어떤 foundation model과 어떤 로봇도 연결해 사용할 수 있는 개방형 Physical AI 운영기반으로 설정하는 편이 설득력 있다.Strategic analysis · proposed target architecture, not an official ETRI program name
Part I · §1-§2

플랫폼의 단위는 “모델”이 아니라 “운영 가능한 지능 스택”이다

VLA, world model, embodiment abstraction, whole-body control, Real2Sim2Real, lifelong learning, safety, fleet, network를 하나의 실행체계로 결합한다.

§1 · Why a Platform

모든 로봇을 다시 학습시키는 방식은 범용화가 아니다

로봇마다 데이터 수집, fine-tuning, 제어기 통합, 안전검증을 처음부터 반복하면 foundation model의 재사용성은 현장에서 크게 줄어든다. 따라서 공통 지능은 공유하고, 몸체의 차이는 명시적인 Embodiment Abstraction Layer에서 흡수하는 구조가 필요하다.

\[\text{Open Physical AI Fabric}=\text{Generalist Intelligence}+\text{Embodiment Abstraction}+\text{World Model}+\text{Real-Time Runtime}+\text{Safety}+\text{Lifelong/Fleet Learning}\]
§2 · ETRI Positioning

ETRI의 ICT 강점을 Physical AI의 결합계층으로 확장한다

Public direction이전 분석에서 참고한 ETRI 공개 연구방향에는 대규모 멀티모달 기반 Robot Foundation Model, 지각–이해–행동 통합, 실제 경험 기반 자율성장 파이프라인, 확장 가능한 휴머노이드 시스템 아키텍처가 포함된다. 이 기반을 2028~2032에는 개별 요소기술에서 개방형·이기종·네트워크형 Physical AI Platform으로 확장하는 그림이 자연스럽다.

Part II · §3

15개 핵심 요소기술과 2028→2032 제안 KPI

KPI는 연구개발 목표치 제안이다. reported result와 섞지 않고, benchmark는 현재 기술수준과 방향성을 읽는 기준점으로만 제시한다.

§3 · Technology Portfolio

Intelligence Core → Embodiment & Runtime → Fleet & Infrastructure

#핵심 요소기술2028 제안 KPI2032 제안 KPI국내외 Benchmark / 기준점ETRI 관점 목표형상
01Generalist Robot Foundation Model / VLA3종 embodiment
50 tasks
unseen SR 70%
10종+ embodiment
200 tasks
unseen SR 85%+
GR00T N1은 실제 GR-1 manipulation에서 평균 76.8%를 보고했다. Gemini Robotics와 π0.5는 새로운 embodiment와 open-world task generalization을 다룬다.ETRI Generalist Physical Foundation Model — 하나의 VLA/RFM을 여러 로봇에 재사용
02Cross-Embodiment Intelligence & Embodiment Abstraction신규 로봇 적응 ≤2주
500 demos
≤24시간
≤100 demos
기존 성능 90%+ 유지
X-VLA는 6개 simulation·3개 실제 robot에서 cross-embodiment를 평가한다. Embodiment Gap 연구는 adaptation effort 자체의 측정을 강조한다.Physical AI HAL — 제조사·기구학·센서·action-space 차이를 흡수
03Multimodal Spatial–Physical GroundingVision+Language+3D
grounding 90%
Vision+Language+3D+Tactile+Force
95%+
NAVER LABS는 Spatial AI와 foundation-model robotics를 전개하고 있으며, 국내 Human Motion Foundation Model 연구도 확장되고 있다.Physical Multimodal Encoder — 시각·언어·공간·촉각·힘의 공통 표현
04Causal / Predictive World Model2초 horizon
위험사건 recall 90%
5~10초 horizon
recall 95%+
ECE ≤0.05
Physical AI 연구는 action 결과 예측, dynamics modeling, uncertainty-aware planning을 핵심 축으로 이동시키고 있다.Causal Physical World Model — 행동 전에 미래와 위험을 시뮬레이션
05Hierarchical Planning & Long-Horizon Skill Composition20-step task
성공률 70%
100-step+ task
80%+
π0.5는 새로운 가정에서 long-horizon manipulation을 시연했고, VLA-Arena는 Long Horizon을 독립 평가축으로 둔다.Hierarchical Physical Agent Planner — Mission → Task → Skill → Action
06Whole-Body / Loco-Manipulation Foundation Model10종 whole-body skill
80%
50종+ skill
90%
disturbance recovery 95%+
GR00T는 reasoning과 diffusion action을 분리하는 dual-system 구조를 사용하며, whole-body RL·loco-manipulation 통합이 진전 중이다.Behavior Foundation Model — 이동·균형·양팔·손 조작 통합
07Real2Sim2Real / Synthetic Experience Engine실제 데이터 요구량 50% 절감
sim-real gap ≤15%p
실제 데이터 80% 절감
gap ≤5%p
NVIDIA는 real robot, human video, synthetic data와 simulation pipeline을 foundation-robotics stack에 결합한다.Physical AI Experience Factory — 현장 digital twin과 synthetic trajectory 자동생성
08Real-Time Edge Physical AI RuntimeVLA action ≥10 Hz
P95 ≤100 ms
≥20 Hz
P95 ≤50 ms
low-level control ≥500 Hz
OpenVLA-OFT는 LIBERO 평균 76.5→97.1%, action-generation throughput 26×를 보고했다. SmolVLA는 lightweight/asynchronous inference를 지향한다.ETRI Physical AI Runtime — foundation reasoning과 RT control 분리
09Lifelong Learning & Persistent Physical Memory신규 20 skills
forgetting <10%p
100+ skills
forgetting <5%p
rollback <1분
로봇 AI roadmap은 lifelong learning을 장기 핵심과제로 제시한다. embodied exploration에서도 episodic memory가 독립 평가대상으로 부상한다.자율성장 Physical AI Loop — Deploy → Experience → Verify → Learn → Redeploy
10Runtime Safety Assurance & Verified Actionhazard recall ≥95%
unsafe-action <5%
recall ≥99%
unsafe-action <1%
intervention ≤50 ms
AGENTSAFE는 45개 adversarial scenario, 1,350 hazardous tasks, 9,900 instructions로 hazard recognition과 safe execution의 간극을 평가한다.Safety Kernel + Risk World Model + Human Override — VLA와 독립된 안전계층
11Human–Robot Interaction & Human Authorityintent grounding 90%
human correction 30% 감소
intent grounding 95%+
override 100% 보장
NAVER LABS HUMANS는 사람의 자세·행동·사회적 context 이해를 다루며, robotics roadmap도 collaboration과 explainability를 핵심과제로 둔다.Human-Centered Physical AI Interface — 명령뿐 아니라 의도·상태·권한까지 표현
12Multi-Robot / Fleet Physical AI이기종 50대
availability 99.5%
500대+
99.9%
fleet policy update ≤5분
NAVER LABS ARC는 대규모 공간정보와 이기종 robot을 cloud intelligence로 연결하고 cloud/on-board AI를 함께 운용한다.Physical AI Fleet Fabric — 다수 로봇이 지능·경험을 공유
13Physical AI Data, Provenance & Reproducibilitydata/model/action lineage 95%100% traceability
replay reproducibility 95%+
복잡한 robotics stack에서 reproducibility와 auditability를 높여야 한다는 요구가 커지고 있다.Physical AI Provenance Ledger — 센서→데이터→모델→계획→행동 역추적
14Open Robot Interface, Plug-and-Play & Benchmark Platform5종 robot adapter
100 benchmark tasks
10개 제조사+
500 tasks
API conformance 95%+
VLA-Arena는 Safety, Distractor, Extrapolation, Long Horizon의 170-task open benchmark를 제공한다.Open Physical AI API/SDK + Korea Physical AI Arena
15Network–Compute–AI Co-Design / Connected Physical AIedge/cloud split inference
control E2E ≤50 ms
mission loop ≤20 ms급
critical-link reliability 99.999%
ComVLA는 visual token을 512→32로 줄여 inference compute 74%, latency 22%를 낮추면서 평균 task success 감소를 1.5%p로 제한했다고 보고한다.6G–Edge–Cloud–Robot Co-Designed Physical AI Fabric — ETRI ICT 강점과 직접 연결

KPI proposal위 수치는 논문이 이미 달성했다고 주장하는 benchmark score가 아니라 전략목표로 제안한 KPI이다. 따라서 실제 사업기획 단계에서는 task 정의, test protocol, hardware class, latency 측정구간, success criterion을 별도 규격으로 고정해야 한다.

Part III · §4-§5

Benchmark는 “누가 더 큰가”가 아니라 “어디까지 플랫폼화했는가”를 본다

모델 성능, simulation/data engine, runtime, fleet, hardware integration, safety를 함께 봐야 플랫폼 수준의 경쟁력을 읽을 수 있다.

§4 · International Reference Points

NVIDIA는 수직통합, VLA 계열은 범용정책, benchmark는 실패경계를 보여준다

Benchmark contextNVIDIA Isaac GR00T는 model·simulation·data·runtime·Jetson까지 하나의 ecosystem으로 묶는 수직 통합 경로를 보여준다. GR00T N1은 humanoid foundation model, Gemini Robotics는 VLA와 embodied reasoning, π0.5는 open-world long-horizon generalization, X-VLA는 cross-embodiment adaptation을 각각 대표하는 기준점이다.

OpenVLA-OFT와 SmolVLA는 foundation policy와 실시간 실행계층 사이의 병목을 다룬다. AGENTSAFE와 VLA-Arena는 높은 task success만으로 안전성과 generalization을 설명할 수 없다는 점을 드러낸다.

§5 · Domestic Reference Points

국내에서는 공간지능·클라우드 로보틱스·제조현장 실증이 중요한 기준점이다

이전 분석은 NAVER LABS의 Spatial AI, HUMANS, ARC를 국내 benchmark로 두었다. ARC는 cloud/on-board AI와 이기종 robot을 대규모 공간정보와 연결한다는 점에서 fleet-level Physical AI와 직접 연결된다. 현대자동차그룹의 제조·휴머노이드·edge AI 결합 역시 산업적 reference point로 해석할 수 있다.

Caution기업별 공개자료는 task 정의와 평가조건이 서로 다르므로 단일 성능순위로 비교하기보다 어떤 계층을 실제 운영환경까지 통합했는지를 비교하는 것이 적절하다.

Part IV · §6-§7

2032 목표형상: Open Physical AI Fabric

이 명칭과 구조는 공식 ETRI 사업명이 아니라, 앞선 기술·benchmark 분석에서 도출한 전략적 목표형상 제안이다.

§6 · Reference Architecture

Mission에서 Robot Actuation까지 하나의 폐루프를 만든다

Mission / Human Intent → Agentic Mission Planner → Causal World Model ↔ Generalist VLA + Safety Kernel → Skill / Behavior Foundation Models → Embodiment Abstraction → Real-Time Runtime → Heterogeneous Robots

이 수직 stack을 가로질러 Real2Sim2Real·Data·Memory·Provenance·Lifelong Learning·Fleet Learning·Benchmark가 순환한다. 실행 인프라는 Edge–6G–Cloud로 연결되고, safety kernel과 human authority는 모델과 독립된 통제계층으로 유지한다.

Analysis핵심 차별점은 Open + Cross-Embodiment + Networked + Verifiable + Continuously Learning이다. 폐쇄적인 단일 robot stack을 하나 더 만드는 것이 아니라 서로 다른 foundation model과 로봇을 교체·결합할 수 있는 공통 운영기반을 만드는 방향이다.

§7 · Strategic Equation

ETRI Physical AI 2032를 일곱 계층으로 압축하면

\[\begin{aligned}\text{ETRI Physical AI 2032}=&\;\text{Open Generalist Intelligence}\\+&\;\text{Embodiment Abstraction}\\+&\;\text{Causal World Model}\\+&\;\text{Real-Time Edge Intelligence}\\+&\;\text{6G/Cloud/Fleet Intelligence}\\+&\;\text{Lifelong Learning}\\+&\;\text{Independent Safety Assurance}\end{aligned}\]

이 목표형상은 ETRI가 공개적으로 제시한 Robot Foundation Model, multimodal learning, autonomous learning pipeline, scalable humanoid architecture를 상위 플랫폼 구조로 확장한 전략적 해석이다.

Part V · §8-§9

2028 → 2030 → 2032: 단계별 완성도를 높인다

초기에는 공통 지능과 안전 기반을 확보하고, 중기에는 whole-body·lifelong·fleet를 결합하며, 최종적으로 networked open platform까지 확장한다.

§8 · Three-Stage Roadmap

원천기술 확보 → 통합 → 국가 수준 플랫폼

2028

Core Intelligence

① Generalist RFM/VLA
② Embodiment Abstraction
③ Causal World Model
④ Real2Sim2Real Experience Engine
⑤ Independent Safety Kernel

2030

Embodied Integration

Whole-body foundation model, lifelong learning, edge runtime, multi-robot fleet를 공통 플랫폼 안에서 결합한다. 단일 demo가 아니라 복합 임무와 heterogeneous deployment를 평가한다.

2032

Open Physical AI Fabric

6G–Edge–Cloud, open API/SDK, provenance, fleet learning, benchmark와 독립 safety assurance까지 연결해 국가 수준의 개방형 Physical AI 플랫폼으로 완성한다.

§9 · First Five Priorities

가장 먼저 잡아야 할 다섯 축

01 · Generalist RFM/VLA

다양한 task와 embodiment에 재사용되는 공통 지능코어.

02 · Embodiment Abstraction

새 robot을 빠르게 연결하는 HAL/adapter 계층.

03 · Causal World Model

실행 전에 미래·실패·위험을 예측하는 predictive layer.

04 · Experience Engine

Real2Sim2Real과 synthetic data로 물리경험을 규모화.

05 · Safety Kernel

VLA와 독립된 verification·override·runtime assurance.

Strategic rationale이 다섯 기술은 이후 whole-body control, fleet intelligence, lifelong learning, open interface를 얹을 수 있는 플랫폼의 최소 공통 기반이라는 점에서 우선순위가 높다.

Part VI · §10-§11

KPI는 성능뿐 아니라 “새 로봇을 붙이는 비용”까지 측정해야 한다

범용 플랫폼의 진짜 경쟁력은 benchmark score 하나보다 coverage, adaptation cost, latency, safety, reproducibility를 함께 줄이는 데 있다.

§10 · Platform Generality

범용성의 분모에는 비용이 들어가야 한다

\[\text{Platform Generality}\propto\frac{\text{Task}\times\text{Environment}\times\text{Embodiment Coverage}}{\text{Data}+\text{Fine-tuning}+\text{Integration}+\text{Validation Cost}}\]

Proposed metric이 식은 기존 표준 metric이 아니라 앞선 분석에서 제안한 평가관점이다. 새 robot에서도 높은 success rate를 내지만 수개월의 integration이 필요하다면 “범용 플랫폼”이라고 부르기 어렵다는 문제의식을 반영한다.

§11 · Final Target

모델 경쟁에서 플랫폼 경쟁으로

2028~2032년의 핵심 전환은 “더 큰 VLA”에서 “운영 가능한 Physical AI Fabric”으로 이동하는 것이다. 여기서 ETRI의 차별점은 통신·네트워크·엣지·데이터·AI·시스템을 함께 다룰 수 있다는 점을 Physical AI의 결합계층으로 가져오는 데 있다.

최종 목표는 하나의 로봇이 똑똑해지는 것이 아니라, 새로운 로봇과 임무가 추가될수록 플랫폼 전체가 더 재사용 가능하고 더 검증 가능하며 더 안전해지는 구조이다.

2032의 성공기준은 “모델 크기”가 아니라 새로운 robot·task·environment를 얼마나 적은 데이터·시간·통합비용으로 안전하게 수용하는가여야 한다.Strategic takeaway
References & Benchmark Anchors

연구·산업 기준점

아래 출처는 이전 분석에서 사용한 대표 원문이다. KPI 자체는 제안 목표이며, 각 출처의 성능수치를 직접 2032 목표로 등치하지 않는다.

[01]
ETRI Physical AI Research Direction
ETRI · Public Research Page
Robot Foundation Model, multimodal learning, autonomous growth, humanoid architecture 등 ETRI 공개 연구방향의 기준점. Source
[02]
NVIDIA Isaac GR00T / GR00T N1
NVIDIA · 2025+
Foundation model, simulation, synthetic data, runtime, hardware까지 연결한 수직통합 Physical AI ecosystem. Platform · N1 overview · Paper
[03]
Gemini Robotics
arXiv:2503.20020 · 2025
VLA와 embodied reasoning, 새로운 embodiment로의 적응을 다룬다. Source
[04]
π0.5: A Vision-Language-Action Model with Open-World Generalization
arXiv:2504.16054 · 2025
새로운 가정환경과 long-horizon manipulation을 포함한 open-world generalization의 기준점. Source
[05]
OpenVLA-OFT
arXiv:2502.19645 · 2025
action chunking, parallel decoding, continuous action representation을 통해 VLA runtime 효율을 개선한다. Source
[06]
SmolVLA
arXiv:2506.01844 · 2025
경량 VLA와 asynchronous inference를 통한 edge-friendly deployment 방향. Source
[07]
X-VLA
arXiv:2510.10274 · 2025
cross-embodiment soft prompting과 heterogeneous robot data 공유를 다룬다. Source
[08]
The Embodiment Gap in Robot Foundation Models
arXiv:2608.18433 · 2026
foundation-model benchmark 성능과 실제 robot integration/adaptation 사이의 간극을 분석하는 기준점. Source
[09]
VLA-Arena
Open Benchmark · 2025/2026
Safety, Distractor, Extrapolation, Long Horizon을 포함하는 170-task VLA 평가환경. Project
[10]
AGENTSAFE
CVPR 2026
hazard recognition과 safe execution의 차이를 hazardous embodied-agent tasks로 평가한다. CVF
[11]
A Roadmap for AI in Robotics
Nature Machine Intelligence · 2025
transfer, lifelong learning, human collaboration, explainability, safe deployment를 장기 과제로 정리한다. Source
[12]
NAVER LABS Spatial AI / ARC / HUMANS
Domestic Industry Reference
국내 spatial intelligence, cloud robotics, human-aware robotics의 benchmark anchor. Spatial AI · ARC · HUMANS
[13]
ComVLA
arXiv:2609.07838 · 2026
communication/computation-aware visual-token reduction을 통해 connected Physical AI의 효율을 다룬다. Source