2028~2032 범용 피지컬 AI의 경쟁력은 하나의 거대한 VLA 모델에서 결정되지 않는다. 다양한 로봇·환경·임무에 공통으로 재사용되는 지능 코어와 embodiment adapter, world model, 실시간 제어, 지속학습, 안전검증, 엣지–클라우드 실행환경을 하나의 플랫폼으로 묶는 능력이 핵심이다.
이 글의 15개 KPI는 기존 논문이 이미 달성한 수치가 아니라 2028 중간목표와 2032 최종목표로 제안하는 연구개발 KPI이다. 해외·국내 benchmark는 목표수치의 직접 비교표가 아니라 기술방향과 현재 기준점을 잡기 위한 reference point로 사용한다.
플랫폼의 단위는 “모델”이 아니라 “운영 가능한 지능 스택”이다
VLA, world model, embodiment abstraction, whole-body control, Real2Sim2Real, lifelong learning, safety, fleet, network를 하나의 실행체계로 결합한다.
모든 로봇을 다시 학습시키는 방식은 범용화가 아니다
로봇마다 데이터 수집, fine-tuning, 제어기 통합, 안전검증을 처음부터 반복하면 foundation model의 재사용성은 현장에서 크게 줄어든다. 따라서 공통 지능은 공유하고, 몸체의 차이는 명시적인 Embodiment Abstraction Layer에서 흡수하는 구조가 필요하다.
ETRI의 ICT 강점을 Physical AI의 결합계층으로 확장한다
Public direction이전 분석에서 참고한 ETRI 공개 연구방향에는 대규모 멀티모달 기반 Robot Foundation Model, 지각–이해–행동 통합, 실제 경험 기반 자율성장 파이프라인, 확장 가능한 휴머노이드 시스템 아키텍처가 포함된다. 이 기반을 2028~2032에는 개별 요소기술에서 개방형·이기종·네트워크형 Physical AI Platform으로 확장하는 그림이 자연스럽다.
15개 핵심 요소기술과 2028→2032 제안 KPI
KPI는 연구개발 목표치 제안이다. reported result와 섞지 않고, benchmark는 현재 기술수준과 방향성을 읽는 기준점으로만 제시한다.
Intelligence Core → Embodiment & Runtime → Fleet & Infrastructure
| # | 핵심 요소기술 | 2028 제안 KPI | 2032 제안 KPI | 국내외 Benchmark / 기준점 | ETRI 관점 목표형상 |
|---|---|---|---|---|---|
| 01 | Generalist Robot Foundation Model / VLA | 3종 embodiment 50 tasks unseen SR 70% | 10종+ embodiment 200 tasks unseen SR 85%+ | GR00T N1은 실제 GR-1 manipulation에서 평균 76.8%를 보고했다. Gemini Robotics와 π0.5는 새로운 embodiment와 open-world task generalization을 다룬다. | ETRI Generalist Physical Foundation Model — 하나의 VLA/RFM을 여러 로봇에 재사용 |
| 02 | Cross-Embodiment Intelligence & Embodiment Abstraction | 신규 로봇 적응 ≤2주 500 demos | ≤24시간 ≤100 demos 기존 성능 90%+ 유지 | X-VLA는 6개 simulation·3개 실제 robot에서 cross-embodiment를 평가한다. Embodiment Gap 연구는 adaptation effort 자체의 측정을 강조한다. | Physical AI HAL — 제조사·기구학·센서·action-space 차이를 흡수 |
| 03 | Multimodal Spatial–Physical Grounding | Vision+Language+3D grounding 90% | Vision+Language+3D+Tactile+Force 95%+ | NAVER LABS는 Spatial AI와 foundation-model robotics를 전개하고 있으며, 국내 Human Motion Foundation Model 연구도 확장되고 있다. | Physical Multimodal Encoder — 시각·언어·공간·촉각·힘의 공통 표현 |
| 04 | Causal / Predictive World Model | 2초 horizon 위험사건 recall 90% | 5~10초 horizon recall 95%+ ECE ≤0.05 | Physical AI 연구는 action 결과 예측, dynamics modeling, uncertainty-aware planning을 핵심 축으로 이동시키고 있다. | Causal Physical World Model — 행동 전에 미래와 위험을 시뮬레이션 |
| 05 | Hierarchical Planning & Long-Horizon Skill Composition | 20-step task 성공률 70% | 100-step+ task 80%+ | π0.5는 새로운 가정에서 long-horizon manipulation을 시연했고, VLA-Arena는 Long Horizon을 독립 평가축으로 둔다. | Hierarchical Physical Agent Planner — Mission → Task → Skill → Action |
| 06 | Whole-Body / Loco-Manipulation Foundation Model | 10종 whole-body skill 80% | 50종+ skill 90% disturbance recovery 95%+ | GR00T는 reasoning과 diffusion action을 분리하는 dual-system 구조를 사용하며, whole-body RL·loco-manipulation 통합이 진전 중이다. | Behavior Foundation Model — 이동·균형·양팔·손 조작 통합 |
| 07 | Real2Sim2Real / Synthetic Experience Engine | 실제 데이터 요구량 50% 절감 sim-real gap ≤15%p | 실제 데이터 80% 절감 gap ≤5%p | NVIDIA는 real robot, human video, synthetic data와 simulation pipeline을 foundation-robotics stack에 결합한다. | Physical AI Experience Factory — 현장 digital twin과 synthetic trajectory 자동생성 |
| 08 | Real-Time Edge Physical AI Runtime | VLA action ≥10 Hz P95 ≤100 ms | ≥20 Hz P95 ≤50 ms low-level control ≥500 Hz | OpenVLA-OFT는 LIBERO 평균 76.5→97.1%, action-generation throughput 26×를 보고했다. SmolVLA는 lightweight/asynchronous inference를 지향한다. | ETRI Physical AI Runtime — foundation reasoning과 RT control 분리 |
| 09 | Lifelong Learning & Persistent Physical Memory | 신규 20 skills forgetting <10%p | 100+ skills forgetting <5%p rollback <1분 | 로봇 AI roadmap은 lifelong learning을 장기 핵심과제로 제시한다. embodied exploration에서도 episodic memory가 독립 평가대상으로 부상한다. | 자율성장 Physical AI Loop — Deploy → Experience → Verify → Learn → Redeploy |
| 10 | Runtime Safety Assurance & Verified Action | hazard recall ≥95% unsafe-action <5% | recall ≥99% unsafe-action <1% intervention ≤50 ms | AGENTSAFE는 45개 adversarial scenario, 1,350 hazardous tasks, 9,900 instructions로 hazard recognition과 safe execution의 간극을 평가한다. | Safety Kernel + Risk World Model + Human Override — VLA와 독립된 안전계층 |
| 11 | Human–Robot Interaction & Human Authority | intent grounding 90% human correction 30% 감소 | intent grounding 95%+ override 100% 보장 | NAVER LABS HUMANS는 사람의 자세·행동·사회적 context 이해를 다루며, robotics roadmap도 collaboration과 explainability를 핵심과제로 둔다. | Human-Centered Physical AI Interface — 명령뿐 아니라 의도·상태·권한까지 표현 |
| 12 | Multi-Robot / Fleet Physical AI | 이기종 50대 availability 99.5% | 500대+ 99.9% fleet policy update ≤5분 | NAVER LABS ARC는 대규모 공간정보와 이기종 robot을 cloud intelligence로 연결하고 cloud/on-board AI를 함께 운용한다. | Physical AI Fleet Fabric — 다수 로봇이 지능·경험을 공유 |
| 13 | Physical AI Data, Provenance & Reproducibility | data/model/action lineage 95% | 100% traceability replay reproducibility 95%+ | 복잡한 robotics stack에서 reproducibility와 auditability를 높여야 한다는 요구가 커지고 있다. | Physical AI Provenance Ledger — 센서→데이터→모델→계획→행동 역추적 |
| 14 | Open Robot Interface, Plug-and-Play & Benchmark Platform | 5종 robot adapter 100 benchmark tasks | 10개 제조사+ 500 tasks API conformance 95%+ | VLA-Arena는 Safety, Distractor, Extrapolation, Long Horizon의 170-task open benchmark를 제공한다. | Open Physical AI API/SDK + Korea Physical AI Arena |
| 15 | Network–Compute–AI Co-Design / Connected Physical AI | edge/cloud split inference control E2E ≤50 ms | mission loop ≤20 ms급 critical-link reliability 99.999% | ComVLA는 visual token을 512→32로 줄여 inference compute 74%, latency 22%를 낮추면서 평균 task success 감소를 1.5%p로 제한했다고 보고한다. | 6G–Edge–Cloud–Robot Co-Designed Physical AI Fabric — ETRI ICT 강점과 직접 연결 |
KPI proposal위 수치는 논문이 이미 달성했다고 주장하는 benchmark score가 아니라 전략목표로 제안한 KPI이다. 따라서 실제 사업기획 단계에서는 task 정의, test protocol, hardware class, latency 측정구간, success criterion을 별도 규격으로 고정해야 한다.
Benchmark는 “누가 더 큰가”가 아니라 “어디까지 플랫폼화했는가”를 본다
모델 성능, simulation/data engine, runtime, fleet, hardware integration, safety를 함께 봐야 플랫폼 수준의 경쟁력을 읽을 수 있다.
NVIDIA는 수직통합, VLA 계열은 범용정책, benchmark는 실패경계를 보여준다
Benchmark contextNVIDIA Isaac GR00T는 model·simulation·data·runtime·Jetson까지 하나의 ecosystem으로 묶는 수직 통합 경로를 보여준다. GR00T N1은 humanoid foundation model, Gemini Robotics는 VLA와 embodied reasoning, π0.5는 open-world long-horizon generalization, X-VLA는 cross-embodiment adaptation을 각각 대표하는 기준점이다.
OpenVLA-OFT와 SmolVLA는 foundation policy와 실시간 실행계층 사이의 병목을 다룬다. AGENTSAFE와 VLA-Arena는 높은 task success만으로 안전성과 generalization을 설명할 수 없다는 점을 드러낸다.
국내에서는 공간지능·클라우드 로보틱스·제조현장 실증이 중요한 기준점이다
이전 분석은 NAVER LABS의 Spatial AI, HUMANS, ARC를 국내 benchmark로 두었다. ARC는 cloud/on-board AI와 이기종 robot을 대규모 공간정보와 연결한다는 점에서 fleet-level Physical AI와 직접 연결된다. 현대자동차그룹의 제조·휴머노이드·edge AI 결합 역시 산업적 reference point로 해석할 수 있다.
Caution기업별 공개자료는 task 정의와 평가조건이 서로 다르므로 단일 성능순위로 비교하기보다 어떤 계층을 실제 운영환경까지 통합했는지를 비교하는 것이 적절하다.
2032 목표형상: Open Physical AI Fabric
이 명칭과 구조는 공식 ETRI 사업명이 아니라, 앞선 기술·benchmark 분석에서 도출한 전략적 목표형상 제안이다.
Mission에서 Robot Actuation까지 하나의 폐루프를 만든다
이 수직 stack을 가로질러 Real2Sim2Real·Data·Memory·Provenance·Lifelong Learning·Fleet Learning·Benchmark가 순환한다. 실행 인프라는 Edge–6G–Cloud로 연결되고, safety kernel과 human authority는 모델과 독립된 통제계층으로 유지한다.
Analysis핵심 차별점은 Open + Cross-Embodiment + Networked + Verifiable + Continuously Learning이다. 폐쇄적인 단일 robot stack을 하나 더 만드는 것이 아니라 서로 다른 foundation model과 로봇을 교체·결합할 수 있는 공통 운영기반을 만드는 방향이다.
ETRI Physical AI 2032를 일곱 계층으로 압축하면
이 목표형상은 ETRI가 공개적으로 제시한 Robot Foundation Model, multimodal learning, autonomous learning pipeline, scalable humanoid architecture를 상위 플랫폼 구조로 확장한 전략적 해석이다.
2028 → 2030 → 2032: 단계별 완성도를 높인다
초기에는 공통 지능과 안전 기반을 확보하고, 중기에는 whole-body·lifelong·fleet를 결합하며, 최종적으로 networked open platform까지 확장한다.
원천기술 확보 → 통합 → 국가 수준 플랫폼
Core Intelligence
① Generalist RFM/VLA
② Embodiment Abstraction
③ Causal World Model
④ Real2Sim2Real Experience Engine
⑤ Independent Safety Kernel
Embodied Integration
Whole-body foundation model, lifelong learning, edge runtime, multi-robot fleet를 공통 플랫폼 안에서 결합한다. 단일 demo가 아니라 복합 임무와 heterogeneous deployment를 평가한다.
Open Physical AI Fabric
6G–Edge–Cloud, open API/SDK, provenance, fleet learning, benchmark와 독립 safety assurance까지 연결해 국가 수준의 개방형 Physical AI 플랫폼으로 완성한다.
가장 먼저 잡아야 할 다섯 축
01 · Generalist RFM/VLA
다양한 task와 embodiment에 재사용되는 공통 지능코어.
02 · Embodiment Abstraction
새 robot을 빠르게 연결하는 HAL/adapter 계층.
03 · Causal World Model
실행 전에 미래·실패·위험을 예측하는 predictive layer.
04 · Experience Engine
Real2Sim2Real과 synthetic data로 물리경험을 규모화.
05 · Safety Kernel
VLA와 독립된 verification·override·runtime assurance.
Strategic rationale이 다섯 기술은 이후 whole-body control, fleet intelligence, lifelong learning, open interface를 얹을 수 있는 플랫폼의 최소 공통 기반이라는 점에서 우선순위가 높다.
KPI는 성능뿐 아니라 “새 로봇을 붙이는 비용”까지 측정해야 한다
범용 플랫폼의 진짜 경쟁력은 benchmark score 하나보다 coverage, adaptation cost, latency, safety, reproducibility를 함께 줄이는 데 있다.
범용성의 분모에는 비용이 들어가야 한다
Proposed metric이 식은 기존 표준 metric이 아니라 앞선 분석에서 제안한 평가관점이다. 새 robot에서도 높은 success rate를 내지만 수개월의 integration이 필요하다면 “범용 플랫폼”이라고 부르기 어렵다는 문제의식을 반영한다.
모델 경쟁에서 플랫폼 경쟁으로
2028~2032년의 핵심 전환은 “더 큰 VLA”에서 “운영 가능한 Physical AI Fabric”으로 이동하는 것이다. 여기서 ETRI의 차별점은 통신·네트워크·엣지·데이터·AI·시스템을 함께 다룰 수 있다는 점을 Physical AI의 결합계층으로 가져오는 데 있다.
최종 목표는 하나의 로봇이 똑똑해지는 것이 아니라, 새로운 로봇과 임무가 추가될수록 플랫폼 전체가 더 재사용 가능하고 더 검증 가능하며 더 안전해지는 구조이다.
연구·산업 기준점
아래 출처는 이전 분석에서 사용한 대표 원문이다. KPI 자체는 제안 목표이며, 각 출처의 성능수치를 직접 2032 목표로 등치하지 않는다.