로봇이 “그럴듯한 미래”를 생성하는 것과, 그 미래를 정확한 3차원 좌표·접촉·전력·안전 제약 안에서 실행하는 것은 다른 문제다. 최근 연구는 이 차이를 더 선명하게 만든다.
검증된 서지 2025년 1월 1일부터 2026년 10월 8일 KST까지 공개된 1차 연구 기록을 조사했다. 논문 보고 수치는 저자 결과이며 독립 재현이 아니다. 편집 해석은 서로 다른 논문을 스택으로 연결한 판단, 창의적 제안은 향후 연구 프로그램이다.
범위와 한계. “범용 Physical AI 풀 스택”은 확립된 학술 표준명이 아니다. Physical AI·embodied AI·VLA·world models·전신 제어·안전·데이터·edge/cloud·배포/운영을 통합하기 위한 작업 정의다. 다수 자료가 arXiv 프리프린트·기술보고서이며, 서로 다른 로봇·과제·데이터의 결과를 직접 순위화하지 않는다. 논문 전체 조합을 하나의 시스템으로 재현한 연구는 확인하지 못했다.
PART 01 · DEFINITION
범용성은 거대 모델이 아니라 전이와 운용의 곱이다
작업 정의 범용 Physical AI 풀 스택은 여러 과제·환경·로봇 형태에서 관측과 언어 목표를 물리적으로 실행 가능한 행동으로 변환하고, 결과를 예측·감시·복구하며, 검증된 경험으로 개선하는 통합 시스템이다. 센서·액추에이터, 데이터, 3D 표현, 세계모델, VLA, 계획, 전신 제어, 안전, edge/cloud 연산, 배포·평가·운영을 포함한다.
범용 정책 모델과 범용 운용 시스템은 동일하지 않다. GR00T N1·Gemini Robotics·π0.5·π0.7은 정책 전이를 확장하지만 좌표 보정·제어 마감·안전 필터·에너지·회귀시험까지 동시에 검증하지 않는다.[2][3][4][6]
범용성을 새 과제, 새 장면, 새 embodiment, 장기 수행, 실패 복구, 자원 제약, 지시 변경의 일곱 축으로 측정한다. 이는 본 글의 평가 틀이다.
PART 02 · PROBLEM DEFINITION
불완전한 관측 아래 목표·물리·위험을 함께 최적화하기
과제 g, embodiment e, 관측 이력 h로 belief b를 만들고 정책 π가 행동 a를 선택한다. 세계모델은 다음 상태를 예측하지만 실제 실행에는 좌표계, 접촉, 액추에이터 한계, 지연과 전력 예산이 들어온다.
subject to physical feasibility, safety invariants, deadlines, calibrated frames, bounded update authority
편집 해석 문제는 성공률 최대화가 아니라 분포 변화 속에서 임무 가치와 위험·비용을 함께 제한하는 폐루프 시스템 설계다. LBA-CBF의 보증도 참 동역학을 대표하는 후보가 유지되고 제약이 실행 가능하다는 조건에서만 성립한다.[17]
모델 수준 검증은 표현·예측·행동 생성의 품질을 본다. 스택 수준 검증은 모델이 센서, 제어기, 안전 장치, 컴퓨팅, 사람의 개입 절차와 연결된 채 반복 임무를 수행하는지를 본다. 두 수준을 분리하지 않으면 video quality·offline 정확도·선호 점수가 실제 성공의 대리 지표로 오인된다.[18]
PART 03 · CORE CONCEPTS
여덟 개 층과 네 개 횡단 계약
횡단 계약 좌표계·시간, 불확실성, 안전 속성, provenance의 네 계약이 층 사이를 관통해야 한다. 인터페이스의 단위·시간 기준이 다르면 좋은 모델끼리 연결해도 좋은 시스템이 되지 않는다.
PART 04 · INTRODUCTION
2025년 이후 진전은 “하나의 뇌”보다 연결의 다양화에 있다
Cosmos는 비디오 큐레이션·토크나이저·세계모델을 플랫폼으로 묶었고, GR00T N1은 VLM 기반 고수준 추론과 diffusion 행동 생성을 결합했다.[1][2] Gemini Robotics와 π0.5는 새로운 물체·과제·가정 환경의 일반화를 전면에 놓았다.[3][4]
후속 연구는 이 낙관을 세분화했다. grounding gap은 지시 정보가 내부에 인코딩돼도 행동을 통제하지 않을 수 있음을 보였고, FAVOR는 예측 미래를 실행 중 검증·복구에 사용했다.[11][12] 최신 논문은 RGB의 3D 불일치, 모터 접촉 신호, 에너지, 급격한 동역학 변화, 선호 최적화의 실물 실패, 장기 전신 과제를 분리한다.
핵심 독해 Physical AI는 모델 아키텍처 경쟁에서 “어떤 계약이 실제 실행을 보존하는가”라는 시스템 연구로 이동 중이다. 이는 분야 합의가 아니라 본 글의 편집 해석이다.
PART 05 · MOTIVATION AND BACKGROUND
데이터 규모만으로 닫히지 않는 세 개의 현실 간극
의미 간극
웹·로봇 데이터를 함께 학습해 의미 지식과 행동 prior를 넓혀도, 동일 장면에서 지시만 바꿨을 때 행동 대상이 함께 바뀌는지는 별도 시험이 필요하다.[4][11]
기하·접촉 간극
픽셀상 그럴듯한 비디오는 metric depth, 카메라 extrinsics, 충돌·마찰을 보장하지 않는다. DepthWorld와 MIM-VLA는 각각 3D 보정과 모터 전류 기반 접촉 정보를 정책에 끌어온다.[14][15]
배포 간극
평균 성공률은 전력 제한, tail latency, 네트워크 장애, payload·마찰 변화, 업데이트 승인 절차를 포함하지 않는다. ActTune과 LBA-CBF는 compute와 적응형 안전을 별도 연구 대상으로 만든다.[16][17]
질문은 “학습할 수 있는가”에서 “변화 중에도 관측·제약·책임을 유지할 수 있는가”로 확장된다.
PART 06 · CHALLENGES
범용성의 병목은 연결부에서 증폭된다
- 표현–행동 불일치: latent·선호 모델이 잘 맞아도 목표 포즈와 액션이 어긋날 수 있다.[18]
- 좌표 오차: 작은 보정 오차가 3D 정책과 grasp target에 누적된다.[14]
- 부분 관측 접촉: 영상만으로 저항·미끄럼·힘을 보기 어렵고, 모터 신호도 calibrated force는 아니다.[15]
- 장기 신용 할당: 이동–접근–잡기–운반의 초기 실패가 뒤 단계 학습을 오염시킨다.[19]
- 동역학 급변: payload·바람·마찰 변화가 고정 모델 안전 필터의 가정을 무너뜨린다.[17]
- 자원 변동: 정밀도·GPU 주파수를 지연·에너지·행동 품질과 함께 최적화해야 한다.[16]
- 평가 파편화: 종료·adapter·센서 조건이 다르면 성공률을 재사용하기 어렵다.[13]
시스템 효과 잘못 보정된 depth가 target을 흔들고 지연이 safety margin을 줄이며, 불명확한 실패 로그가 다음 학습 데이터에 들어간다. 평균 오류보다 오류 전파 경로를 검증해야 한다.
PART 07 · RESEARCH QUESTIONS
모델 점수를 시스템 과학의 질문으로 바꾸기
PART 08 · APPROACHES (METHODS)
학습에서 운영까지 방법을 여섯 묶음으로 구성하기
A. 혼합 데이터와 계층 정책
GR00T N1의 VLM System 2+diffusion System 1, π0.5의 웹·다중 로봇 co-training, π0.7의 하위목표 이미지·metadata conditioning이 대표적이다.[2][4][6]
B. 3D world model과 실행 anchor
DepthWorld는 stereo depth와 factor graph로 shared kinematics·scene extrinsics를 보정한 뒤 multi-view RGB-depth를 생성한다.[14] FAVOR는 생성 미래를 anchor로 관측·행동 이탈을 감지한다.[12]
C. 상호작용 토큰과 전신 curriculum
MIM-VLA는 motor current·position·velocity·validity를 128차원 interaction token으로 만든다.[15] ResMimic은 motion tracking에 residual policy를, Humanoid Horizon은 parallel training·dynamic starting·reward gating을 쓴다.[5][19]
D. 조건부 형식 안전과 진단
FEARL은 큰 controller와 작은 safety module을 분리한다.[8] LBA-CBF는 예측 오차로 후보 동역학을 순위화하고 high-order CBF를 적용한다.[17] ForesightSafety-VLA는 위험 유형과 노출 시간을 분리한다.[9]
E. 행동 인지형 시스템 최적화
ActTune은 layer precision decision tree와 workload forecast 기반 GPU frequency/power cap을 결합한다.[16] LIBERO·특정 GPU의 “최대” 수치이며 모든 edge/cloud 토폴로지로 외삽할 수 없다.
F. 반례 중심 정렬과 재사용 평가
AutodidactWAM은 손 pose estimator·IK gate와 hybrid DPO+SFT+DTW로 video-action asymmetry를 다룬다.[18] Inspect Robots는 task·policy·adapter·embodiment·로그를 연결한다.[13] 방법은 성능 향상뿐 아니라 어떤 proxy가 실패했는지 남겨야 한다.
PART 09 · KEY APPLICATIONS
응용마다 다른 검증 계약이 필요하다
산업 성과는 데모 성공보다 변종 작업을 추가할 때 데이터·통합·재검증 비용이 얼마나 감소하는가로 측정해야 한다.
PART 10 · OPEN PROBLEMS
아직 닫히지 않은 일곱 문제
- 물리적으로 유효한 세계모델: RGB·depth 일관성이 힘·마찰·deformable object까지 보존하는가?
- proxy-to-action calibration: video quality·preference accuracy·latent probing이 실물 action error를 예측하는가?
- 센서 최소충분성: motor current, vision, tactile, force/torque의 비용 대비 충분한 조합은?
- 안전 가정 런타임 감시: 후보 동역학의 대표성과 barrier feasibility를 어떻게 감지하는가?
- 장기·조합적 범용성: 기술을 처음 보는 순서·물체·embodiment에서 결합해도 유지되는가?
- edge/cloud 공동 검증: jitter·열 throttling·전력 제한이 정책과 safety deadline에 미치는 영향은?
- 지속 학습 변경 관리: 어떤 실패를 학습하고 누가 업데이트를 승인·rollback하는가?
확인된 사실 논문들은 서로 다른 부분 문제를 실험했다. 편집 해석 전체를 결합한 장기 현장 검증은 확인하지 못했다. 형식 보증은 지정 속성과 가정 안에서만 성립하며 프리프린트 수치는 독립 재현이 아니다.
PART 11 · FUTURE DIRECTIONS
검증 비용을 줄이는 연구 프로그램
창의적 제안 목표를 “모든 행동을 한 모델에 넣기”보다 새 과제·로봇·환경을 추가할 때 실물 데이터와 재검증 비용을 줄이는 것으로 정식화할 수 있다.
- Physical Execution Record: 지시, 좌표계, 관측, 예측, 행동, 안전 개입, 결과, 에너지·지연을 provenance graph로 기록.
- 3D–action consistency test: depth·extrinsics 교란이 grasp·collision·복구에 미치는 민감도 측정.
- Safety envelope contract: skill별 물체·힘·공간·지연 범위와 fallback을 기계 판독 형식으로 배포.
- Counterexample factory: grounding gap·video-action asymmetry·후보 누락을 자동 탐색하고 실물 재확인.
- Success-per-joule certification: FPS 대신 성공당 에너지, p95 지연, 열 상태, 안전 개입을 공동 보고.
- Shadow-to-authority deployment: shadow→제한 envelope→감독 실행→조건부 자율로 승격하고 rollback 기준 명시.
전략기획 시사점 모델·센서·제어·통신·안전·데이터 과제를 별도 KPI로만 관리하지 말고 공통 임무의 evidence gate로 연결해야 한다. 최고 성공률 외에 transfer cost, violation budget, intervention rate, energy per success, rollback time을 공동 KPI로 삼을 수 있다.
EVIDENCE MAP
근거 비교표: 기여와 외삽 한계
PRIMARY SOURCES & LIMITATIONS
출처 URL과 검토 경계
날짜는 arXiv 최초 제출일 기준이다. 수락·제출 상태는 저자 표기가 있을 때만 적었다. 원문 초록과 제공된 본문을 검토했으나 실험을 재현하지 않았다.
- Cosmos World Foundation Model Platform for Physical AIarXiv technical reporthttps://arxiv.org/abs/2501.03575
- GR00T N1arXiv research recordhttps://arxiv.org/abs/2503.14734
- Gemini RoboticsarXiv technical reporthttps://arxiv.org/abs/2503.20020
- π0.5https://arxiv.org/abs/2504.16054
- ResMimichttps://arxiv.org/abs/2510.05070
- π0.7https://arxiv.org/abs/2604.15483
- Embodied-R1.5https://arxiv.org/abs/2606.11324
- Verifiable Foundation Models for Robot SafetyarXiv v1https://arxiv.org/abs/2606.23754v1
- ForesightSafety-VLAhttps://arxiv.org/abs/2606.27079
- PhysAI-Benchhttps://arxiv.org/abs/2609.23695
- Encoded but Not in ControlarXiv v1https://arxiv.org/abs/2610.06235v1
- Future Anchored Verification and Online Recovery for World Action ModelsarXiv v1https://arxiv.org/abs/2610.06280v1
- Inspect RobotsarXiv v1; workshop submission statedhttps://arxiv.org/abs/2610.06306v1
- DepthWorld: 3D World Model for Robot ManipulationCoRL 2026 accepted as statedhttps://arxiv.org/abs/2610.08780
- MIM-VLAarXiv v1https://arxiv.org/abs/2610.08425
- ActTunearXiv v1https://arxiv.org/abs/2610.08444
- Learning-based Adaptive Control Barrier FunctionsarXiv v1https://arxiv.org/abs/2610.08765
- AutodidactWAMarXiv v1 preprinthttps://arxiv.org/abs/2610.08119
- Humanoid HorizonarXiv v1https://arxiv.org/abs/2610.08320