SUNGSOO KIM / AI RESEARCH

PHYSICAL AI · EMBODIED INTELLIGENCE · SYSTEMS

그럴듯한 움직임에서 검증된 물리 실행으로

From Plausible Motion to Verified Physical Execution — 3D 기하, 접촉, 행동 정렬, 전신 제어, 안전, 에너지와 운영을 하나의 검증 사슬로 읽는 연구 지도

관측에서 검증된 물리 실행까지의 닫힌 순환데이터와 3차원 관측이 세계모델과 지시 해석을 거쳐 행동 정책, 전신 제어, 안전 필터와 실행으로 이어지고, 실행 기록이 다시 학습과 검증으로 돌아간다.DATA + 3D경험·기하·접촉WORLD MODEL미래·물리 상태VLA / POLICY지시·행동 정렬WHOLE BODY계획·접촉·제어SAFE EXECUTION필터·중단·복구EDGE / CLOUD지연·에너지·분할EVALUATION능력·위험·비용OPERATIONS기록·회귀·개선범용성 = 전이 가능한 능력 × 검증 가능한 연결
편집 종합. 단일 모델의 평균 성공률이 아니라, 기하·접촉·정책·제어·안전·연산·운영의 연결이 실제 임무에서 함께 성립해야 풀 스택 수준의 근거가 된다.

점선은 검증된 실행 기록을 데이터와 학습으로 되돌리는 개선 경로다. 안전은 마지막 모듈 하나가 아니라 모든 층의 계약과 관측 가능성에 의존한다.

로봇이 “그럴듯한 미래”를 생성하는 것과, 그 미래를 정확한 3차원 좌표·접촉·전력·안전 제약 안에서 실행하는 것은 다른 문제다. 최근 연구는 이 차이를 더 선명하게 만든다.

검증된 서지 2025년 1월 1일부터 2026년 10월 8일 KST까지 공개된 1차 연구 기록을 조사했다. 논문 보고 수치는 저자 결과이며 독립 재현이 아니다. 편집 해석은 서로 다른 논문을 스택으로 연결한 판단, 창의적 제안은 향후 연구 프로그램이다.

범위와 한계. “범용 Physical AI 풀 스택”은 확립된 학술 표준명이 아니다. Physical AI·embodied AI·VLA·world models·전신 제어·안전·데이터·edge/cloud·배포/운영을 통합하기 위한 작업 정의다. 다수 자료가 arXiv 프리프린트·기술보고서이며, 서로 다른 로봇·과제·데이터의 결과를 직접 순위화하지 않는다. 논문 전체 조합을 하나의 시스템으로 재현한 연구는 확인하지 못했다.

PART 01 · DEFINITION

범용성은 거대 모델이 아니라 전이와 운용의 곱이다

작업 정의 범용 Physical AI 풀 스택은 여러 과제·환경·로봇 형태에서 관측과 언어 목표를 물리적으로 실행 가능한 행동으로 변환하고, 결과를 예측·감시·복구하며, 검증된 경험으로 개선하는 통합 시스템이다. 센서·액추에이터, 데이터, 3D 표현, 세계모델, VLA, 계획, 전신 제어, 안전, edge/cloud 연산, 배포·평가·운영을 포함한다.

범용 정책 모델과 범용 운용 시스템은 동일하지 않다. GR00T N1·Gemini Robotics·π0.5·π0.7은 정책 전이를 확장하지만 좌표 보정·제어 마감·안전 필터·에너지·회귀시험까지 동시에 검증하지 않는다.[2][3][4][6]

범용성을 새 과제, 새 장면, 새 embodiment, 장기 수행, 실패 복구, 자원 제약, 지시 변경의 일곱 축으로 측정한다. 이는 본 글의 평가 틀이다.

PART 02 · PROBLEM DEFINITION

불완전한 관측 아래 목표·물리·위험을 함께 최적화하기

과제 g, embodiment e, 관측 이력 h로 belief b를 만들고 정책 π가 행동 a를 선택한다. 세계모델은 다음 상태를 예측하지만 실제 실행에는 좌표계, 접촉, 액추에이터 한계, 지연과 전력 예산이 들어온다.

min E[task loss + λ₁·risk + λ₂·energy + λ₃·latency + λ₄·adaptation cost]
subject to physical feasibility, safety invariants, deadlines, calibrated frames, bounded update authority

편집 해석 문제는 성공률 최대화가 아니라 분포 변화 속에서 임무 가치와 위험·비용을 함께 제한하는 폐루프 시스템 설계다. LBA-CBF의 보증도 참 동역학을 대표하는 후보가 유지되고 제약이 실행 가능하다는 조건에서만 성립한다.[17]

모델 수준 검증은 표현·예측·행동 생성의 품질을 본다. 스택 수준 검증은 모델이 센서, 제어기, 안전 장치, 컴퓨팅, 사람의 개입 절차와 연결된 채 반복 임무를 수행하는지를 본다. 두 수준을 분리하지 않으면 video quality·offline 정확도·선호 점수가 실제 성공의 대리 지표로 오인된다.[18]

PART 03 · CORE CONCEPTS

여덟 개 층과 네 개 횡단 계약

층역할대표 근거검증 질문
데이터·경험실물·영상·합성·실패 provenanceCosmos, GR00T [1][2]현장 분포를 대표하는가?
3D·상태metric depth, 좌표 보정DepthWorld [14]영상과 기하가 함께 일관적인가?
세계모델행동 조건 미래·실패 예측Cosmos, FAVOR [1][12]오류가 행동·위험으로 어떻게 전파되는가?
VLA·추론언어·시각·행동 연결Gemini, π, grounding gap [3][11]지시가 실제 선택을 통제하는가?
접촉·전신힘·균형·관절 제약MIM-VLA, ResMimic, Horizon [15][5][19]접촉·장기 단계 실패를 감지하는가?
안전·복구진단, 차단, 재계획FEARL, Foresight, LBA-CBF [8][9][17]보증 가정·fallback이 명시됐는가?
연산·통신정밀도, 전력, edge/cloudActTune, PhysAI-Bench [16][10]성공당 에너지·tail latency는?
평가·운영adapter, 로그, 회귀, 승인Inspect Robots [13]업데이트 뒤 다시 검증하는가?

횡단 계약 좌표계·시간, 불확실성, 안전 속성, provenance의 네 계약이 층 사이를 관통해야 한다. 인터페이스의 단위·시간 기준이 다르면 좋은 모델끼리 연결해도 좋은 시스템이 되지 않는다.

PART 04 · INTRODUCTION

2025년 이후 진전은 “하나의 뇌”보다 연결의 다양화에 있다

Cosmos는 비디오 큐레이션·토크나이저·세계모델을 플랫폼으로 묶었고, GR00T N1은 VLM 기반 고수준 추론과 diffusion 행동 생성을 결합했다.[1][2] Gemini Robotics와 π0.5는 새로운 물체·과제·가정 환경의 일반화를 전면에 놓았다.[3][4]

후속 연구는 이 낙관을 세분화했다. grounding gap은 지시 정보가 내부에 인코딩돼도 행동을 통제하지 않을 수 있음을 보였고, FAVOR는 예측 미래를 실행 중 검증·복구에 사용했다.[11][12] 최신 논문은 RGB의 3D 불일치, 모터 접촉 신호, 에너지, 급격한 동역학 변화, 선호 최적화의 실물 실패, 장기 전신 과제를 분리한다.

핵심 독해 Physical AI는 모델 아키텍처 경쟁에서 “어떤 계약이 실제 실행을 보존하는가”라는 시스템 연구로 이동 중이다. 이는 분야 합의가 아니라 본 글의 편집 해석이다.

PART 05 · MOTIVATION AND BACKGROUND

데이터 규모만으로 닫히지 않는 세 개의 현실 간극

의미 간극

웹·로봇 데이터를 함께 학습해 의미 지식과 행동 prior를 넓혀도, 동일 장면에서 지시만 바꿨을 때 행동 대상이 함께 바뀌는지는 별도 시험이 필요하다.[4][11]

기하·접촉 간극

픽셀상 그럴듯한 비디오는 metric depth, 카메라 extrinsics, 충돌·마찰을 보장하지 않는다. DepthWorld와 MIM-VLA는 각각 3D 보정과 모터 전류 기반 접촉 정보를 정책에 끌어온다.[14][15]

배포 간극

평균 성공률은 전력 제한, tail latency, 네트워크 장애, payload·마찰 변화, 업데이트 승인 절차를 포함하지 않는다. ActTune과 LBA-CBF는 compute와 적응형 안전을 별도 연구 대상으로 만든다.[16][17]

질문은 “학습할 수 있는가”에서 “변화 중에도 관측·제약·책임을 유지할 수 있는가”로 확장된다.

PART 06 · CHALLENGES

범용성의 병목은 연결부에서 증폭된다

  1. 표현–행동 불일치: latent·선호 모델이 잘 맞아도 목표 포즈와 액션이 어긋날 수 있다.[18]
  2. 좌표 오차: 작은 보정 오차가 3D 정책과 grasp target에 누적된다.[14]
  3. 부분 관측 접촉: 영상만으로 저항·미끄럼·힘을 보기 어렵고, 모터 신호도 calibrated force는 아니다.[15]
  4. 장기 신용 할당: 이동–접근–잡기–운반의 초기 실패가 뒤 단계 학습을 오염시킨다.[19]
  5. 동역학 급변: payload·바람·마찰 변화가 고정 모델 안전 필터의 가정을 무너뜨린다.[17]
  6. 자원 변동: 정밀도·GPU 주파수를 지연·에너지·행동 품질과 함께 최적화해야 한다.[16]
  7. 평가 파편화: 종료·adapter·센서 조건이 다르면 성공률을 재사용하기 어렵다.[13]

시스템 효과 잘못 보정된 depth가 target을 흔들고 지연이 safety margin을 줄이며, 불명확한 실패 로그가 다음 학습 데이터에 들어간다. 평균 오류보다 오류 전파 경로를 검증해야 한다.

PART 07 · RESEARCH QUESTIONS

모델 점수를 시스템 과학의 질문으로 바꾸기

질문최소 실험 설계지표
RQ1. 지시가 행동을 인과적으로 통제하는가?장면 고정·목표 변경, 표현·행동 동시 측정지시 민감도, 목표 선택
RQ2. 3D 일관성이 downstream 성공을 높이는가?RGB-only/RGB-depth 동일 예산, 보정 교란reprojection, depth, success, risk
RQ3. proprioception은 접촉 판단에 충분한가?모터·영상·촉각·FT 제거/결합접촉 F1, 손상, 검출 지연
RQ4. 적응 안전은 어떤 변화율까지 유지되는가?payload·바람·마찰, 후보 누락violation, feasibility, intervention
RQ5. 성공당 에너지 이득이 긴 임무에도 유지되는가?행동 단계별 precision/DVFS와 열 상태J/success, p95 latency, 온도
RQ6. offline 정렬 점수는 실물 실행을 예측하는가?선호 정확도·video quality와 action error 분리상관, calibration, 실물 성공
RQ7. 전체 스택 업데이트를 안전하게 승인할 수 있는가?모델·adapter·제어·센서 회귀 matrix능력 보존, rollback 시간

PART 08 · APPROACHES (METHODS)

학습에서 운영까지 방법을 여섯 묶음으로 구성하기

A. 혼합 데이터와 계층 정책

GR00T N1의 VLM System 2+diffusion System 1, π0.5의 웹·다중 로봇 co-training, π0.7의 하위목표 이미지·metadata conditioning이 대표적이다.[2][4][6]

B. 3D world model과 실행 anchor

DepthWorld는 stereo depth와 factor graph로 shared kinematics·scene extrinsics를 보정한 뒤 multi-view RGB-depth를 생성한다.[14] FAVOR는 생성 미래를 anchor로 관측·행동 이탈을 감지한다.[12]

C. 상호작용 토큰과 전신 curriculum

MIM-VLA는 motor current·position·velocity·validity를 128차원 interaction token으로 만든다.[15] ResMimic은 motion tracking에 residual policy를, Humanoid Horizon은 parallel training·dynamic starting·reward gating을 쓴다.[5][19]

D. 조건부 형식 안전과 진단

FEARL은 큰 controller와 작은 safety module을 분리한다.[8] LBA-CBF는 예측 오차로 후보 동역학을 순위화하고 high-order CBF를 적용한다.[17] ForesightSafety-VLA는 위험 유형과 노출 시간을 분리한다.[9]

E. 행동 인지형 시스템 최적화

ActTune은 layer precision decision tree와 workload forecast 기반 GPU frequency/power cap을 결합한다.[16] LIBERO·특정 GPU의 “최대” 수치이며 모든 edge/cloud 토폴로지로 외삽할 수 없다.

F. 반례 중심 정렬과 재사용 평가

AutodidactWAM은 손 pose estimator·IK gate와 hybrid DPO+SFT+DTW로 video-action asymmetry를 다룬다.[18] Inspect Robots는 task·policy·adapter·embodiment·로그를 연결한다.[13] 방법은 성능 향상뿐 아니라 어떤 proxy가 실패했는지 남겨야 한다.

PART 09 · KEY APPLICATIONS

응용마다 다른 검증 계약이 필요하다

응용가치필수 검증근거 경계
가정 모바일 조작새 집·물체·장기 정리지시 변경, 사람 근접, 복구π0.5 새 가정 실험은 상시 운용 보증 아님 [4]
휴머노이드 제조·물류이동+양손 조작균형, 접촉, takt timeResMimic·Horizon 조건 밖 생산성 미검증 [5][19]
정밀 조립·검사접촉 기반 품질힘 calibration, 손상, 추적성MIM-VLA 3개 과제·13쌍을 범용 tactile로 일반화 불가 [15]
UAV·시설 점검센서·도구·통신 판단비행 제어, 링크 단절PhysAI-Bench는 의사결정 평가 [10]
자율 실험실조작+실험 상태오염·정밀도·provenance본 글의 확장 제안; 직접 실증 아님
재난·현장 서비스동역학·통신 변화 대응적응 안전, energy budgetLBA-CBF+ActTune 통합 현장 실증 없음 [16][17]

산업 성과는 데모 성공보다 변종 작업을 추가할 때 데이터·통합·재검증 비용이 얼마나 감소하는가로 측정해야 한다.

PART 10 · OPEN PROBLEMS

아직 닫히지 않은 일곱 문제

  • 물리적으로 유효한 세계모델: RGB·depth 일관성이 힘·마찰·deformable object까지 보존하는가?
  • proxy-to-action calibration: video quality·preference accuracy·latent probing이 실물 action error를 예측하는가?
  • 센서 최소충분성: motor current, vision, tactile, force/torque의 비용 대비 충분한 조합은?
  • 안전 가정 런타임 감시: 후보 동역학의 대표성과 barrier feasibility를 어떻게 감지하는가?
  • 장기·조합적 범용성: 기술을 처음 보는 순서·물체·embodiment에서 결합해도 유지되는가?
  • edge/cloud 공동 검증: jitter·열 throttling·전력 제한이 정책과 safety deadline에 미치는 영향은?
  • 지속 학습 변경 관리: 어떤 실패를 학습하고 누가 업데이트를 승인·rollback하는가?

확인된 사실 논문들은 서로 다른 부분 문제를 실험했다. 편집 해석 전체를 결합한 장기 현장 검증은 확인하지 못했다. 형식 보증은 지정 속성과 가정 안에서만 성립하며 프리프린트 수치는 독립 재현이 아니다.

PART 11 · FUTURE DIRECTIONS

검증 비용을 줄이는 연구 프로그램

창의적 제안 목표를 “모든 행동을 한 모델에 넣기”보다 새 과제·로봇·환경을 추가할 때 실물 데이터와 재검증 비용을 줄이는 것으로 정식화할 수 있다.

  1. Physical Execution Record: 지시, 좌표계, 관측, 예측, 행동, 안전 개입, 결과, 에너지·지연을 provenance graph로 기록.
  2. 3D–action consistency test: depth·extrinsics 교란이 grasp·collision·복구에 미치는 민감도 측정.
  3. Safety envelope contract: skill별 물체·힘·공간·지연 범위와 fallback을 기계 판독 형식으로 배포.
  4. Counterexample factory: grounding gap·video-action asymmetry·후보 누락을 자동 탐색하고 실물 재확인.
  5. Success-per-joule certification: FPS 대신 성공당 에너지, p95 지연, 열 상태, 안전 개입을 공동 보고.
  6. Shadow-to-authority deployment: shadow→제한 envelope→감독 실행→조건부 자율로 승격하고 rollback 기준 명시.
단계공동 산출물진입 조건
공통 검증 기반provenance, 좌표·시간 계약, 실패 taxonomy정책·제어·센서·네트워크 오류 분리 재현
검증된 단일 로봇VLA–world model–safety–compute 통합성공·위험·에너지·개입 비용 보고
다중 embodimentskill 계약, adapter conformance, 회귀시험적응 비용 감소와 기존 능력 보존
현장 fleet승인·rollback·사고 분석 governance장기 drift의 감사 가능한 대응

전략기획 시사점 모델·센서·제어·통신·안전·데이터 과제를 별도 KPI로만 관리하지 말고 공통 임무의 evidence gate로 연결해야 한다. 최고 성공률 외에 transfer cost, violation budget, intervention rate, energy per success, rollback time을 공동 KPI로 삼을 수 있다.

EVIDENCE MAP

근거 비교표: 기여와 외삽 한계

논문 / 최초 공개기여·저자 보고조건과 한계
[1] Cosmos WFM Platform
2025-01-07
큐레이션·토크나이저·세계모델·후속학습생성 품질이 접촉·정책 안전을 증명하지 않음
[2] GR00T N1
2025-03-18
VLM System 2+diffusion System 1, 혼합 데이터모든 로봇·전신 작업 보증 아님
[3] Gemini Robotics
2025-03-25
VLA와 Robotics-ERfine-tuning·환경 조건 포함 독해 필요
[4] π0.5
2025-04-22
웹·다중 로봇·의미 하위과제 co-training새 가정 결과를 무제한 open-world로 외삽 불가
[5] ResMimic
2025-10-06
motion tracking+residual policy·접촉·물체 보상simulation·Unitree G1 조건
[6] π0.7
2026-04-16
하위목표 이미지·metadata conditioning일반화는 보고 과제에 한정
[7] Embodied-R1.5
2026-06-09
인지·계획·수정·pointing 통합추론 benchmark≠실시간 안전
[8] Verifiable FM for Robot Safety
2026-06-22
큰 controller와 검증 가능 safety module 분리지정 속성·관측·모델 가정 의존
[9] ForesightSafety-VLA
2026-06-25
위험 유형·누적 비용·노출 시간RoboTwin 66 시나리오·5 embodiment
[10] PhysAI-Bench
2026-09-20
UAV 센서·도구·협업·네트워크 의사결정실기체 비행·인증 아님
[11] Encoded but Not in Control
2026-10-05 · v1
동일 장면·지시 변경 grounding gap4개 simulation, 2개 real-world VLA
[12] FAVOR
2026-10-05 · v1
미래 anchor 기반 이탈 감지·복구LIBERO simulation; 안전 보증 아님
[13] Inspect Robots
2026-10-05 · v1
task·policy·adapter·embodiment·로그8개 mini-task·6개 정책; 인증 아님
[14] DepthWorld
2026-10-06 · CoRL 2026 수락 표기
DROID-3D; RGB-depth 생성, PSNR +1.48dBdownstream 정책 안전·일반화 미증명
[15] MIM-VLA
2026-10-06 · v1
모터 interaction token; 13쌍 75.0% 대 48.8%3개 실물 과제; calibrated force 아님
[16] ActTune
2026-10-06 · v1
precision·GPU 제어; 최대 2.02×, 에너지 76.8%↓LIBERO·특정 hardware 최대치
[17] LBA-CBF
2026-10-06 · v1
후보 동역학+high-order CBF참 후보 유지·feasibility 조건
[18] AutodidactWAM
2026-10-06 · arXiv v1
video-action asymmetry; hybrid full-task 20%/30%Unitree G1 소규모 실물; plain DPO 0%는 일반 법칙 아님
[19] Humanoid Horizon
2026-10-06 · v1
장기 curriculum; 두 물체 단계별 >80%350 train/66 held-out; 물체 수 증가 시 저하

PRIMARY SOURCES & LIMITATIONS

출처 URL과 검토 경계

날짜는 arXiv 최초 제출일 기준이다. 수락·제출 상태는 저자 표기가 있을 때만 적었다. 원문 초록과 제공된 본문을 검토했으나 실험을 재현하지 않았다.

  1. Cosmos World Foundation Model Platform for Physical AIarXiv technical reporthttps://arxiv.org/abs/2501.03575
  2. GR00T N1arXiv research recordhttps://arxiv.org/abs/2503.14734
  3. Gemini RoboticsarXiv technical reporthttps://arxiv.org/abs/2503.20020
  4. π0.5https://arxiv.org/abs/2504.16054
  5. ResMimichttps://arxiv.org/abs/2510.05070
  6. π0.7https://arxiv.org/abs/2604.15483
  7. Embodied-R1.5https://arxiv.org/abs/2606.11324
  8. Verifiable Foundation Models for Robot SafetyarXiv v1https://arxiv.org/abs/2606.23754v1
  9. ForesightSafety-VLAhttps://arxiv.org/abs/2606.27079
  10. PhysAI-Benchhttps://arxiv.org/abs/2609.23695
  11. Encoded but Not in ControlarXiv v1https://arxiv.org/abs/2610.06235v1
  12. Future Anchored Verification and Online Recovery for World Action ModelsarXiv v1https://arxiv.org/abs/2610.06280v1
  13. Inspect RobotsarXiv v1; workshop submission statedhttps://arxiv.org/abs/2610.06306v1
  14. DepthWorld: 3D World Model for Robot ManipulationCoRL 2026 accepted as statedhttps://arxiv.org/abs/2610.08780
  15. MIM-VLAarXiv v1https://arxiv.org/abs/2610.08425
  16. ActTunearXiv v1https://arxiv.org/abs/2610.08444
  17. Learning-based Adaptive Control Barrier FunctionsarXiv v1https://arxiv.org/abs/2610.08765
  18. AutodidactWAMarXiv v1 preprinthttps://arxiv.org/abs/2610.08119
  19. Humanoid HorizonarXiv v1https://arxiv.org/abs/2610.08320