SUNGSOO KIM · AI RESEARCH출처와 검증 범위
PHYSICAL AI · EMBODIED INTELLIGENCE · SURVEY REVIEW

생성형 AI가 몸을 얻을 때Physical AI를 움직이는 다섯 모델군

From Foundation Models to Closed-Loop Embodiment

2026-10-11 KST · 첨부 리뷰 논문 종합 · 25쪽 · 5개 모델군 · 7개 응용 영역

다섯 생성 모델군이 연결되는 Physical AI 폐루프다양한 센서와 시연 데이터가 모델을 학습시키고, World Foundation Model은 시뮬레이션과 데이터를 생성하며, Robot Foundation Model과 Vision Language Action model은 지각에서 행동으로 연결한다. Large Behavior Model은 자연스러운 움직임 prior를, Diffusion Policy Model은 시계열적으로 일관된 조작 행동을 제공한다. 실제 행동 결과는 평가와 데이터 개선으로 돌아간다. 현실·시연 데이터영상 · 언어 · 상태 · 힘 · 행동학습·정렬된 표현멀티모달 기반모델WFM · 가상 월드예측 · 시뮬레이션 · 합성 사례RFM · VLA지각·추론·행동 연결다양한 과제·embodimentLBM · DPM행동 prior · 궤적 생성자연스러움 · 시간 일관성물리적 실행로봇 · 차량 · 의료 시스템센서–제어–환경 상호작용평가·안전 감시·현실 피드백성공 · 실패 · 지연 · 에너지 · 위해 가능성 foundationdatasimulationintegrationpolicyexecute학습·개선 순환검증 결과 반영
논문의 통합 관점 · 모델군은 대체재가 아니라 지각·행동·운동 생성·월드 시뮬레이션의 서로 다른 역할을 맡는다. 회색 점선은 실제 운영 결과를 학습·검증에 되돌리는 설계 방향을 표시한다.

센서와 시연으로 학습한 기반모델이 현실 행동을 만들고, 월드모델은 희귀 상황과 가상 데이터를 보완한다. 행동은 현실에서 평가되며 안전성과 성능을 확인한 경험만 다시 개선에 반영되어야 한다.

Physical AI의 핵심은 생성 모델이 그럴듯한 출력을 만드는 데 있지 않다. 그 출력이 물리 월드에서 안전하고 반복 가능한 행동으로 이어지는 데 있다.

첨부된 리뷰는 Generative Physical Artificial Intelligence (GPAI)를 로봇·차량 등 embodied system을 위해 행동, 궤적, 미래 환경 상태를 생성하는 대규모 생성 모델의 통합으로 설명한다. 전통적 자동화의 고정 규칙을 넘어, 다양한 데이터로 사전학습한 모델이 새로운 과제와 환경, embodiment에 전이하는 것이 목표다. 저자들은 Robot Foundation Models (RFMs), Vision-Language-Action (VLAs), Large Behavior Models (LBMs), Diffusion Policy Models (DPMs), World Foundation Models (WFMs)의 다섯 축을 제시한다.

논문 전체를 관통하는 요점은 단일한 만능 모델이 아니라, 서로 다른 능력을 가진 모델군과 실제 제어·검증 체계를 결합해야 한다는 것이다. 이 글은 원문의 구성 요소, 학습 방식, 응용, 벤치마크, 위험과 연구 방향을 한 흐름으로 재구성한다. 논문의 산업 도입 및 성능 수치는 저자가 인용한 보고치로 다루며, 독립적인 시장·현장 검증 결과로 해석하지 않는다.

논문 서술 저자들이 정리한 분류·사례·수치. 편집 해석 여러 절을 연결한 설명. 확장 제안 본 글의 운영·평가 제언. 제공된 리뷰의 범위를 넘어선 성능 검증을 주장하지 않는다.

PART 01 · SYSTEM FOUNDATION

규칙 기반 자동화에서 생성형 물리 지능으로

초기 로봇은 미리 지정한 궤적과 조건문에 따라 움직였다. 부품 위치, 마찰, 도구 상태, 장애물이 달라지면 다시 프로그래밍해야 했다. 계층형 sense–plan–act는 목표 계획이 분리되어 지연될 수 있고, 반응형 sense–act는 빠르지만 복잡한 의도 추론이 약하다. 하이브리드 구조가 계획과 빠른 실행을 절충했고, GPAI는 여기에 LLM·VLM의 추론 및 멀티모달 생성 능력을 결합한다.

논문이 그리는 시스템은 네 요소가 맞물린 폐루프다. 인지는 목표 이해와 계획을, 지각은 영상·언어·거리·관성·힘·촉각·고유수용성 신호의 융합을, 작동은 궤적·역기구학·충돌회피·저수준 제어를 담당한다. 피드백은 실제 결과와 지각의 차이를 평가하고 다음 행동과 데이터 큐레이션에 반영한다.

관측 (이미지·언어·상태) → 추론·계획 → 행동 궤적 → 제어기·구동기 → 물리 환경
↑ ─────────────── 결과 관측·평가·오류 복구 ─────────────── ↓

데이터 기반은 웹 규모의 이미지·텍스트·비디오, 로봇 시연, 원격조작 궤적, 센서 로그, 시뮬레이션과 디지털 트윈을 포함한다. 각 데이터는 수집 장비, 좌표계, 시간 동기화, 행동 의미, 실패 라벨이 달라 결합과 정제가 핵심 비용이 된다. 기반모델의 인지적 능력과 실제 로봇의 정밀한 운동 제어 사이를 안전한 제어기, 계획기, middleware가 연결해야 한다.

학습 방식도 하나가 아니다. 대규모 사전학습은 일반 표현과 전이성을, 지도 미세조정과 모방학습은 시연 행동 정렬을, 강화학습은 보상 아래의 정책 개선을, 자기지도학습과 합성 데이터는 관측·행동의 부족을 보완한다. 실제 시스템은 이 방식을 혼합하며, 실행 로그는 회귀 시험과 다음 학습에 쓰인다. 다만 현장 데이터를 바로 재학습에 넣으면 이전 능력의 퇴행, 편향 강화, 안전 회귀를 초래할 수 있어 검증 관문이 필요하다.

PART 02 · FIVE MODEL FAMILIES

같은 “기반모델” 안의 서로 다른 역할

다섯 분류는 모델 크기나 제품 라벨이 아니라 GPAI 파이프라인에서의 기능으로 나뉜다. 논문은 이 구분이 상호배타적이라기보다 보완적이라고 강조한다. 실제 제품은 여러 역할을 한 시스템 안에 합칠 수 있다.

모델군중심 기능대표 입력과 출력강점과 주의점
RFM
Robot Foundation Model
다양한 과제와 로봇 플랫폼 간 기술 전이영상·언어·로봇 상태·시연 → 범용 행동 또는 계획넓은 전이 잠재력. 플랫폼별 데이터 정합, 큰 데이터·연산 요구, 일반성 측정이 관건
VLA
Vision-Language-Action
시각·언어 이해를 물리 행동에 직접 연결이미지·지시·고유수용성 상태 → 행동 토큰·제어지시를 환경에 grounding. 지연시간과 저수준 제어 정밀도·실패 복구 검증 필요
LBM
Large Behavior Model
인간다운 전신 동작과 행동 양식 생성행동·동작 데이터·목표 → 자연스러운 움직임모션 prior와 사람-로봇 상호작용에 유용. 의도와 물리적 안전성은 별도 제약 필요
DPM
Diffusion Policy Model
다봉적이고 시간적으로 일관된 행동 궤적 생성관측·목표·시연 → 반복 정제된 action chunk불확실한 조작과 다양한 해법에 강점. 반복 추론 비용과 제어 주기 지연을 고려
WFM
World Foundation Model
미래 장면·환경 상태 예측 및 시뮬레이션현재 상태·행동 조건 → 미래 상태·합성 시나리오희귀 사례 생성과 계획 평가에 유용. 시각적 사실성과 물리적 타당성은 다를 수 있음

RFM: 여러 로봇이 공유할 수 있는 표현

RFM은 궤적·말단장치 포즈, 자연어, 힘·관성·관절 상태, RGB·깊이 입력을 각각의 인코더로 처리한 뒤 공통 표현으로 융합하고 action decoder로 명령을 낸다. 논문은 좁은 작업에서 정밀도를 높이는 task-specific model과 여러 작업·플랫폼을 포괄하는 general-purpose model을 대비한다. PaLM-E는 연속적인 관측과 로봇 상태를 언어모델 표현에 넣는 접근, Gato는 이질적 입력과 출력을 공통 토큰 시퀀스로 다루는 접근의 예로 등장한다. 범용성은 데이터·연산 요구와 함께 평가해야 한다.

VLA: 말과 시각을 행동 인터페이스까지 잇기

VLA는 이미지, 자연어 지시, proprioception을 공통 잠재 표현에서 융합한 후 action token 또는 제어 시퀀스로 변환한다. RT-1·RT-2, OpenVLA 등이 논문이 제시하는 사례다. RT-1 절은 대규모 teleoperation 시연 학습과 여러 조작 과제에 대한 보고 결과를 소개하고, RT-2는 웹 지식을 로봇 행동 표현에 연결하는 방향을 설명한다. 그 수치는 통제된 평가 프로토콜의 결과이지 모든 로봇·환경에 대한 보장으로 일반화할 수 없다. 언어적 추론이 성공해도 좌표 정합, 접촉, grasp, 실시간 제어는 해결되지 않을 수 있다.

LBM과 DPM: 움직임의 “모양”과 “정책”

LBM은 대규모 행동·인간 동작 데이터에서 전신 운동, 사회적 신호, 상호작용의 prior를 학습한다. 논문은 Meta Motivo를 대표 사례로 언급한다. LBM의 자연스러운 운동 생성은 물리적 안정성이나 작업 성공과 같은 뜻이 아니며, balance·충돌·관절 한계·사람 주변 안전을 제어층에서 확인해야 한다.

DPM은 노이즈에서 시작해 여러 번 정제함으로써 행동의 시간적 일관성과 다중 가능성을 모델링한다. 특히 조작 시연에서 여러 유효 경로가 가능한 경우에 유용하며, receding-horizon 실행이나 고수준 계획 아래 짧은 action chunk를 내는 설계와 결합할 수 있다. 반복 denoising 비용, 긴 horizon에서의 오류 누적, 높은 제어 주파수 요구가 남는다.

WFM: 가상 장면을 만들고 행동의 결과를 묻기

WFM은 현재 상태와 후보 행동이 주어졌을 때 다음 월드 상태를 예측하고 계획·모델예측제어(MPC)에 rollouts를 제공한다. NVIDIA Cosmos는 미래 상태를 생성하는 Predict, 구조화 입력을 제어 가능한 영상으로 옮기는 Transfer, 장면 분석과 큐레이션을 돕는 Reason으로 설명된다. 자율주행의 GAIA 계열도 희귀한 상호작용·위험 장면을 생성하는 사례다.

디지털 트윈이 명시적 물리·구조 모델과 동기화된 가상 복제를 제공한다면, WFM은 데이터에서 관측과 동역학의 잔차를 배울 수 있다. 두 접근을 결합해 트윈이 구조적 제약을 주고 학습모델이 복잡한 관측·잔차를 보완하는 것이 유망하다. 그러나 그럴듯한 비디오는 정확한 마찰·질량·접촉·인과를 보장하지 않는다. 생성 월드에서 성공한 정책은 현실 검증을 통과하기 전까지 안전한 정책이 아니다.

PART 03 · DATA, CONTROL & EVALUATION

모델 평가는 행동이 끝난 뒤까지 이어져야 한다

GPAI의 데이터·인프라 계층에는 수집, annotation, 시간·좌표 정합, 저장·버전 관리, 대규모 학습, 시뮬레이션, edge 실행, 실제 운영 로그가 모두 포함된다. cloud는 대규모 사전학습과 장기 계획에, edge는 저지연 인식·제어에 적합하지만 통신 단절·대역폭·전력 제약도 설계 조건이다.

논문이 나열한 평가 자산에는 LIBERO(평생학습 조작 작업), RLBench(시각 기반 조작), Open X-Embodiment(다양한 embodiment의 대규모 궤적) 등이 있다. 보고된 데이터셋 크기와 task count는 논문이 인용한 버전 기준이다. 월드모델 평가는 영상 품질 하나로 충분하지 않다. WorldScore는 제어 가능성·품질·동역학의 평가를 지향하며, WorldModelBench는 프롬프트 정합과 물리 오류를, WorldSimBench는 명시적 지각 평가와 생성 장면의 downstream 행동 효용을 함께 다룬다.

평가 층위확인할 질문권장 지표 예시
표현·생성입력 조건과 장면·행동이 맞는가?조건 정합, 물체 영속성, 물리 위반, 다양성
작업 성능새 물체·지시·환경에서 임무를 마치는가?성공률, 일반화, 반복성, 샘플 효율
운영 실시간성마감시간과 자원 내에서 동작하는가?p95/p99 지연, 에너지/성공 작업, 메모리
안전·복구실패를 감지하고 안전 상태로 전환하는가?실패 예측, 위해도, 안전거리, 복구율, 인간 개입
수명주기업데이트가 기존 능력을 훼손하지 않는가?회귀시험, 분포 변화, 로그 추적성, 재현성

통제된 벤치마크 점수와 현실의 견고성은 상관이 약할 수 있다. 저자들이 지적하듯, 현행 벤치마크는 실패 예측, 작업자 안전 여유, 장기 운용, 업데이트 후 회귀를 충분히 반영하지 못한다. 표준 task 점수에 더해 실제 embodiment·지연·센서 손상·예외 상황을 포함하는 system-level evaluation이 필요하다.

PART 04 · APPLICATION LANDSCAPE

응용은 넓지만 검증 조건은 도메인마다 다르다

영역논문이 다루는 활용도메인별 검증 과제
자율주행·ADAS다중센서 인식, 행동 예측, end-to-end 주행, 희귀 시나리오 생성교통 규칙·장기 꼬리 위험·악천후·차량 간 상호작용; 합성 시나리오의 현실성 검증
산업 로봇·제조조립·검사·정밀 조작, 협동로봇, 디지털 트윈 기반 공정 분석공차·접촉 물리·반복 정밀도·가동률; 현장 설비와 안전 인증
의료·헬스케어수술 보조, 의료 영상 이해, 재활·보조 로봇임상 검증, 책임·인적 감독, 생체 조직과 예외 상황의 안전
휴머노이드·HRI전신 움직임, 물체 조작, 사람과의 자연스러운 상호작용낙상·충돌·전신 균형·사회적 규범; 자연스러움과 안전을 함께 검증
물류·창고·공급망피킹·분류·이동·자율 작업 배치와 다중로봇 조정예상 밖 적재물·혼잡·가동 시간; 자동화의 작업자 영향과 안전
디지털 인프라·스마트 시스템디지털 트윈, edge/cloud 연계, 네트워크형 센서·구동기 운영통신·시간 동기화·사이버보안·오류 전파; 현장-가상 모델 일치
소비자·연구서비스 로봇, 실험 자동화, 연구 플랫폼 및 보조 시스템사용자별 환경 차이, 유지관리, 실험 재현성, 개인정보·동의

자율주행에서는 자주 일어나지 않지만 치명적인 상황을 직접 모으기 어렵기 때문에 world model과 시뮬레이션의 가치가 크다. 제조와 물류는 구조화된 작업 데이터가 풍부해도 설비별 좌표·그립·재료 차이가 전이를 방해한다. 의료는 높은 정확도만으로 충분하지 않고 사람의 판단과 책임 체계가 요구된다. 휴머노이드는 범용 행동의 상징적 응용이지만 이동·조작·균형·대인 상호작용의 동시 제약이 크다.

논문은 Amazon Robotics, KUKA, ABB YuMi, BMW의 생산 사례, Intuitive Surgical da Vinci와 Medtronic Hugo, NVIDIA GR00T N1 및 Google DeepMind RT-2 등 사례를 분야 지도에 배치한다. 이 사례들을 GPAI의 상용 성능 증거로 동일시해서는 안 된다. 각 사례의 자율성 수준, 실제 투입 여부, 사용된 모델, 독립 평가 근거가 서로 다르기 때문이다.

편집 해석 응용 분야의 공통 분모는 모델 점수 → 물리적 임무 → 안전 검증 → 운영 지속성으로 증거를 이어 붙이는 일이다. 산업 사례는 사용 가능성을 보여줄 수 있지만, 독립적이고 비교 가능한 성능 측정은 별도의 연구 과제로 남는다.

PART 05 · LIMITATIONS & RISK

현실 세계가 드러내는 열 가지 취약점

  1. 데이터 부족과 불균형. 다양한 센서·로봇·실패 사례를 모으기 어렵고, 성공 사례 위주 데이터는 드문 위험 상황과 long-tail 환경을 가린다.
  2. 편향과 윤리. 데이터에 반영된 사회적 편향이 사람 분류·상호작용·작업 배치로 이어질 수 있다. 노동 전환, 동의, 감시, 책임성도 배치와 함께 다뤄야 한다.
  3. 하드웨어·실시간 제약. 대형 추론기의 지연·메모리·전력은 작은 로봇과 edge 환경에 부담이다. cloud round-trip은 제어 마감과 연결 단절 위험을 만든다.
  4. Sim-to-real 격차와 불확실성. 접촉·마찰·변형체·센서 잡음·조명·지연의 불일치가 시뮬레이션에서 배운 행동을 무너뜨릴 수 있다. WFM도 실제 불확실성을 없애지 않는다.
  5. 일반화와 추론 한계. 언어적 상식은 관측되지 않은 상태나 정확한 물리량에 대한 지식과 다르다. 분포 이동이나 조합적으로 새로운 상황에서 과신할 수 있다.
  6. 통합 복잡성. 기초모델, VLM, 계획기, 모션정책, 저수준 제어기, safety monitor의 인터페이스가 틀리면 오류가 단계 간 전파된다.
  7. 세밀한 제어 부족. 고수준 행동 토큰은 힘 조절, 미끄러짐, 유연 물체 조작 같은 접촉 중심 제어를 대신하지 못한다.
  8. 견고성·안전·실패. 불확실한 인식과 행동의 연쇄 오류는 물리적 위해로 이어질 수 있다. 안전한 정지, 회피, 복구 경로가 있어야 한다.
  9. 투명성과 설명 가능성. 잠재표현에서 나온 행동의 이유와 한계를 추적하기 어렵고, 사고 후 원인 분석·책임 배분도 어려워진다.
  10. 에너지·비용·확장성. 대규모 사전학습과 시뮬레이션은 계산·전력·탄소 비용을 높인다. 더 큰 데이터와 모델이 실제 운영 효율을 개선하는지 입증해야 한다.

Physical AI에서는 모델의 오답이 화면 속 오류로 끝나지 않고, 충돌·파손·작업자 위해로 이어질 수 있다. 따라서 기능 성능만으로 출시는 정당화되지 않는다. 학습·검증·배포·운영 전 단계의 안전 사례와 책임 있는 fallback이 시스템 요건이다.

논문은 안전 테스트, 위험 프레임워크, 거버넌스를 중요한 대응으로 언급한다. 이를 실제 배치로 옮기려면 위험 분류, 작동 범위, 안전 요구사항, 시험 장면, 남은 위험, 인간 감독, 현장 로그와 변경관리까지 이어지는 safety case가 필요하다. 이는 본문이 제안하는 운영상 보완이며 원 논문의 실험 결과는 아니다.

PART 06 · RESEARCH QUESTIONS

다음 연구는 모델 규모보다 시스템의 검증 가능성을 묻는다

  • 새 작업·새 물체·새 embodiment·분포 변화 중 전이가 실패하는 경계를 재현 가능하게 어떻게 정의할 것인가?
  • 웹 비디오·로봇 시연·시뮬레이션·실제 운영 로그의 provenance와 좌표·시간·행동 의미를 어떤 표준으로 연결할 것인가?
  • WFM의 영상 품질이 아니라 행동 조건부 예측의 물리 정확도와 downstream 정책의 안전성을 어떻게 분리 측정할 것인가?
  • VLA의 고수준 추론과 별도 저수준 컨트롤러를 어떤 계약·타입·모니터링 인터페이스로 결합하면 오류 전파를 제한하는가?
  • 행동 생성 모델의 confidence, 실패 예측, out-of-distribution 감지를 실제 정지·회복 결정에 어떻게 연결할 것인가?
  • 벤치마크를 현실 운영과 연결하고, 긴 작업·실패·사람 개입·업데이트 회귀를 포함하면서도 공정한 비교가 가능하도록 할 수 있는가?
  • 로봇 한 대에서 얻은 개선이 다른 구조와 현장으로 전이되는지, 소스 데이터·연산·전력까지 포함한 비용 효율은 무엇인지 입증할 수 있는가?

이 질문들은 논문이 서술한 한계와 미래 방향에서 파생한 연구 의제다. 각 문제는 모델 개발보다 데이터 계약·평가 프로토콜·실패 분석·배포환경의 공동 설계를 요구한다.

PART 07 · FUTURE DIRECTIONS

데이터 효율, 모듈성, edge 추론, 안전의 동시 설계

연구 방향리뷰 논문의 제안실증 단계에서 필요한 증거
데이터 효율 학습시뮬레이션·시연·자기지도·운영 로그를 활용해 제한된 실월드 데이터로 성능과 일반화 개선새 환경 전이, 실패 데이터 가치, 데이터 provenance, 과거 능력 유지
모듈형·일반화 기반모델RFM·VLA의 범용성과 전문 정책의 정밀 제어를 결합모듈 간 입력·출력 계약, 대체·업데이트 회귀, 플랫폼 간 비교
계산·하드웨어 효율edge 친화적 구조와 실시간 처리를 위한 압축·가속·효율 개선동일 하드웨어에서 지연·전력·성공률·발열·메모리 동시 측정
안전 프로토콜엄격한 테스트, 안전성 평가, 위험관리·거버넌스 내장명시적 운용 범위, 안전 제약, 위해 기반 시험, 인간 개입과 사고 추적

추가로 WFM과 디지털 트윈의 hybridization, physics-informed learning, 생성 시나리오를 이용한 stress test, 예측 행동을 정책 학습에 증류하는 방법이 논의된다. 실월드 rollout을 가상 데이터와 함께 쓰되 모델 편향과 drift를 보정하고, 업데이트마다 안전 검증을 다시 해야 한다.

실행 제안 연구 프로그램은 성숙도를 세 단계로 나누어 볼 수 있다. ① 재현 가능한 데이터·작업·실패 taxonomy와 공통 평가 구축, ② 시뮬레이션에서의 제약부 행동 검증과 현실 격차 측정, ③ 제한된 운용 범위에서 edge 포함 폐루프 실증 및 변경관리 검증. 각 단계의 진전은 모델 파라미터 수보다 전이성·안전·성공당 비용의 증거로 판정해야 한다.

유망한 GPAI는 관측을 행동으로 바꾸는 모델과 행동을 감시·수정·설명하는 체계가 함께 성장하는 시스템이다. 서로 다른 모델군의 강점을 결합하되, 물리적 제약과 인간 책임이 결합의 바깥에 남지 않도록 해야 한다.

REFERENCES · SOURCE & SCOPE

출처와 검증 범위

[1] S. Gaba, K. Rana, S. Sai, V. Chamola, and D. Niyato. “A Comprehensive Review of Generative Physical Artificial Intelligence.” arXiv:2609.18111, v1, 16 Sep 2026. 사용자 제공 25쪽 PDF의 전체 본문을 바탕으로 요약·재구성. DOI: 10.1109/JIOT.2026.3671268.arXiv 초록·판본·저자 정보 · PDF
범위 주의. 글의 분류·모델 사례·벤치마크 설명은 리뷰 저자의 종합이다. 논문에 인용된 시장 전망 및 기업 성능 수치는 각 원자료를 본 글에서 독립 재검증하지 않았으므로 게시물의 사실 주장으로 확장하지 않았다. 해당 리뷰는 2026년 9월 arXiv 제출본이며, arXiv 페이지의 저널 게재 정보는 별도 서지 맥락으로 확인했다.
인용된 벤치마크 이름. LIBERO · RLBench · Open X-Embodiment · WorldScore · WorldModelBench · WorldSimBench. 세부 버전과 프로토콜은 각 원 논문에서 확인해야 한다.