피지컬 AI 플랫폼의 조건,
검증 가능한 현장적응
Physical AI Platforms through the Lens of Artificial Intelligence Review: Six Gaps and Verifiable Field Adaptation
AIR의 공간지능·행동학습·안전제어·엣지 배치·평가 리뷰를 연결하고, 여섯 간극과 일곱 연구질문에서 현장적응 플랫폼의 설계 조건을 도출한다.
게시 기준일: 2026-10-06. 파일에는 조사 범위의 연월(2025년~2026년 10월)만 있으며 일이 없다. 사용자 선택에 따라 게시일을 한국 시간 2026년 10월 6일로 정했다. 이 날짜는 개별 논문의 발행일을 뜻하지 않는다. 원문에 명시된 개별 발표일과 검색 기간은 본문에 보존했다. 첨부는 대표 표본에 기반한 해설이며 AIR 전체 논문의 체계적 전수조사가 아니다. 여섯 간극, 일곱 연구질문, 문제 수식, A-L-E-M-S와 REALON의 대응은 첨부의 종합 해석 또는 연구 제안이다. 각 리뷰의 실험 결과와 통합 플랫폼의 성능 입증은 구분한다.
정의와 문제 · 물리적 결과에 책임지는 AI
범위와 결론
첨부 조사 기록은 Artificial Intelligence Review(AIR)에 2025년부터 2026년 10월까지 실린 피지컬 AI 관련 리뷰 22편을 확인했고, 이 중 약 20편을 직접 근거로 사용했다고 보고한다. 같은 시기 arXiv에 공개된 피지컬 AI·월드모델·VLA 서베이도 함께 참고했다. 이 목록은 대표 표본이며, 해당 기간 AIR 논문 전체가 아니다. Springer 검색 결과를 끝까지 확인할 수 없었기 때문이다.
이 기간 AIR에는 "Physical AI"를 제목에 직접 내건 리뷰가 거의 없다. 대신 공간지능, 행동 생성, 장기 작업계획, 안전제어, 엣지 배치, 평가처럼 주제가 흩어져 실려 있다. 이 조각들을 모으면 하나의 플랫폼 그림이 나온다. 아래의 6개 간극, 연구질문, 수식은 여러 논문을 종합한 첨부의 종합 해석이다.
1. Definition
피지컬 AI 플랫폼은 물리 세계에서 지각, 공간·물리 추론, 행동 생성, 실행·안전제어, 검증·환류를 하나의 폐루프로 묶는 데이터·모델·제어·평가 스택이다. 이것은 여러 논문의 정의를 묶어 만든 종합 정의이다. 근거가 되는 정의는 다음과 같다.
- 생성형 피지컬 AI(GPAI): 대규모 파운데이션 모델과 물리적 신체를 결합해 실제 상황에서 스스로 지각·추론·행동하는 에이전트형 시스템이다. arxiv
- 체화 추론(embodied reasoning): 추상 지식을 감각 입력과 물리 행동에 연결해 지각·추론·행동하는 능력이다. link.springer
- 공간지능: 물체가 어디에 있고, 서로 어떤 관계이며, 시점이 바뀔 때 공간이 어떻게 달라지는지 이해하는 능력이다. link.springer
- 에이전틱 AI: 정해진 단일 과업을 처리하는 시스템에서, 사람의 감독을 최소화한 채 목표를 향해 추론·계획·학습·행동하는 에이전트로 넘어가는 패러다임 전환이다. link.springer
한 문장으로 줄이면, 피지컬 AI는 말이나 텍스트가 아니라 물리적 결과에 책임지는 AI이다.
2. Problem Definition
여러 리뷰가 공통으로 다루는 문제를 수식으로 정리하면, 제약이 붙은 부분관측 의사결정 문제가 된다. 아래 식은 첨부가 종합한 표현이다.
이 식에는 성격이 다른 세 가지 제약이 함께 들어 있다.
- 성능: 작업을 실제로 완수해야 한다.
- 안전: 안전 강화학습 리뷰는 안전을 "학습과 배치 모두에서 시스템이 안정적이고 제약을 지키는 것"으로 정의한다. link.springer
- 자원: 온디바이스 LLM 리뷰는 정확도·지연·에너지·메모리를 함께 보는 A-L-E-M 기준을 제시한다. link.springer
여기에 일반화 요구가 더해집니다. 같은 정책이 다른 신체, 다른 지형, 다른 작업에서도 작동해야 한다. 이족보행 리뷰는 현재 방법들이 아직 이런 통합 틀을 갖추지 못했다고 진단한다. link.springer
핵심 개념 · 수요와 기술적 배경
3. Core Concepts
| 개념 | 핵심 의미 | 근거 |
|---|---|---|
| 공간지능 | 위치·관계·시점 변화의 이해 | AIR 공간지능 link.springer |
| LLM 에이전트 4요소 | 프로필·기억·계획·행동 실행 | AIR LLM 에이전트 link.springer |
| TAMP(하이브리드 계획) | 이산적 상위 행동과 연속적 하위 경로를 함께 계획 | AIR 다중에이전트 TAMP link.springer |
| End-to-end와 계층형 제어 | 센서에서 관절까지 단일 정책으로 갈지, 상위 계획기와 하위 제어기로 나눌지 | AIR 이족보행 link.springer |
| 파지 생성(GG)과 파지 실행(GE) | 잡는 자세를 만드는 단계와 실제로 실행하는 단계의 분리 | AIR 정밀 파지 link.springer |
| Lyapunov·Barrier 인증서 | Lyapunov 함수는 안정성을, Barrier 함수는 제약 준수를 보장 | AIR 안전 RL link.springer |
| 내결함 제어(FTC) | 고장 탐지·진단·재구성을 묶은 체계 | AIR 산업로봇 FTC link.springer |
| 상호작용형 예측·계획 | 내 행동에 주변 행위자가 어떻게 반응할지 함께 모델링 | AIR 자율주행 예측·계획 link.springer |
| 월드모델 3단계 | 그럴듯함 → 개입에 따른 변화 예측 → 실제 행동 개선 | Yao et al., arXiv 2026 arxiv |
4. Introduction
AI의 무게중심이 "말하는 AI"에서 "행동하는 AI"로 옮겨가고 있다. LLM 에이전트 리뷰는 2023~2025년 상위 학회와 Q1 저널 논문 108편을 분석했다. 그 결과 LLM이 텍스트 생성을 넘어 도구를 쓰는 자율 워크플로로 확장되고 있으며, 적용 분야에 로보틱스와 체화 AI가 포함된다고 정리한다. link.springer
물리 세계에서는 오류의 대가가 다릅니다. 텍스트 환각은 다시 쓰면 되지만, 로봇의 잘못된 접촉은 사람이나 설비를 다치게 한다. 그래서 AIR의 피지컬 AI 관련 리뷰들은 공통적으로 성능보다 신뢰와 검증을 앞에 둡니다.
5. Motivation and Background
- 사회적 수요: 고령화와 돌봄 인력 부족 때문에 식사·몸단장·옷 입히기·자세 바꾸기 같은 돌봄 조작 작업에 로봇이 필요해지고 있다. link.springer
- 산업적 수요: 산업로봇 고장은 작업자 안전, 생산성, 유지비에 직접 영향을 준다. 양팔로 여러 핀을 동시에 끼우는 조립은 접촉이 많아 대표적인 고난도 작업이다. link.springer
- 기술적 배경: 사람을 따라가거나 안내하는 동반 로봇 분야에서도 LLM과 VLA 모델이 새로운 흐름으로 다뤄집니다. 피지컬 AI 서베이는 지각 연구와 물리 추론 연구가 따로 발전해 왔다고 지적하며, 둘을 잇는 통합 틀이 필요하다고 봅니다. link.springer
여섯 간극과 일곱 연구질문
6. Challenges
여러 리뷰가 지적하는 어려움을 6개의 간극으로 묶었다. 이 분류는 첨부의 종합 해석이다.
| 간극 | 내용 | 근거 |
|---|---|---|
| ① 공간 간극 | VLM이 공간을 제대로 이해하지 못하고, 벤치마크 설계에도 편향이 있을 수 있음 | AIR 공간지능 link.springer |
| ② 접촉 간극 | 변형되는 물체, 다점 접촉, 양팔 폐연쇄 제약, 고자유도 손 제어 | AIR 돌봄 link.springer, AIR 양팔 조립 link.springer, AIR 정밀 파지 link.springer |
| ③ 현실 간극 | 시뮬레이션과 현실의 차이, 고품질 시연 데이터 부족 | AIR 이족보행 link.springer, AIR 합성데이터 link.springer |
| ④ 시간 간극 | 장기 작업, 온라인 재계획 비용, 에이전트 수 증가에 따른 확장성 | AIR TAMP link.springer |
| ⑤ 안전·보안 간극 | 함수근사 상황에서 인증서의 유효성, 고차원 확장, 물리적 적대 공격이 지각→계획→제어로 번지는 문제 | AIR 안전 RL link.springer, AIR 자율시스템 보안 link.springer |
| ⑥ 배치·평가 간극 | 메모리 장벽과 KV 캐시 증가, 성공/실패만 보는 평가, 비용·안전 점수의 부재 | AIR 온디바이스 link.springer, AIR 에이전트 평가 link.springer |
특히 눈여겨볼 진단이 있다. 에이전트 평가 리뷰는 배치를 가로막는 핵심 병목이 모델 성능이 아니라 평가 방법론이라고 봅니다. link.springer
7. Research Questions
위 6개 간극에서 도출한 연구질문 제안이다.
- RQ1 (공간): 2D 사전학습 VLM에 3D 공간 구조를 어떻게 주입해야 실제 조작 성능이 오르는가?
- RQ2 (접촉): 시각·촉각·힘을 융합한 접촉 상태 추정을 행동 정책과 어떻게 결합할 것인가?
- RQ3 (현실): 합성 데이터와 월드모델로 만든 데이터는 실제 데이터를 어느 비율까지 대체할 수 있는가?
- RQ4 (시간): 언어 기반 상위 계획과 연속 운동계획을 환각 없이 어떻게 맞물릴 것인가?
- RQ5 (안전): 학습된 정책에 대해 Lyapunov·Barrier 인증서를 실시간으로 유지할 수 있는가?
- RQ6 (배치): A-L-E-M 예산 안에서 행동 모델의 안전성과 성능을 동시에 지키는 압축 방법은 무엇인가?
- RQ7 (평가): 성공률 대신 무엇을 측정해야 현장 배치 가능성을 예측할 수 있는가?
방법론 · 지각에서 배치와 평가까지
8. Approaches (Methods)
지각·공간이해
- 공간지능 강화 방법은 다섯 갈래이다: 프롬프팅, 모델 개선, 명시적 2D 단서, 3D 정보 보강, 데이터 중심 전략. link.springer
예측·월드모델
- 자율주행에서는 개별 행위자 예측 → 행위자 간 상호작용을 반영한 조건부 예측 → 예측과 계획을 함께 푸는 상호작용형 방식으로 발전하고 있다. 향후 과제로 효율적인 월드모델이 제시된다. link.springer
- 생성형 피지컬 AI는 다섯 가지 접근으로 분류된다: 로봇 파운데이션 모델(RFM), VLA, 대규모 행동 모델(LBM), 확산 정책 모델(DPM), 월드 파운데이션 모델(WFM). arxiv
행동학습
- 돌봄 로봇 분야의 네 가지 축: 멀티모달 지각 학습, 시연 모방학습, 상호작용 강화학습, VLM 기반 체화 추론. link.springer
- 이족보행 제어는 End-to-end(참조 기반·참조 없음)와 계층형(심층계획 혼합·피드백 제어 혼합·학습된 계층)으로 나뉩니다. link.springer
- 정밀 파지의 파지 생성은 분류·회귀·생성(GAN, VAE, Flow, 확산) 방식으로 나뉩니다. link.springer
장기작업·계획
- 다중에이전트 TAMP는 세 가지 축으로 분류된다: 작업계획과 운동계획의 순서(작업 우선·운동 우선·교차), 통신 방식(중앙집중·분산), 계획기 적응성(고정·적응). link.springer
안전·신뢰 제어
- 안전 강화학습은 Lyapunov 함수(CLF), Barrier 함수(CBF), 둘의 결합으로 나뉘며, 2017년 이후 모델 기반에서 모델 없는 방식으로 이동했다. link.springer
- 내결함 제어 구조는 수동형·능동형·혼합형으로 구분된다. link.springer
- 인간-로봇 협업 리뷰는 신뢰를 결과가 아니라 설계 원리로 다뤄야 한다고 봅니다. 이를 위해 신뢰 추정, 의도 인식, 설명가능 강화학습, 적응 제어를 연결한다. link.springer
배치·데이터
- 모델 수준의 경량화(양자화·가지치기·지식증류·저랭크 분해)와 시스템 수준의 최적화(컴파일러, 메모리 관리, 엣지-클라우드 협업)가 함께 쓰인다. link.springer
- 지식증류와 데이터셋 증류는 모델과 데이터 양쪽의 부담을 줄인다. link.springer
- 합성 데이터는 절차적 생성, 래스터화·레이트레이싱, 확산·방사장(radiance field) 기반 신경 영상 합성으로 만든다. link.springer
평가
- 평가는 정적 과업 벤치마크, 상호작용 환경 평가, 도메인 특화 평가 프레임워크로 나뉩니다. link.springer
응용과 미해결 문제
9. Key Applications
- 돌봄: 식사·몸단장·옷 입히기·자세 바꾸기 link.springer
- 동반·안내 이동로봇: 의료, 물류, 공공안전 분야 link.springer
- 제조 조립과 산업로봇 고장관리 link.springer
- 창고 자동화·물류의 다중로봇 계획 link.springer
- GNSS가 닿지 않는 공간의 탐사: 지하, 재난 현장, 행성 탐사 link.springer
- 자율주행 link.springer
- 디지털트윈·메타버스 동기화에 쓰이는 강화학습 link.springer
10. Open Problems
- 안전 인증서의 한계: 함수근사와 분포 이동 아래에서 Lyapunov 인증서가 유효한지, CBF-QP 방식에서 해가 없거나 교착이 생기는 문제, 고차원·부분관측 환경으로의 확장 link.springer
- 양팔 다중핀 조립의 근거 부족: 직접 검증한 실험이 부족하고, 성능과 학습 비용 보고 방식이 제각각이라 연구 간 비교가 어렵다 link.springer
- 신뢰 측정의 공백: 표준 신뢰 지표가 없고, 장기적 신뢰와 실환경 검증 연구가 부족하다 link.springer
- 돌봄 로봇 평가 기준 부재: 안전·편안함·신뢰성을 재는 표준 척도가 없다 link.springer
- 평가 신뢰도 문제: 벤치마크 오염, 환경 변화(drift)에 따른 재현성 문제, 벤치마크 간 비교 불가 link.springer
- 에이전트 추론의 신뢰성: 추론을 검증할 수 없고, 스스로 개선하는 능력이 제한적이다 link.springer
미래 방향 · 행동과 검증의 동시 설계
11. Future Directions
논문들이 제시한 방향에 첨부의 종합 해석을 더해 다섯 가지로 정리했다.
- 신체 파운데이션 모델: 이족보행 리뷰는 이족보행 파운데이션 모델(BFM)과 이동하며 조작하는 loco-manipulation을 제안한다. 정밀 파지 리뷰는 언어와 정렬된 대규모 시각·촉각 데이터셋을 요구한다. link.springer
- 실제 행동을 개선하는 월드모델: 그럴듯한 영상 생성이 아니라, 실제 계획·복구·데이터 선택 성능을 높이는지로 평가해야 한다. 장기 작업 계획에는 VLM 기반 계획과 이론 기반 계획이 함께 제시된다. arxiv
- 안전의 내장화: 행동 정책과 함께 안전 인증서, 고장 재구성, 신뢰 적응 제어가 묶여 배포되는 구조이다. 첨부에서 제안한 이름으로는 "행동+인증서 동시 배포"이다. 근거는 AIR FTC의 고장 주입 시험, AIR HRC 신뢰의 폐루프 인간중심 프레임워크, AIR 안전 에이전틱 AI의 시뮬레이션 기반 안전 탐색이다. link.springer
- 엣지 실행 기준 확장: 기존 A-L-E-M에 안전(Safety)을 더한 A-L-E-M-S 기준을 제안한다. 압축 변환·보정·커널 융합을 함께 최적화하는 저비트 파이프라인이 그 기반이 된다. link.springer
- 전주기 평가: 표준 프로토콜, 사람이 참여하는 평가, 배치 이후 지속 평가가 필요하다. link.springer
ETRI-REALON · 검증 가능한 현장적응
ETRI-REALON 시사점
AIR 리뷰들이 지적한 간극은 ETRI-REALON의 6계층과 그대로 대응한다.
- 공간 간극 → 세계이해·예측
- 접촉·시간 간극 → 행동학습·적응, 장기작업·운영
- 안전·배치 간극 → 실행·안전제어
- 현실·평가 간극 → 현장 실증·환류
따라서 "검증 가능한 현장적응"을 플랫폼의 차별점으로 내세우면 학술적 근거가 탄탄하다. 특히 평가 체계를 독자 자산으로 두는 전략은 "병목은 모델 성능이 아니라 평가 방법론"이라는 진단과 정확히 맞닿는다. link.springer
자료와 출처
구성 자료: AIR-Physical AI.md. 첨부의 모든 연구 항목, 비교, 수치, 표, 수식, 한계와 후속 연구 제안을 수록했다. 대화 시스템의 인용 표시와 추적 매개변수는 편집 과정에서 제거했다. 읽기용 본문 외에 첨부 원문도 아래에 보존한다. 본문 링크는 해당 자료로 연결된다.
- A Comprehensive Review of Generative Physical Artificial Intelligence
- Feeding, grooming, dressing, and body repositioning: categorizing four pillars of learning-based manipulation for robotic caregiving
- Spatial intelligence in vision-language models: a comprehensive survey
- Towards safe and trustworthy agentic AI: foundations, taxonomy, technologies, applications, and future directions
- A review on safe reinforcement learning using Lyapunov and barrier functions
- On-device large language models: a survey of model compression and system optimization
- Deep reinforcement learning for robotic bipedal locomotion: a brief survey
- From language to action: a review of large language models as autonomous agents and tool users
- Multi-agent task and motion planning trends analysis: a survey
- An overview of learning-based dexterous grasping: recent advances and future directions
- Fault-tolerant control strategies for industrial robots: state of the art and future perspective on AI-based fault management
- Ranging from prediction to planning via machine learning approaches for autonomous driving: a survey
- World Models for Embodied Intelligence: From Plausible to Controllable to Actionable
- Artificial intelligence for dual-arm robotic multi-peg-in-hole assembly: a review
- Recent advances in AI-based mobile robots for human companionship: survey
- Automating synthetic dataset generation for image-based 3D detection: a literature review
- Securing (vision-based) autonomous systems: taxonomy, challenges, and defense mechanisms against adversarial threats
- From benchmarks to deployment: a comprehensive review of agentic AI evaluation
- Trust as a design principle in human–robot collaboration: a review of explainable and adaptive control
- Knowledge distillation and dataset distillation of large language models: emerging trends, challenges, and future directions
- Intelligent multi-robot exploration in non-exposed spaces: methods and challenges
- Reinforcement learning and the Metaverse: a symbiotic collaboration
첨부 원문 전체 보기 · AIR-Physical AI.md
## 범위와 결론
Artificial Intelligence Review(AIR)에 2025년부터 2026년 10월까지 실린 논문 가운데 피지컬 AI와 관련된 리뷰 22편을 확인했습니다. 이 중 직접 근거로 쓴 것은 약 20편입니다. 같은 시기 arXiv에 공개된 피지컬 AI·월드모델·VLA 서베이도 함께 참고했습니다. 이 목록은 대표 표본이며, 해당 기간 AIR 논문 전체가 아닙니다. Springer 검색 결과를 끝까지 확인할 수 없었기 때문입니다.
이 기간 AIR에는 "Physical AI"를 제목에 직접 내건 리뷰가 거의 없습니다. 대신 공간지능, 행동 생성, 장기 작업계획, 안전제어, 엣지 배치, 평가처럼 주제가 흩어져 실려 있습니다. 이 조각들을 모으면 하나의 플랫폼 그림이 나옵니다. 아래의 6개 간극, 연구질문, 수식은 여러 논문을 종합한 제 해석입니다.
---
## 1. Definition
피지컬 AI 플랫폼은 물리 세계에서 지각, 공간·물리 추론, 행동 생성, 실행·안전제어, 검증·환류를 하나의 폐루프로 묶는 데이터·모델·제어·평가 스택입니다. 이것은 여러 논문의 정의를 묶어 만든 종합 정의입니다. 근거가 되는 정의는 다음과 같습니다.
- **생성형 피지컬 AI(GPAI)**: 대규모 파운데이션 모델과 물리적 신체를 결합해 실제 상황에서 스스로 지각·추론·행동하는 에이전트형 시스템입니다. [arxiv](https://arxiv.org/abs/2609.18111)
- **체화 추론(embodied reasoning)**: 추상 지식을 감각 입력과 물리 행동에 연결해 지각·추론·행동하는 능력입니다. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11524-7)
- **공간지능**: 물체가 어디에 있고, 서로 어떤 관계이며, 시점이 바뀔 때 공간이 어떻게 달라지는지 이해하는 능력입니다. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11671-x)
- **에이전틱 AI**: 정해진 단일 과업을 처리하는 시스템에서, 사람의 감독을 최소화한 채 목표를 향해 추론·계획·학습·행동하는 에이전트로 넘어가는 패러다임 전환입니다. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11682-8)
한 문장으로 줄이면, 피지컬 AI는 말이나 텍스트가 아니라 물리적 결과에 책임지는 AI입니다.
## 2. Problem Definition
여러 리뷰가 공통으로 다루는 문제를 수식으로 정리하면, 제약이 붙은 부분관측 의사결정 문제가 됩니다. 아래 식은 제가 종합한 표현입니다.
\[
\pi^*=\arg\max_{\pi}\ \mathbb{E}\Big[\sum_t r(s_t,a_t)\Big]\quad \text{s.t.}\quad \Pr(s_t\in\mathcal{S}_{safe})\ge 1-\delta,\ \ (\text{Latency},\text{Energy},\text{Memory})\le B
\]
이 식에는 성격이 다른 세 가지 제약이 함께 들어 있습니다.
- **성능**: 작업을 실제로 완수해야 합니다.
- **안전**: 안전 강화학습 리뷰는 안전을 "학습과 배치 모두에서 시스템이 안정적이고 제약을 지키는 것"으로 정의합니다. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11611-9)
- **자원**: 온디바이스 LLM 리뷰는 정확도·지연·에너지·메모리를 함께 보는 A-L-E-M 기준을 제시합니다. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11538-1)
여기에 일반화 요구가 더해집니다. 같은 정책이 다른 신체, 다른 지형, 다른 작업에서도 작동해야 합니다. 이족보행 리뷰는 현재 방법들이 아직 이런 통합 틀을 갖추지 못했다고 진단합니다. [link.springer](https://link.springer.com/article/10.1007/s10462-025-11451-z)
## 3. Core Concepts
| 개념 | 핵심 의미 | 근거 |
|---|---|---|
| 공간지능 | 위치·관계·시점 변화의 이해 | AIR 공간지능 [link.springer](https://link.springer.com/article/10.1007/s10462-026-11671-x) |
| LLM 에이전트 4요소 | 프로필·기억·계획·행동 실행 | AIR LLM 에이전트 [link.springer](https://link.springer.com/article/10.1007/s10462-025-11471-9) |
| TAMP(하이브리드 계획) | 이산적 상위 행동과 연속적 하위 경로를 함께 계획 | AIR 다중에이전트 TAMP [link.springer](https://link.springer.com/article/10.1007/s10462-026-11588-5) |
| End-to-end와 계층형 제어 | 센서에서 관절까지 단일 정책으로 갈지, 상위 계획기와 하위 제어기로 나눌지 | AIR 이족보행 [link.springer](https://link.springer.com/article/10.1007/s10462-025-11451-z) |
| 파지 생성(GG)과 파지 실행(GE) | 잡는 자세를 만드는 단계와 실제로 실행하는 단계의 분리 | AIR 정밀 파지 [link.springer](https://link.springer.com/article/10.1007/s10462-025-11262-2) |
| Lyapunov·Barrier 인증서 | Lyapunov 함수는 안정성을, Barrier 함수는 제약 준수를 보장 | AIR 안전 RL [link.springer](https://link.springer.com/article/10.1007/s10462-026-11611-9) |
| 내결함 제어(FTC) | 고장 탐지·진단·재구성을 묶은 체계 | AIR 산업로봇 FTC [link.springer](https://link.springer.com/article/10.1007/s10462-025-11327-2) |
| 상호작용형 예측·계획 | 내 행동에 주변 행위자가 어떻게 반응할지 함께 모델링 | AIR 자율주행 예측·계획 [link.springer](https://link.springer.com/article/10.1007/s10462-026-11604-8) |
| 월드모델 3단계 | 그럴듯함 → 개입에 따른 변화 예측 → 실제 행동 개선 | Yao et al., arXiv 2026 [arxiv](https://arxiv.org/abs/2609.16697) |
## 4. Introduction
AI의 무게중심이 "말하는 AI"에서 "행동하는 AI"로 옮겨가고 있습니다. LLM 에이전트 리뷰는 2023~2025년 상위 학회와 Q1 저널 논문 108편을 분석했습니다. 그 결과 LLM이 텍스트 생성을 넘어 도구를 쓰는 자율 워크플로로 확장되고 있으며, 적용 분야에 로보틱스와 체화 AI가 포함된다고 정리합니다. [link.springer](https://link.springer.com/article/10.1007/s10462-025-11471-9)
물리 세계에서는 오류의 대가가 다릅니다. 텍스트 환각은 다시 쓰면 되지만, 로봇의 잘못된 접촉은 사람이나 설비를 다치게 합니다. 그래서 AIR의 피지컬 AI 관련 리뷰들은 공통적으로 성능보다 신뢰와 검증을 앞에 둡니다.
## 5. Motivation and Background
- **사회적 수요**: 고령화와 돌봄 인력 부족 때문에 식사·몸단장·옷 입히기·자세 바꾸기 같은 돌봄 조작 작업에 로봇이 필요해지고 있습니다. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11524-7)
- **산업적 수요**: 산업로봇 고장은 작업자 안전, 생산성, 유지비에 직접 영향을 줍니다. 양팔로 여러 핀을 동시에 끼우는 조립은 접촉이 많아 대표적인 고난도 작업입니다. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11705-4)
- **기술적 배경**: 사람을 따라가거나 안내하는 동반 로봇 분야에서도 LLM과 VLA 모델이 새로운 흐름으로 다뤄집니다. 피지컬 AI 서베이는 지각 연구와 물리 추론 연구가 따로 발전해 왔다고 지적하며, 둘을 잇는 통합 틀이 필요하다고 봅니다. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11603-9)
## 6. Challenges
여러 리뷰가 지적하는 어려움을 6개의 간극으로 묶었습니다. 이 분류는 제 해석입니다.
| 간극 | 내용 | 근거 |
|---|---|---|
| ① 공간 간극 | VLM이 공간을 제대로 이해하지 못하고, 벤치마크 설계에도 편향이 있을 수 있음 | AIR 공간지능 [link.springer](https://link.springer.com/article/10.1007/s10462-026-11671-x) |
| ② 접촉 간극 | 변형되는 물체, 다점 접촉, 양팔 폐연쇄 제약, 고자유도 손 제어 | AIR 돌봄 [link.springer](https://link.springer.com/article/10.1007/s10462-026-11524-7), AIR 양팔 조립 [link.springer](https://link.springer.com/article/10.1007/s10462-026-11705-4), AIR 정밀 파지 [link.springer](https://link.springer.com/article/10.1007/s10462-025-11262-2) |
| ③ 현실 간극 | 시뮬레이션과 현실의 차이, 고품질 시연 데이터 부족 | AIR 이족보행 [link.springer](https://link.springer.com/article/10.1007/s10462-025-11451-z), AIR 합성데이터 [link.springer](https://link.springer.com/article/10.1007/s10462-025-11431-3) |
| ④ 시간 간극 | 장기 작업, 온라인 재계획 비용, 에이전트 수 증가에 따른 확장성 | AIR TAMP [link.springer](https://link.springer.com/article/10.1007/s10462-026-11588-5) |
| ⑤ 안전·보안 간극 | 함수근사 상황에서 인증서의 유효성, 고차원 확장, 물리적 적대 공격이 지각→계획→제어로 번지는 문제 | AIR 안전 RL [link.springer](https://link.springer.com/article/10.1007/s10462-026-11611-9), AIR 자율시스템 보안 [link.springer](https://link.springer.com/article/10.1007/s10462-025-11373-w) |
| ⑥ 배치·평가 간극 | 메모리 장벽과 KV 캐시 증가, 성공/실패만 보는 평가, 비용·안전 점수의 부재 | AIR 온디바이스 [link.springer](https://link.springer.com/article/10.1007/s10462-026-11538-1), AIR 에이전트 평가 [link.springer](https://link.springer.com/article/10.1007/s10462-026-11571-0) |
특히 눈여겨볼 진단이 있습니다. 에이전트 평가 리뷰는 배치를 가로막는 핵심 병목이 모델 성능이 아니라 평가 방법론이라고 봅니다. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11571-0)
## 7. Research Questions
위 6개 간극에서 도출한 연구질문 제안입니다.
- **RQ1 (공간)**: 2D 사전학습 VLM에 3D 공간 구조를 어떻게 주입해야 실제 조작 성능이 오르는가?
- **RQ2 (접촉)**: 시각·촉각·힘을 융합한 접촉 상태 추정을 행동 정책과 어떻게 결합할 것인가?
- **RQ3 (현실)**: 합성 데이터와 월드모델로 만든 데이터는 실제 데이터를 어느 비율까지 대체할 수 있는가?
- **RQ4 (시간)**: 언어 기반 상위 계획과 연속 운동계획을 환각 없이 어떻게 맞물릴 것인가?
- **RQ5 (안전)**: 학습된 정책에 대해 Lyapunov·Barrier 인증서를 실시간으로 유지할 수 있는가?
- **RQ6 (배치)**: A-L-E-M 예산 안에서 행동 모델의 안전성과 성능을 동시에 지키는 압축 방법은 무엇인가?
- **RQ7 (평가)**: 성공률 대신 무엇을 측정해야 현장 배치 가능성을 예측할 수 있는가?
## 8. Approaches (Methods)
**지각·공간이해**
- 공간지능 강화 방법은 다섯 갈래입니다: 프롬프팅, 모델 개선, 명시적 2D 단서, 3D 정보 보강, 데이터 중심 전략. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11671-x)
**예측·월드모델**
- 자율주행에서는 개별 행위자 예측 → 행위자 간 상호작용을 반영한 조건부 예측 → 예측과 계획을 함께 푸는 상호작용형 방식으로 발전하고 있습니다. 향후 과제로 효율적인 월드모델이 제시됩니다. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11604-8)
- 생성형 피지컬 AI는 다섯 가지 접근으로 분류됩니다: 로봇 파운데이션 모델(RFM), VLA, 대규모 행동 모델(LBM), 확산 정책 모델(DPM), 월드 파운데이션 모델(WFM). [arxiv](https://arxiv.org/abs/2609.18111)
**행동학습**
- 돌봄 로봇 분야의 네 가지 축: 멀티모달 지각 학습, 시연 모방학습, 상호작용 강화학습, VLM 기반 체화 추론. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11524-7)
- 이족보행 제어는 End-to-end(참조 기반·참조 없음)와 계층형(심층계획 혼합·피드백 제어 혼합·학습된 계층)으로 나뉩니다. [link.springer](https://link.springer.com/article/10.1007/s10462-025-11451-z)
- 정밀 파지의 파지 생성은 분류·회귀·생성(GAN, VAE, Flow, 확산) 방식으로 나뉩니다. [link.springer](https://link.springer.com/article/10.1007/s10462-025-11262-2)
**장기작업·계획**
- 다중에이전트 TAMP는 세 가지 축으로 분류됩니다: 작업계획과 운동계획의 순서(작업 우선·운동 우선·교차), 통신 방식(중앙집중·분산), 계획기 적응성(고정·적응). [link.springer](https://link.springer.com/article/10.1007/s10462-026-11588-5)
**안전·신뢰 제어**
- 안전 강화학습은 Lyapunov 함수(CLF), Barrier 함수(CBF), 둘의 결합으로 나뉘며, 2017년 이후 모델 기반에서 모델 없는 방식으로 이동했습니다. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11611-9)
- 내결함 제어 구조는 수동형·능동형·혼합형으로 구분됩니다. [link.springer](https://link.springer.com/article/10.1007/s10462-025-11327-2)
- 인간-로봇 협업 리뷰는 신뢰를 결과가 아니라 설계 원리로 다뤄야 한다고 봅니다. 이를 위해 신뢰 추정, 의도 인식, 설명가능 강화학습, 적응 제어를 연결합니다. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11554-1)
**배치·데이터**
- 모델 수준의 경량화(양자화·가지치기·지식증류·저랭크 분해)와 시스템 수준의 최적화(컴파일러, 메모리 관리, 엣지-클라우드 협업)가 함께 쓰입니다. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11538-1)
- 지식증류와 데이터셋 증류는 모델과 데이터 양쪽의 부담을 줄입니다. [link.springer](https://link.springer.com/article/10.1007/s10462-025-11423-3)
- 합성 데이터는 절차적 생성, 래스터화·레이트레이싱, 확산·방사장(radiance field) 기반 신경 영상 합성으로 만듭니다. [link.springer](https://link.springer.com/article/10.1007/s10462-025-11431-3)
**평가**
- 평가는 정적 과업 벤치마크, 상호작용 환경 평가, 도메인 특화 평가 프레임워크로 나뉩니다. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11571-0)
## 9. Key Applications
- **돌봄**: 식사·몸단장·옷 입히기·자세 바꾸기 [link.springer](https://link.springer.com/article/10.1007/s10462-026-11524-7)
- **동반·안내 이동로봇**: 의료, 물류, 공공안전 분야 [link.springer](https://link.springer.com/article/10.1007/s10462-026-11603-9)
- **제조 조립과 산업로봇 고장관리** [link.springer](https://link.springer.com/article/10.1007/s10462-026-11705-4)
- **창고 자동화·물류의 다중로봇 계획** [link.springer](https://link.springer.com/article/10.1007/s10462-026-11588-5)
- **GNSS가 닿지 않는 공간의 탐사**: 지하, 재난 현장, 행성 탐사 [link.springer](https://link.springer.com/article/10.1007/s10462-025-11395-4)
- **자율주행** [link.springer](https://link.springer.com/article/10.1007/s10462-026-11604-8)
- **디지털트윈·메타버스 동기화에 쓰이는 강화학습** [link.springer](https://link.springer.com/article/10.1007/s10462-025-11433-1)
## 10. Open Problems
- **안전 인증서의 한계**: 함수근사와 분포 이동 아래에서 Lyapunov 인증서가 유효한지, CBF-QP 방식에서 해가 없거나 교착이 생기는 문제, 고차원·부분관측 환경으로의 확장 [link.springer](https://link.springer.com/article/10.1007/s10462-026-11611-9)
- **양팔 다중핀 조립의 근거 부족**: 직접 검증한 실험이 부족하고, 성능과 학습 비용 보고 방식이 제각각이라 연구 간 비교가 어렵습니다 [link.springer](https://link.springer.com/article/10.1007/s10462-026-11705-4)
- **신뢰 측정의 공백**: 표준 신뢰 지표가 없고, 장기적 신뢰와 실환경 검증 연구가 부족합니다 [link.springer](https://link.springer.com/article/10.1007/s10462-026-11554-1)
- **돌봄 로봇 평가 기준 부재**: 안전·편안함·신뢰성을 재는 표준 척도가 없습니다 [link.springer](https://link.springer.com/article/10.1007/s10462-026-11524-7)
- **평가 신뢰도 문제**: 벤치마크 오염, 환경 변화(drift)에 따른 재현성 문제, 벤치마크 간 비교 불가 [link.springer](https://link.springer.com/article/10.1007/s10462-026-11571-0)
- **에이전트 추론의 신뢰성**: 추론을 검증할 수 없고, 스스로 개선하는 능력이 제한적입니다 [link.springer](https://link.springer.com/article/10.1007/s10462-025-11471-9)
## 11. Future Directions
논문들이 제시한 방향에 제 해석을 더해 다섯 가지로 정리했습니다.
1. **신체 파운데이션 모델**: 이족보행 리뷰는 이족보행 파운데이션 모델(BFM)과 이동하며 조작하는 loco-manipulation을 제안합니다. 정밀 파지 리뷰는 언어와 정렬된 대규모 시각·촉각 데이터셋을 요구합니다. [link.springer](https://link.springer.com/article/10.1007/s10462-025-11262-2)
2. **실제 행동을 개선하는 월드모델**: 그럴듯한 영상 생성이 아니라, 실제 계획·복구·데이터 선택 성능을 높이는지로 평가해야 합니다. 장기 작업 계획에는 VLM 기반 계획과 이론 기반 계획이 함께 제시됩니다. [arxiv](https://arxiv.org/abs/2609.16697)
3. **안전의 내장화**: 행동 정책과 함께 안전 인증서, 고장 재구성, 신뢰 적응 제어가 묶여 배포되는 구조입니다. 제가 붙인 이름으로는 "행동+인증서 동시 배포"입니다. 근거는 AIR FTC의 고장 주입 시험, AIR HRC 신뢰의 폐루프 인간중심 프레임워크, AIR 안전 에이전틱 AI의 시뮬레이션 기반 안전 탐색입니다. [link.springer](https://link.springer.com/article/10.1007/s10462-025-11327-2)
4. **엣지 실행 기준 확장**: 기존 A-L-E-M에 안전(Safety)을 더한 A-L-E-M-S 기준을 제안합니다. 압축 변환·보정·커널 융합을 함께 최적화하는 저비트 파이프라인이 그 기반이 됩니다. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11538-1)
5. **전주기 평가**: 표준 프로토콜, 사람이 참여하는 평가, 배치 이후 지속 평가가 필요합니다. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11571-0)
## ETRI-REALON 시사점
AIR 리뷰들이 지적한 간극은 ETRI-REALON의 6계층과 그대로 대응합니다.
- 공간 간극 → 세계이해·예측
- 접촉·시간 간극 → 행동학습·적응, 장기작업·운영
- 안전·배치 간극 → 실행·안전제어
- 현실·평가 간극 → 현장 실증·환류
따라서 "검증 가능한 현장적응"을 플랫폼의 차별점으로 내세우면 학술적 근거가 탄탄합니다. 특히 평가 체계를 독자 자산으로 두는 전략은 "병목은 모델 성능이 아니라 평가 방법론"이라는 진단과 정확히 맞닿습니다. [link.springer](https://link.springer.com/article/10.1007/s10462-026-11571-0)