로봇이 한 번 성공하는 능력과, 낯선 환경에서 반복해서 안전하게 일하는 능력 사이에는 무엇이 필요한가?
이 글은 범용 Physical AI를 모델 하나의 성능 경쟁에서 데이터와 실행·검증·운영의 연결 문제로 확장해 읽는다. 논문별 기여를 존중하면서, 전체 시스템에 필요한 계약과 평가 기준을 제안한다.
범위와 근거. 2025년 1월 이후 2026년 10월 6일까지의 대표 논문 10편을 선별한 서술적 연구 종합이다. 체계적 문헌고찰이나 분야 전체의 완전한 목록은 아니다. 아래 목록은 arXiv 공개 논문·기술보고서로 다루며 심사·게재 상태를 별도로 확정하지 않았다. 성능은 저자 보고이며 독립 재현하지 않았다. 핵심 방법·서지·범위는 공개 초록과 검색 레코드에서 확인했으며, PhysAI-Bench 원문 본문은 확인하지 못했다. 검증된 서지, 저자 보고 결과, 편집 해석, 연구 제안을 구분해 읽는다.
PART 01 · DEFINITION
범용성은 모델의 크기보다 전이와 운용의 범위에 있다
작업 정의 · 편집 해석. 범용 Physical AI 풀 스택은 다양한 물리 환경·과제·로봇 형태에서 관측을 해석하고, 행동 결과를 예측하며, 목표를 실행하고, 실패를 감지·복구하며, 검증된 경험으로 개선하는 통합 시스템이다. 여기서 풀 스택은 센서·액추에이터부터 데이터, 표현, 세계모델, 정책, 제어, 안전, 연산·통신, 배포·운영까지 연결한다.
범용 정책 모델과 범용 운용 시스템은 구분해야 한다. VLA는 시각·언어·행동을 연결하는 정책의 한 유형이며, 세계모델은 환경 전이의 학습 표현이다. 어느 하나만으로 전체 스택이 완성되지는 않는다. Cosmos의 플랫폼 관점과 GR00T·Gemini·π 계열의 정책 관점을 함께 읽어 구성한 정의이며, 이 정확한 명칭이 학계의 합의된 표준이라는 뜻은 아니다.[1][2][3][4]
‘범용’은 이분법 대신 새로운 과제, 새로운 물체·장면, 새로운 embodiment, 장기 수행, 실패 복구, 자원 제약의 여섯 축으로 측정하는 것이 유용하다. 이는 본 글의 평가 틀 제안이다. Physical AI는 로봇 조작 외 자율이동과 물리 시스템까지 포괄할 수 있지만, 아래 근거의 중심은 로봇 조작·휴머노이드이고 UAV는 보완 사례다.
PART 02 · PROBLEM DEFINITION
관측에서 행동까지, 행동에서 책임 있는 결과까지
정식화 · 본 글의 종합. 과제 g와 embodiment e가 주어지고 환경 상태 s는 부분적으로만 관측된다. 관측 이력 h로 belief b를 구성하고 정책 π(a|b,g,e)가 행동을 선택하며, 세계모델 p(s′|s,a,e)는 그 결과를 예측한다. 실제 로봇에서는 좌표계·시간·관절 한계·접촉 상태가 이 수학적 연결을 구현해야 한다.
subject to 안전 제약, 행동 가능성, 제어 마감시간, 데이터·연산 예산
이 식은 특정 논문의 목적함수를 재현한 것이 아니라 풀 스택 설계 문제의 개념적 정식화다. 훈련 분포에서 높은 성공률을 얻는 동시에, 과제·환경·로봇이 변할 때 적응 비용과 위험을 제한해야 한다. π0.5는 새로운 가정 환경의 일반화 문제를 구체화하고, FEARL과 ForesightSafety-VLA는 능력과 안전 평가를 분리해야 하는 이유를 보여 준다.[4][8][9]
예를 들어 “깨지기 쉬운 컵을 치워라”는 문장은 대상 식별, 잡기 가능성, 미끄러짐·파손 위험, 사람 접근, 놓을 공간, 실패 시 재계획을 함께 요구한다. 언어 이해의 정답과 물리 임무의 성공 사이에 존재하는 이 연결이 핵심 연구 문제다.
PART 03 · CORE CONCEPTS
여덟 층과 세 가지 시간 척도
참조 구조 · 편집 해석. 다음 층은 논문들을 연결한 아키텍처 지도이며, 인용한 모델들이 이 조합을 공동 구현하거나 상호 운용성을 검증했다는 뜻은 아니다.
| 층 | 역할과 핵심 개념 | 연결 근거 / 검증 질문 |
|---|---|---|
| 1. 신체·센싱 | 영상·깊이·고유감각·힘/촉각, 구동기와 접촉 | ResMimic [5] / 물체와 접촉을 충분히 관측하는가? |
| 2. 데이터 기반 | 시연·영상·합성 궤적의 정렬, 출처와 버전 | Cosmos·GR00T [1][2] / 누락된 실패 사례는 무엇인가? |
| 3. 표현·신체화 추론 | affordance, 공간 관계, belief와 임무 기억 | Gemini-ER·Embodied-R1.5 [3][7] / 무엇을 할 수 있고 무엇이 불확실한가? |
| 4. 세계모델·시뮬레이션 | 행동 조건부 미래, 합성 환경, 반사실 평가 | Cosmos [1] / 예측이 물리적으로 유효한가? |
| 5. 계획·범용 정책 | 하위목표, VLA, diffusion·flow 계열 행동 생성 | GR00T·π 계열 [2][4][6] / 계획과 행동이 일치하는가? |
| 6. 실행·전신 제어 | 행동 청크, 궤적·접촉·균형, embodiment adapter | ResMimic [5] / 로봇의 실제 제약을 만족하는가? |
| 7. 안전·평가 | 실행 제약, 위험 감시, 중단·복구, 형식 검증 | FEARL·ForesightSafety [8][9] / 성공 과정도 안전한가? |
| 8. 연산·운영 | edge/cloud 분할, 지연·통신, 로그·배포·회귀검사 | PhysAI-Bench [10] / 통신이 나빠져도 임무 판단이 유지되는가? |
데이터·안전·평가는 모든 층을 관통한다. 이들을 마지막 부속품으로 붙이면 모델이 무엇을 학습했고 왜 실패했는지 추적하기 어렵다. 의미적 계획은 느리게, 행동 정책은 더 빠르게, 안정화 제어는 가장 빠르게 반응하도록 시간 척도를 분리하는 설계가 유용하다. 구체적 주기는 하드웨어와 과제의 제어 요구에서 정해야 하며 보편적인 한 값으로 고정할 수 없다.
PART 04 · INTRODUCTION
컵 하나를 옮기는 일에 왜 전체 시스템이 필요한가
깨끗한 실험실에서 익숙한 물체를 잡는 것과, 처음 방문한 집에서 여러 물체를 치우는 것은 다른 문제다. 바뀐 조명과 가려진 물체는 지각을 흔들고, 이동과 조작은 좌표를 바꾸며, 작은 실수는 다음 하위과제의 전제를 무너뜨린다. 이 예시는 풀 스택의 필요성을 설명하는 사고실험이다.
2025년의 GR00T N1·Gemini Robotics·π0.5는 대규모 사전학습 지식을 실제 행동에 연결하는 다양한 경로를 제시했다. 2026년의 π0.7·Embodied-R1.5는 조건부 실행과 신체화 추론을 확장하고, 안전 연구는 “할 수 있는가”와 “안전하게 했는가”를 분리한다.[2][3][4][6][7][9]
핵심 논지 · 종합 해석. 범용성은 모델 내부 능력과 시스템 간 연결 품질이 함께 결정한다. 좋은 정책이 잘못된 좌표계로 행동하거나 오래된 관측을 사용하면, 언어·비전 점수가 좋아도 임무는 실패할 수 있다.
PART 05 · MOTIVATION AND BACKGROUND
웹의 지식을 물리 경험으로 바꾸는 병목
웹 규모의 시각·언어 데이터는 물체와 상황의 의미를 제공하지만, 특정 로봇이 어느 힘으로 언제 접촉해야 하는지 직접 알려 주지는 않는다. 반대로 로봇 궤적은 행동을 정확히 담지만 수집 비용과 embodiment 의존성이 크다. GR00T의 이질적 데이터 혼합과 π0.5의 co-training은 이 간극을 줄이는 접근이다.[2][4]
Cosmos는 세계모델뿐 아니라 큐레이션·토크나이저·후속학습을 플랫폼 구성에 포함한다. 이는 데이터 생산과 활용을 함께 설계해야 한다는 배경을 제공한다. 다만 생성된 데이터가 희귀 접촉 실패나 실제 센서 오류까지 충실하게 재현하는지는 별도의 검증 문제다.[1]
전략적 해석. ETRI와 같은 연구기관의 풀 스택 과제에서는 모델 규모 외에 센서·제어·네트워크·검증 자산의 연결을 차별화할 수 있다. 연구 목표는 최고 모델 하나의 도입보다 새 임무를 안전하게 추가하는 비용의 감소로 정의하는 편이 시스템 투자의 효과를 측정하기 쉽다.
PART 06 · CHALLENGES
일반화, 접촉, 장기 수행, 안전은 서로 얽힌다
| 도전 | 실패 메커니즘 | 검증 관점 |
|---|---|---|
| 분포 변화 | 새 물체·조명·집 구조·지시 조합이 기존 표현을 깨뜨림 | 환경·물체·과제를 분리한 held-out 평가 [4][6] |
| Embodiment 전이 | 관절·작업공간·손 형태가 달라 동일 행동의 효과가 바뀜 | 새 하드웨어 적응 데이터·시간·실패 비용 [2][3] |
| 접촉·균형 | 그럴듯한 동작이 실제 물체 상호작용에 필요한 정밀도를 갖지 못함 | 접촉·물체 추적 및 전신 과제 [5] |
| 장기 수행 | 하위과제 오차와 상태 추정 오류가 누적됨 | 완료율뿐 아니라 재시도·복구·사람 개입 [4] |
| 세계모델 타당성 | 시각적 사실감과 행동 결과 예측의 정확성이 다를 수 있음 | 정책의 실제 전이 효과와 동역학 제약 검증 [1] |
| 안전·지연 | 위험한 성공, 관측 노후화, 통신 장애가 명목 성능에 숨음 | 과정 위험·센서 가정·지연 조건 [8][9][10] |
마지막 행은 로봇 안전 평가와 UAV 의사결정 평가를 종합한 시스템 관점이다. 두 평가가 동일한 하드웨어·정책에서 수행됐다는 뜻은 아니다. 높은 임무 성공률만으로 안전한 운용을 주장할 수 없다는 점은 ForesightSafety-VLA의 안전/위험 성공 구분과 직접 연결된다.[9]
PART 07 · RESEARCH QUESTIONS
풀 스택을 실험 가능한 질문으로 바꾸기
연구 질문 · 본 글의 제안. 다음 질문은 각 논문의 미해결 부분을 연결해 구성한 연구 의제다. 각 질문에는 반증 가능한 비교 실험이 필요하다.
- 표현의 공유 범위: 무엇을 공통 표현에 넣고 무엇을 embodiment별로 남겨야 하는가? 공유 backbone+adapter와 독립 모델을 같은 적응 예산으로 비교한다.
- 세계모델의 실용 가치: 동일 비용의 실제 시연 추가보다 합성 데이터·반사실 계획이 실물 성능을 더 개선하는가? 영상 품질과 실물 성공을 따로 측정한다.
- 추론과 실행의 연결: 명시적 하위목표가 직접 VLA보다 장기 임무와 복구에 도움이 되는가? 의미 이해·행동·누적 실패를 분해한다.
- 안전 모듈의 보증 범위: 낮은 차원의 안전 인터페이스가 어떤 위험을 보존하고 어떤 위험을 놓치는가? 센서 누락·범위 밖 위험을 의도적으로 평가한다.
- 불확실성과 도움 요청: 모델이 모를 때 적절히 중단·질문하는가? 잘못된 확신과 불필요한 거절을 동시에 측정한다.
- 분산 운용: 어떤 기능을 edge에 남겨야 통신 단절에서도 안전한가? 지연·손실·관측 노후화를 독립적으로 변화시킨다.
- 지속 학습: 새 경험을 반영하면서 기존 능력과 안전 제약을 보존하는가? 업데이트 전후의 고정 회귀시험과 새로운 임무 시험을 모두 시행한다.
이 연구 질문의 근거 축은 일반화 [4][6], 세계모델 [1], 신체화 추론 [7], 안전 분리 [8], 과정 평가 [9], 분산 의사결정 [10]이다.
PART 08 · APPROACHES (METHODS)
데이터 확장과 실행 검증을 하나의 순환으로
문헌에서 확인한 접근. 이질적 co-training은 언어·비전의 의미적 지식을 로봇 행동으로 이전하는 경로다. GR00T N1은 VLM과 diffusion 행동 모듈을 공동 학습하고, π0.5는 의미적 하위과제와 저수준 행동을 다중 데이터와 결합한다. π0.7은 하위목표 이미지·메타데이터를 추가 조건으로 사용한다.[2][4][6]
Gemini Robotics는 embodied reasoning과 VLA를 함께 제시한다. Embodied-R1.5는 인지·계획·수정·pointing을 하나의 신체화 기반모델에 연결한다. 이들은 의미 수준의 이해를 강화하지만, 전신 접촉 제어는 별도 연구 축이다.[3][7]
ResMimic은 인간 동작 추적을 기반으로 잔차 학습을 더해 물체 상호작용을 정교화한다. FEARL은 큰 정책과 작은 안전 모듈을 분리하여 검증 대상을 줄인다. 정책의 표현력과 검증 가능한 인터페이스를 함께 설계하는 접근으로 읽을 수 있지만, 두 논문의 통합 구현은 본 글의 제안이다.[5][8]
통합 방법론 · 제안. ① 시연·실패·환경 메타데이터를 수집한다. ② 사전학습 정책과 embodiment adapter를 학습한다. ③ 세계모델·시뮬레이션으로 변형 상황을 만든다. ④ 실물에서 전이 효과를 확인한다. ⑤ runtime 안전과 복구를 검증한다. ⑥ 운영 로그에서 실패 군집을 추출한다. ⑦ 검증된 데이터로만 업데이트하고 회귀시험 후 배포한다.
층 사이 메시지에는 단위·좌표계·타임스탬프·모델 버전·유효기간·불확실성·실행 권한을 포함하는 인터페이스를 제안한다. “컵을 잡아라”라는 목표뿐 아니라 사용한 관측과 허용 힘·중단 조건도 함께 전달해야 실패 원인을 추적할 수 있다. 이는 인용 모델들이 이미 공통 프로토콜을 지원한다는 주장이 아니다.
| 평가 묶음 · 제안 | 지표 | 평가 설계 |
|---|---|---|
| 일반화·적응 | 미관측 환경 성공, 적응 시연 수·시간 | 과제/환경/로봇을 구분해 분할 |
| 운용 신뢰성 | 시간당 사람 개입, 복구율, 장기 완료율 | 동일 난이도·동일 시간 예산 |
| 안전 | 안전한 성공, 누적 위험 비용, 위험 노출 시간 | ForesightSafety 개념을 활용하되 실물 지표를 별도 정의 [9] |
| 시스템 비용 | 지연 상위 분위수, 에너지/임무, 데이터·연산 비용 | 네트워크·열·배터리 조건을 기록 |
PART 09 · KEY APPLICATIONS
적용 분야마다 범용성의 경계를 명시하기
| 분야 | 풀 스택이 제공할 가치 | 근거 수준과 남은 조건 |
|---|---|---|
| 가정 모바일 조작 | 새 환경의 다단계 정리·물체 조작 | π0.5의 새로운 가정 실험 [4]; 상시 무인 서비스 보증은 아님 |
| 휴머노이드 전신 작업 | 이동·균형·물체 상호작용 연결 | GR00T와 ResMimic의 서로 다른 기여 [2][5]; 생산라인 전체 검증은 별도 |
| 제조·물류 | 변종 작업·부품 변화의 재프로그래밍 비용 감소 | 본 글의 적용 전망; takt time·품질·접촉 안전의 현장 검증 필요 |
| UAV·시설 점검 | 센서·도구·통신 조건을 반영한 임무 판단 | PhysAI-Bench의 결정 사례 평가 [10]; 비행 성능과 구분 |
| 자율 실험실 | 시약·기구 조작과 실험 상태 추적 연결 | 본 글의 연구 확장 제안; 오염·정밀도·실험 출처 관리 필요 |
산업적 의미는 한 번의 멋진 시연보다 작업 변동을 감당하면서 사람 개입과 실패 비용을 줄이는가에 있다. 같은 모델이라도 물류 집기와 정밀 조립에서 필요한 센서·허용 오차·안전 조건은 달라진다.
PART 10 · OPEN PROBLEMS
현재 근거가 아직 닫지 못한 간극
문헌을 연결한 미해결 문제. 이번에 확인한 논문들로 데이터 생성부터 장기 실물 운용까지 전체 조합이 검증됐다고 말할 수 없다. 서로 다른 benchmark, 시연 데이터, 하드웨어, fine-tuning 조건은 단일 순위로 합치기 어렵다.
- 물리적으로 유효한 세계모델: 시각적으로 그럴듯한 미래가 힘·접촉·보존 제약을 만족하는지, 그 오류가 정책 학습에 어떻게 전달되는지 검증해야 한다.
- 촉각과 숨어 있는 상태: 마찰·미끄러짐·내부 물성처럼 영상만으로 불충분한 정보를 어떤 관측과 기억으로 보완할 것인가?
- 조합적 범용성: 각각 해 본 동작을 처음 보는 순서·도구·환경에 결합할 때 능력이 유지되는가?
- 안전의 조합 가능성: 각 모듈이 안전해도 시간 지연·좌표 변환·센서 오류를 포함한 연결이 안전한지는 추가 증명이 필요하다.
- 지속 학습의 승인: 어떤 경험을 학습에 넣고 어떤 업데이트를 현장에 허용해야 하는지 결정 기준이 부족하다.
- 평가와 현실의 간극: 희귀 사고·장시간 마모·사람과의 상호작용을 제한된 benchmark로 얼마나 대표할 수 있는가?
위 항목들은 Cosmos, π 계열, FEARL, ForesightSafety의 범위를 연결한 해석과 연구 질문이다.[1][6][8][9] 특히 형식 검증의 보증은 지정된 속성과 가정 안에서 성립한다. 모든 위험에 대한 무조건적인 보증으로 확대하면 안 된다.
PART 11 · FUTURE DIRECTIONS
검증 가능한 전이를 중심으로 연구를 조직하기
창의적 제안 · 본 글의 연구 의제. 범용 Physical AI의 다음 목표를 “모든 행동을 한 모델에 넣기”만으로 정의하지 말고, 새 과제·새 로봇·새 환경을 추가할 때 필요한 실물 데이터와 검증 비용을 줄이는 방향으로 정식화할 수 있다.
- 행동과 근거를 함께 남기는 실행 기록: 목표·관측·예측 결과·제약·실제 결과를 연결한 기록을 만든다. 안전을 증명하는 만능 인증서가 아니라 회귀검사와 원인 분석의 입력이다.
- 안전 조건을 포함한 skill 계약: 기술의 적용 전제, 물체·힘·공간 범위, 실패 신호, 복구 경로를 명시한다. 새 embodiment로 전이할 때 계약 중 어떤 부분을 재검증할지 결정한다.
- 세계모델의 반례 탐색: 성공 영상의 생성뿐 아니라 정책이 실패하는 조명·접촉·지연 조합을 찾고 실물에서 재확인한다.
- 불확실성에 따른 실행 조절: 추정이 불안정하면 속도·힘을 줄이거나 재관측·도움 요청·중단을 선택한다. 성능과 안전 비용의 교환관계를 평가한다.
- 협업지능과 edge 안전: 공유 임무·공간 상태를 이용해 다중 로봇 협업을 연구하고, 안전에 필요한 최소 기능은 통신 장애에도 동작하도록 설계한다.
| 단계 · 제안 | 핵심 산출물 | 다음 단계 진입 조건 |
|---|---|---|
| 공통 실험 기반 | 임무 정의, 데이터 provenance, 고정 평가 분할 | 정책·제어·네트워크 실패를 분리해 재현 |
| 검증된 단일 로봇 | 정책·adapter·안전·복구의 통합 | 미관측 환경에서 안전한 성공과 개입 비용 보고 |
| 다중 embodiment·현장 | 전이 프로토콜과 운영 회귀시험 | 적응 비용 감소, 기존 능력 보존, 장애 시 중단 검증 |
국가 R&D 기획에서는 모델, 센서·제어, 데이터·시뮬레이션, 안전·시험, 통신·운영을 별개 성과로만 관리하기보다 공통 임무의 검증 단계로 연결하는 것이 유용하다. 이 로드맵은 확정된 학술 합의나 달성 예측이 아니라, 위 논문들에서 확인한 병목을 평가 가능한 프로그램으로 바꾼 제안이다.
EVIDENCE MAP
논문별 기여와 해석의 경계
| 논문 / 초기 공개일 | 스택의 위치와 저자 보고 | 독해 범위 |
|---|---|---|
| [1] Cosmos World Foundation Model Platform for Physical AI 2025-01-07 | 세계모델·데이터 비디오 큐레이션, 토크나이저, 사전학습 세계모델과 후속학습을 연결하는 플랫폼. | 생성 영상의 사실감만으로 접촉 동역학이나 정책의 안전성이 증명되지는 않는다. |
| [2] GR00T N1: An Open Foundation Model for Generalist Humanoid Robots 2025-03-18 | 범용 정책 VLM 기반 System 2와 diffusion transformer 기반 System 1을 공동 학습하고 실제·인간영상·합성 데이터를 결합. | cross-embodiment 실험은 모든 로봇 형태와 모든 전신 행동에 대한 보증이 아니다. |
| [3] Gemini Robotics: Bringing AI into the Physical World 2025-03-25 | 추론·행동 Gemini Robotics VLA와 공간·시간 이해를 강화한 Robotics-ER을 함께 제시. | 추가 fine-tuning 및 평가 환경의 조건을 포함해 읽어야 한다. |
| [4] π0.5: a Vision-Language-Action Model with Open-World Generalization 2025-04-22 | 개방세계 일반화 다중 로봇, 웹 데이터, 의미적 하위과제와 저수준 행동의 co-training으로 새로운 가정의 장기 조작을 평가. | 새로운 가정에서의 일반화와 무제한 환경 일반화는 구분해야 한다. |
| [5] ResMimic: From General Motion Tracking to Humanoid Whole-body Loco-Manipulation via Residual Learning 2025-10-06 | 전신 제어 인간 동작 기반 GMT 정책에 잔차 정책과 접촉·물체 추적 보상을 결합; 시뮬레이션과 Unitree G1 평가. | 모션 추적과 물체 상호작용의 차이를 보여 주며 범용 언어 추론 자체를 해결하는 논문은 아니다. |
| [6] π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities 2026-04-16 | 조건부 범용 정책 언어 외에 하위목표 이미지와 수행 메타데이터를 conditioning으로 사용; 실패를 포함한 다양한 데이터를 활용. | 보고된 zero-shot·조합 일반화는 해당 실험 조건에 한정된다. |
| [7] Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models 2026-06-09 | 신체화 추론 인지·계획·수정·pointing을 통합한 embodied foundation model과 VLA 전환을 제안. | 추론 벤치마크의 성과가 실시간 제어 및 안전성의 동시 검증을 대신하지 않는다. |
| [8] Verifiable Foundation Models for Robot Safety 2026-06-22 | 안전 아키텍처 FEARL: 큰 Controller와 저차원 안전 관측을 받는 작은 Safety 모듈을 분리해 형식 검증 범위를 좁힘. | 보증은 지정된 안전 속성과 센서·모델 가정에 의존; 시뮬레이션 3개 영역 및 1개 과제 실물 전이. |
| [9] ForesightSafety-VLA: A Unified Diagnostic Safety Benchmark for Vision-Language-Action Models 2026-06-25 | 안전 평가 물리·언어·시각 안전을 분리하고 누적 안전 비용과 위험 노출 시간을 측정. | RoboTwin의 66개 기본 시나리오·5개 embodiment 결과를 전체 실세계 위험으로 외삽하지 않아야 한다. |
| [10] PhysAI-Bench: A Benchmark for LLM-Based Agentic Decision-Making in Autonomous UAV-Centric Physical AI 2026-09-20 | 분산 의사결정 UAV 임무 대화 흔적에서 센서·도구호출·협업·네트워크 조건을 포함하는 의사결정 사례를 구성. | 결정 사례 평가이며 실기체 비행 제어 성능·안전 인증 평가가 아니다. 서지·방법은 arXiv 검색 레코드에서 확인. |
PRIMARY SOURCES
출처와 읽기 경로
날짜는 arXiv 첫 공개일이며 학회 발표일과 다를 수 있다. 2024년 π0 등 이전 연구는 배경 계보에 해당하지만 이번 핵심 문헌 목록에서는 제외했다. 아래 링크에서 버전별 변경을 확인할 수 있다.
- Cosmos World Foundation Model Platform for Physical AI2025-01-07 · arXiv 공개 연구 / 기술보고서 · 참조일 2026-10-06 KSThttps://arxiv.org/abs/2501.03575
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots2025-03-18 · arXiv 공개 연구 / 기술보고서 · 참조일 2026-10-06 KSThttps://arxiv.org/abs/2503.14734
- Gemini Robotics: Bringing AI into the Physical World2025-03-25 · arXiv 공개 연구 / 기술보고서 · 참조일 2026-10-06 KSThttps://arxiv.org/abs/2503.20020
- π0.5: a Vision-Language-Action Model with Open-World Generalization2025-04-22 · arXiv 공개 연구 / 기술보고서 · 참조일 2026-10-06 KSThttps://arxiv.org/abs/2504.16054
- ResMimic: From General Motion Tracking to Humanoid Whole-body Loco-Manipulation via Residual Learning2025-10-06 · arXiv 공개 연구 / 기술보고서 · 참조일 2026-10-06 KSThttps://arxiv.org/abs/2510.05070
- π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities2026-04-16 · arXiv 공개 연구 / 기술보고서 · 참조일 2026-10-06 KSThttps://arxiv.org/abs/2604.15483
- Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models2026-06-09 · arXiv 공개 연구 / 기술보고서 · 참조일 2026-10-06 KSThttps://arxiv.org/abs/2606.11324
- Verifiable Foundation Models for Robot Safety2026-06-22 · arXiv 공개 연구 / 기술보고서 · 참조일 2026-10-06 KSThttps://arxiv.org/abs/2606.23754v1
- ForesightSafety-VLA: A Unified Diagnostic Safety Benchmark for Vision-Language-Action Models2026-06-25 · arXiv 공개 연구 / 기술보고서 · 참조일 2026-10-06 KSThttps://arxiv.org/abs/2606.27079
- PhysAI-Bench: A Benchmark for LLM-Based Agentic Decision-Making in Autonomous UAV-Centric Physical AI2026-09-20 · arXiv 공개 연구 / 기술보고서 · 참조일 2026-10-06 KSThttps://arxiv.org/abs/2609.23695