범용 피지컬 AI 플랫폼,
경험을 재사용하고
적응을 검증하는 지능
Universal Physical AI Platforms: Generalization, Adaptation, and Verified Learning
새로운 작업·환경·기체에 적은 비용으로 적응하고, 안전과 기존 능력을 지키며 개선하는 공통 기반을 향하여.
“범용 피지컬 AI 플랫폼”의 핵심은 다양한 로봇이 공통의 지식과 행동 경험을 활용하여 새로운 작업과 환경에 적응하고, 그 과정에서 안전성과 성능을 검증하며 지속적으로 개선되도록 하는 데 있다.
2025년 이후 연구에서는 이를 로봇 파운데이션 모델, 시각·언어·행동 모델(VLA), 세계모델, 이종 로봇 간 전이, 지속학습, 안전학습, 범용성 평가라는 서로 연결된 문제로 다루고 있다.
이 글은 2025년 1월부터 2026년 9월 21일까지 공개된 관련 논문을 중심으로 정리한 연구동향이다. “범용 피지컬 AI 플랫폼”은 이 글에서 여러 연구 흐름을 통합하는 작업 정의로 사용한다. 논문이 보고한 성과와 이를 바탕으로 도출한 연구·기획 제안을 구분했으며, 공개 논문에는 프리프린트와 기술보고서가 포함된다.
근거의 구분: 논문의 관찰·평가 결과와 이를 확장한 연구질문·플랫폼 구성·ETRI 목표 문장을 구분한다. ‘비노출 협력학습’은 제안하는 연구 방향이며, 인용 논문들이 이미 달성한 공통 성과가 아니다.
전체 목차 · 11개 항목
범용성을 정의하는 다섯 축
01 Definition — 정의
범용 피지컬 AI 플랫폼은 다음과 같이 정의할 수 있다.
다양한 물리적 장치가 시각·언어·촉각·운동 정보를 통해 환경을 이해하고, 목표에 맞는 행동을 생성·실행하며, 새로운 작업·환경·기체에 적응하도록 지원하는 공통 학습·추론·제어·검증 기반이다.
이 정의에서 중요한 단어는 범용성, 물리적 상호작용, 플랫폼이다.
범용성은 적용 가능한 작업의 개수만으로 판단하기 어렵다. 학습할 때 접하지 않은 조건으로 능력이 얼마나 이전되는지, 이전에 얼마나 많은 추가 데이터와 비용이 필요한지를 함께 살펴야 한다.
| 범용성의 축 | 의미 | 검증할 질문 |
|---|---|---|
| 작업 일반화 | 배운 기술을 새로운 작업에 활용 | 집기와 운반을 배운 로봇이 새로운 정리 작업을 수행하는가? |
| 환경 일반화 | 배치·조명·배경이 바뀌어도 수행 | 학습에 사용하지 않은 현장에서도 작동하는가? |
| 객체 일반화 | 새로운 물체의 형태와 특성에 대응 | 처음 보는 용기나 부품을 다룰 수 있는가? |
| 기체 일반화 | 다른 센서·관절·그리퍼를 가진 로봇으로 전이 | 한 로봇의 경험이 다른 로봇의 학습비용을 줄이는가? |
| 시간적 적응 | 새로운 경험을 반영하면서 기존 능력을 유지 | 새 작업을 배운 뒤 기존 작업도 계속 잘 수행하는가? |
예를 들어 π₀.₅는 이질적인 로봇·웹·의미 정보의 공동학습을 통해 새로운 가정환경에서의 조작 일반화를 연구한다. X-WBC는 공통 동작 표현과 로봇별 실행 모듈을 분리하여 서로 다른 휴머노이드의 제어 경험을 공유한다. 두 연구는 범용성이 환경과 기체라는 서로 다른 축에서 검증되어야 함을 보여준다. π₀.₅, 2025, X-WBC, 2026
플랫폼은 이 능력을 제공하는 모델에 더해 데이터 수집, 기체별 연결, 학습과 적응, 실행 감시, 평가, 업데이트 관리까지 포함하는 체계로 이해하는 것이 적절한다. 이는 아래 논문들을 종합한 플랫폼 설계 관점이다.
02 Problem Definition — 문제 정의
핵심 문제는 다음 문장으로 표현할 수 있다.
제한된 로봇 경험으로 학습한 시스템이 처음 접하는 작업·현장·기체에서도 적은 추가 학습으로 임무를 수행하면서, 물리적 위험과 계산·운영 비용을 허용 범위 안에 유지하게 할 수 있는가?
이를 연구 문제로 구체화하면 세 가지가 결합된다.
첫째, 학습한 상황과 실제 상황의 차이이다. 물체의 위치뿐 아니라 마찰, 무게, 도구, 카메라 시점, 로봇의 관절 구조가 달라진다. OpenVLA-OFT는 사전학습된 VLA도 새로운 로봇 설정에서 효과적인 미세조정이 필요하다는 문제를 다룹니다. OpenVLA-OFT, 2025
둘째, 부분적으로만 관측되는 세계에서의 연속적인 의사결정이다. 로봇은 카메라 영상만으로 물체 내부의 무게나 접촉 상태를 완전히 알 수 없다. 행동한 뒤 얻는 관측을 이용해 판단을 수정해야 한다.
셋째, 성공과 안전의 동시 달성이다. 물건을 옮겼더라도 주변 물건을 파손했다면 적절한 수행으로 볼 수 없다. SafeVLA는 안전 요구를 제약 마르코프 의사결정과정(CMDP)으로 표현하고 안전 강화학습으로 정책을 조정한다. SafeVLA, 2025·2026 개정
이들을 통합한 연구 목표는 개념적으로 다음과 같다.
여기서 \(g,e,b\)는 각각 작업 목표, 환경, 로봇 기체이다. 이 수식은 특정 논문의 식을 인용한 것이 아니라, 범용 플랫폼의 평가 목적을 종합한 정식화 제안이다.
이해에서 실행, 경험에서 개선으로
03 Core Concepts — 핵심 개념
| 개념 | 이해하기 쉬운 설명 | 플랫폼에서의 역할 |
|---|---|---|
| 체화 지능·물리적 접지 | 언어로 표현된 목표를 실제 공간과 행동에 연결 | “컵을 치워라”를 대상 식별·집기·이동으로 변환 |
| 로봇 파운데이션 모델 | 다양한 작업과 로봇 경험으로 사전학습한 공통 모델 | 새로운 응용의 학습 출발점 제공 |
| 시각·언어·행동 모델, VLA | 관측과 명령을 받아 로봇 행동을 생성 | 인지·지시 이해·행동 생성 연결 |
| 세계모델, World Model | 행동에 따른 환경 변화를 예측하거나 생성 | 학습 데이터 확장과 행동 결과 검토 |
| 행동 표현·행동 묶음 | 연속 동작을 학습 가능한 표현이나 짧은 시퀀스로 구성 | 정밀도·생성 속도·제어 반응성 조정 |
| 이종 기체 전이 | 공통 지식을 기체별 센서·동작 공간에 연결 | 로봇마다 반복되는 개발과 학습 감소 |
| 계층적 추론·제어 | 목표 판단과 빠른 운동 제어를 서로 다른 수준에서 수행 | 장기적 계획과 즉각적 반응의 결합 |
| 지속학습·실행 경험 학습 | 현장 경험으로 능력을 개선하고 기존 능력을 보존 | 장기간 운영 중 성능 향상 |
| 안전 정렬·실행 감시 | 위험한 행동을 학습과 실행 단계에서 제한 | 실패의 물리적 피해 억제 |
| 범용성 평가 | 새로운 조건에서의 성능과 적응비용을 측정 | 시연을 넘어 재사용 가능성 검증 |
이 가운데 행동 표현은 특히 중요한 기술적 연결점이다. FAST는 연속 행동을 주파수 기반으로 압축하여 토큰으로 표현하고, OpenVLA-OFT는 연속 행동 표현과 병렬 디코딩·행동 묶음을 결합한다. 이는 언어모델의 출력 방식을 로봇에 그대로 적용하기보다, 물리적 제어에 맞는 표현과 학습 방식을 설계해야 함을 보여준다. FAST, 2025, OpenVLA-OFT, 2025
04 Introduction — 연구의 전체 구도
최근 연구 흐름은 세 가지 질문으로 연결된다.
“물리 세계를 이해하는가?”
Gemini Robotics는 시공간 이해를 담당하는 Robotics-ER와 직접 행동을 생성하는 VLA를 제시한다. 물체 인식과 언어 이해를 넘어, 잡을 위치와 궤적 등 실행에 필요한 정보를 다룹니다. Gemini Robotics, 2025
“이해한 내용을 다양한 상황에서 실행하는가?”
π₀.₅는 새로운 환경에서의 조작 일반화를, GR00T N1은 시각·언어 이해와 연속 행동 생성을 결합한 로봇 파운데이션 모델을 연구한다. π₀.₅, GR00T N1, 2025
“실행 경험이 다음 수행을 개선하는가?”
π*₀.₆는 시연, 자율 수행 데이터, 전문가의 원격 개입을 활용하는 RECAP 학습 방법을 제시한다. 2026년에는 실제 로봇의 순차 학습에서 기존 기술을 보존하는 문제도 구체적으로 평가되고 있다. π*₀.₆, 2025, 실세계 VLA 지속학습 연구, 2026
이 흐름에서 도출되는 플랫폼의 설계 원리는 이해·실행·경험 축적·검증을 반복 가능한 하나의 운영 과정으로 연결하는 것이다.
05 Motivation and Background — 동기와 배경
첫 번째 동기는 응용마다 반복되는 개발비용이다.
범용 모델의 실용적 가치는 새 작업을 추가할 때 필요한 시연, 조정, 프로그래밍을 줄이는 데 있다. Gemini Robotics는 일부 새로운 단기 작업을 약 100개 시연으로 학습하는 결과와 새로운 기체로의 적응을 보고한다. 다만 해당 실험 결과를 모든 작업에 필요한 데이터량으로 일반화할 수는 없다. Gemini Robotics
두 번째 동기는 물리적 경험 데이터의 수집비용이다.
로봇 데이터는 실제 장비와 시간이 필요하고, 실패 경험에는 파손 위험이 따릅니다. DreamGen은 영상 세계모델이 생성한 로봇 동영상에서 잠재 행동모델 또는 역동역학 모델로 의사 행동을 복원하여 학습 데이터를 확장한다. DreamGen, 2025
세 번째 동기는 현장 배치 이후에도 학습이 필요하다는 점이다.
환경과 작업은 계속 변한다. π*₀.₆의 실행 경험 학습은 배치 이후 수집되는 데이터를 정책 개선에 연결하는 방향을 보여준다. π*₀.₆
네 번째 동기는 성능을 믿고 비교할 수 있는 평가 기반이다.
RoboArena는 여러 평가자가 다양한 실제 환경에서 정책 쌍을 이중맹검으로 비교하는 방식을 제안한다. RoboCasa365는 365개 작업과 2,500개 주방환경을 포함하는 대규모 시뮬레이션 평가 기반을 제공한다. 각각 현장의 다양성과 실험의 재현성을 확보하려는 접근이다. RoboArena, 2025, RoboCasa365, 2026
무엇이 일반화를 가로막는가
06 Challenges — 주요 도전과제
다음은 논문들의 문제 설정과 결과를 종합한 핵심 과제이다.
| 도전과제 | 어려운 이유 | 연구·평가 시 확인할 사항 |
|---|---|---|
| 복합적인 분포 변화 | 물체·환경·기체 변화가 동시에 발생 | 개별 변화와 복합 변화 조건을 분리 평가 |
| 접촉과 정밀 조작 | 시각만으로 힘·미끄러짐·변형을 충분히 알기 어려움 | 접촉 상태 인지, 힘 조절, 실패 회복 |
| 장기 작업의 오류 누적 | 초기의 작은 실수가 이후 단계의 전제를 무너뜨림 | 단계별 성공과 전체 임무 성공을 함께 측정 |
| 기체 간 부정적 전이 | 다른 로봇의 경험이 현재 로봇에 부적합할 수 있음 | 공동학습 이득과 기체별 성능 저하 확인 |
| 합성 데이터의 신뢰성 | 영상의 자연스러움과 물리적 실행 가능성이 다름 | 실제 로봇 전이 성과로 데이터 가치를 검증 |
| 추론과 제어의 시간 차이 | 복잡한 추론 도중 환경이 달라질 수 있음 | 관측부터 실제 행동까지의 전체 지연 측정 |
| 지속학습의 망각 | 새 기술에 적응하면서 기존 기술이 손상될 수 있음 | 과거 작업의 회귀 평가 |
| 안전성과 유용성의 균형 | 지나친 보수성은 수행을 막고 과도한 시도는 위험을 증가 | 성공률·위험률·개입률을 함께 평가 |
예를 들어 실제 로봇 지속학습 연구에서는 단순한 순차 미세조정이 심각한 망각을 일으켰으며, 적절히 구성한 경험 재생이 이를 완화했다. 이는 플랫폼에 학습 데이터 선택과 과거 능력 재검증 기능이 필요하다는 근거이다. 실세계 VLA 지속학습 연구
또한 SafeVLA의 주요 평가는 시뮬레이션에 기반하며, 실제 로봇 전이 사례가 포함되어 있어도 광범위한 물리적 안전 보장으로 확대 해석해서는 안 된다. SafeVLA 본문·한계
07 Research Questions — 핵심 연구질문
아래 질문은 문헌을 바탕으로 검증 가능한 연구과제 형태로 재구성한 제안이다.
| 연구질문 | 검증할 가설 | 적절한 실험 |
|---|---|---|
| RQ1. 어떤 경험의 다양성이 일반화를 만드는가? | 반복 데이터의 양보다 작업·환경·기체의 다양성이 전이에 더 기여할 수 있음 | 데이터량을 고정하고 다양성만 변경 |
| RQ2. 공통 지식과 기체별 제어를 어디서 분리해야 하는가? | 공통 표현과 기체별 경량 모듈의 결합이 적응비용을 줄일 수 있음 | 기체 전체를 학습에서 제외한 뒤 적응 비교 |
| RQ3. 세계모델의 어떤 오류가 실제 행동 실패를 유발하는가? | 접촉·가림·객체 지속성 오류가 시각 품질보다 성공률에 더 중요할 수 있음 | 오류 유형별 합성 데이터와 실제 전이 비교 |
| RQ4. 로봇은 언제 재관측·재계획·도움 요청을 해야 하는가? | 불확실성에 따른 선택적 개입이 자율성과 안전의 균형을 개선할 수 있음 | 동일한 사람 개입 예산에서 성능 비교 |
| RQ5. 안전하게 지속학습할 수 있는가? | 위험·실패 중심 경험 재생이 망각과 위험 증가를 함께 줄일 수 있음 | 새 작업 학습 전후의 전체 회귀 평가 |
| RQ6. 민감한 현장 데이터를 외부에 공개하지 않고 경험을 공유할 수 있는가? | 공유 가능한 표현과 현장별 적응을 분리하면 전이와 데이터 보호를 조정할 수 있음 | 중앙학습·현장학습·연합학습 비교 |
| RQ7. 범용성을 어떻게 공정하게 측정할 것인가? | 성공률에 적응비용과 미관측 조건의 성능을 더해야 실용적 범용성을 구별할 수 있음 | 외부 기관의 비공개 조건에서 평가 |
RQ1–RQ2는 π₀.₅와 X-WBC, RQ3은 DreamGen, RQ5는 지속학습 연구, RQ7은 RoboArena·RoboCasa365가 제공하는 출발점과 연결된다. RQ6의 비노출 협력학습은 여기서 추가로 제안하는 플랫폼 연구 방향이며, 위 논문들이 이미 달성한 성과를 뜻하지 않는다.
학습·제어·검증을 연결하는 플랫폼
08 Approaches / Methods — 주요 접근방법
① 이질적 데이터 공동학습
로봇 행동 데이터와 웹의 시각·언어 지식, 객체 정보, 하위 작업 설명을 함께 학습한다. π₀.₅는 이러한 공동학습을 새로운 환경에서의 일반화에 활용한다.
플랫폼 관점에서는 각 데이터의 출처, 로봇 종류, 작업 조건을 기록하고, 데이터 혼합 비율에 따른 전이 효과를 관리해야 한다. π₀.₅
② 의미 이해와 연속 행동 생성의 결합
GR00T N1은 시각·언어 모듈과 확산 Transformer 기반 행동 생성 모듈을 결합하고 함께 학습한다. 상황의 의미를 이해하는 능력과 실제 운동 명령을 생성하는 능력을 연결하는 접근이다. GR00T N1
플랫폼에서는 여기에 실행 결과 관측과 저수준 제어를 연결하여, 모델이 생성한 행동이 현재 기체와 환경에서 유효한지 지속적으로 확인하는 구조를 설계할 수 있다.
③ 효율적인 행동 표현과 적응
FAST는 행동 토큰화를 개선하고, OpenVLA-OFT는 병렬 디코딩과 연속 행동 표현 등을 통해 적응 성능과 추론 효율을 개선한다. 후자는 LIBERO에서 높은 성공률을 보고하지만, 그 수치는 해당 평가 설정의 결과이다. FAST, OpenVLA-OFT
두 연구의 설계상 시사점은 토큰화·행동 묶음·출력 주기·학습 목적을 대상 기체의 요구에 맞춰 함께 선택해야 한다는 것이다.
④ 세계모델 기반 경험 확장
DreamGen은 생성 동영상을 행동 학습에 활용한다. 이 방식은 실제 수집이 어려운 작업과 환경을 확장할 가능성을 보여준다. 플랫폼에는 생성 데이터의 품질을 실제 전이 성과와 연결해 관리하는 기능이 필요한다. DreamGen
⑤ 공통 표현과 기체별 실행 모듈의 분리
X-WBC는 인간 중심 명령 표현과 공통 시간적 구조를 학습하고, 기체별 경량 모듈로 각 로봇의 관측·행동 공간에 연결한다. 논문은 시뮬레이션의 9개 기체와 실제 로봇 4개에서 평가한다. 다만 이는 전신제어 범위의 성과이며, 임의의 로봇이 모든 조작 작업을 수행한다는 의미는 아닙니다. X-WBC
⑥ 실행 경험과 사람의 교정을 활용한 개선
π*₀.₆의 RECAP은 자율 실행 경험과 전문가 개입을 학습에 활용한다. 이를 플랫폼으로 확장하면 실패 구간, 교정 행동, 개선된 모델의 성능을 연결해 관리하는 운영 과정이 중요해집니다. π*₀.₆
⑦ 안전 제약 학습과 독립적인 재검증
SafeVLA는 위험 상황을 드러내고, 제약을 학습에 반영하며, 별도의 평가로 안전 행동을 확인하는 접근을 제시한다. 플랫폼 설계에서는 이를 실행 중 감시 및 업데이트 후 회귀 평가와 결합할 수 있다. SafeVLA
이들을 통합한 플랫폼 구성 제안은 다음과 같다.
| 구성 계층 | 핵심 기능 |
|---|---|
| 데이터·경험 기반 | 실세계·시뮬레이션 데이터, 실패·개입 기록, 출처 관리 |
| 공통 지능 | VLA, 세계모델, 작업·공간 표현 |
| 적응·학습 | 기체별 연결, 소량 데이터 적응, 실행 경험 학습 |
| 실행·제어 | 행동 생성, 상태 추정, 저수준 제어 연결 |
| 안전·운영 | 위험 감시, 중단·복구, 모델 버전과 업데이트 관리 |
| 평가·검증 | 미관측 조건 평가, 외부 현장 평가, 기존 능력 회귀 평가 |
응용의 가치와 검증의 경계
09 Key Applications — 핵심 응용
현재 다룬 논문들의 직접적인 실험 근거는 가정·실내 조작, 양팔 조작, 휴머노이드 제어에 집중되어 있다. 산업·과학 응용은 그 성과를 바탕으로 별도 검증해야 하는 확장 영역이다.
| 응용 | 플랫폼이 제공할 수 있는 가치 | 근거와 검증 범위 |
|---|---|---|
| 가정·생활 지원 | 낯선 공간의 정리, 물체 운반, 생활도구 사용 | π₀.₅ 등의 실제 환경 조작 연구와 직접 연결 |
| 물류·포장 | 다양한 물품과 포장 형태에 대한 적응 | π*₀.₆의 상자 조립 사례와 연결되나 전체 물류 운영은 별도 검증 필요 |
| 유연 제조 | 부품·제품 변경 시 재프로그래밍과 시연 비용 감소 | 정밀도·접촉력·사이클타임을 산업 조건에서 검증해야 함 |
| 이동형 점검·작업 | 이동과 도구 조작의 통합 | 전신제어 성과에 작업 인식·조작을 추가 결합해야 함 |
| 자율 과학실험실 | 용기·장비 조작 기술의 재사용 | 오염 방지·추적성·실험 절차 준수에 대한 별도 연구 필요 |
가정 정리, 상자 조립, 전신제어에 관한 직접 근거는 각각 π₀.₅, π*₀.₆, X-WBC에서 확인할 수 있다.
연구사업을 설계한다면 공통 기술의 재사용을 확인할 수 있는 두 응용을 먼저 선택하는 방식이 유용한다. 예를 들어 물류 피킹과 실험실 용기 이송은 집기·이동 기술을 공유하면서도 대상과 운영 조건이 달라, 전이 효과와 한계를 함께 측정할 수 있다. 이는 실증 설계 제안이다.
10 Open Problems — 아직 해결되지 않은 문제
첫째, 일반화의 경계를 충분히 설명하기 어렵다.
새로운 환경에서 성공했다는 결과만으로 어떤 변화까지 견디는지 알 수 없다. 환경·작업·기체 변화의 강도를 체계적으로 조절하는 평가가 필요한다.
둘째, 시각적으로 그럴듯한 미래와 실행 가능한 미래를 구별해야 한다.
세계모델의 생성 결과가 로봇 관절 한계, 접촉력, 물체 변형까지 만족하는지는 별도로 확인해야 한다. DreamGen의 데이터 확장 방향은 이러한 검증 문제를 함께 제기한다. DreamGen
셋째, 실패 회복 능력의 평가가 부족한다.
물체를 놓치거나 잘못 집은 상황에서 원인을 구별하고 복구하는 능력은 정상적인 수행 성공률과 다릅니다. 플랫폼 평가에는 실패 후 재시도 횟수, 복구시간, 사람 개입을 포함할 필요가 있다.
넷째, 지속학습의 장기적 안정성이 남아 있다.
10개 작업의 순차 학습에서 망각을 완화한 결과는 유의미하지만, 수개월간의 환경 변화와 수많은 작업을 포함한 운영을 입증한 것은 아닙니다. 실세계 VLA 지속학습 연구
다섯째, 학습된 안전 행동의 적용 범위가 제한된다.
검증한 위험 유형과 관측 조건을 벗어나면 안전성이 유지되는지 다시 확인해야 한다. SafeVLA도 광범위한 실제 로봇 검증을 남은 과제로 다룹니다. SafeVLA
여섯째, 서로 다른 모델과 로봇을 연결하는 의미 수준의 호환성이 필요한다.
동일한 “집기” 명령이라도 좌표계, 힘 제한, 성공 조건이 다르면 실행 의미가 달라진다. 공통 인터페이스에는 데이터 형식과 함께 동작 조건·제약·실패 의미를 담아야 한다. 이는 플랫폼 관점에서 도출되는 미해결 설계 문제이다.
재사용 가능한 경험, 검증 가능한 목표
11 Future Directions — 향후 연구 방향
다음은 문헌을 바탕으로 제안하는 연구 방향이다.
① 범용성을 ‘새 조건에서의 성과와 적응비용’으로 평가
새 작업의 성공률과 함께 필요한 시연 수, 학습시간, 사람 개입, 기체별 수정량을 측정해야 한다. 동일한 성능에 도달하는 비용이 감소하는지를 보면 플랫폼의 재사용 가치를 더 명확하게 판단할 수 있다.
② 물리적 결과를 확인하는 세계모델과 행동모델의 결합
행동 전에는 예상 결과를 검토하고, 행동 후에는 실제 결과와 비교하여 모델의 오류를 수정하는 연구가 유망한다. 특히 접촉·가림·변형처럼 행동 성패를 좌우하는 현상을 우선적으로 다룰 필요가 있다.
③ 실패를 재사용 가능한 지식으로 축적
실패 장면만 저장하는 수준에서 나아가, 실패 조건·원인 가설·복구 행동·재발 여부를 함께 기록하는 구조를 제안한다. 다른 현장이나 기체에서도 같은 실패 조건을 인식하는지 검증하면 독창적인 플랫폼 연구로 발전시킬 수 있다.
④ 원천 데이터 비노출 조건의 협력학습
기업·기관별 현장 데이터가 외부로 이동하기 어려운 조건을 연구의 출발점으로 삼을 수 있다. 공통 표현, 기체별 적응 모듈, 공유 가능한 경험 요약을 구분하고, 데이터 보호 수준에 따른 전이 성능과 통신비용을 평가하는 방향이다.
⑤ 능력에 따라 실행 권한을 조절하는 운영
플랫폼이 작업별 검증 이력과 현재 불확실성을 이용해 자율 실행, 재관측, 사람 확인, 중단을 선택하도록 한다. 평가는 “얼마나 많이 스스로 수행했는가”와 “위험한 자율 실행을 얼마나 줄였는가”를 함께 다뤄야 한다.
⑥ 외부 현장의 비공개 평가와 업데이트 검증
RoboArena의 분산 실세계 평가와 RoboCasa365의 재현 가능한 시뮬레이션 평가를 참고하여, 개발에 사용하지 않은 기관·공간·작업에서 성능을 확인하는 체계를 설계할 수 있다. 모델 업데이트마다 기존 능력과 안전 조건을 재검증해야 한다. RoboArena, RoboCasa365
ETRI의 연구개발 목표형상으로 연결한다면, 다음과 같은 검증 가능한 목표 문장을 제안한다.
“이종 로봇과 현장에 축적된 작업 경험을 재사용하여, 학습 시 접하지 않은 작업·환경에 대한 적응비용을 줄이고, 안전한 실행과 지속적인 성능 개선을 검증하는 범용 피지컬 AI 플랫폼을 개발한다.”
이 목표의 성과지표는 미관측 조건의 임무 성공률, 신규 기체·작업의 적응비용, 기존 능력 유지율, 사람 개입률, 위험 발생률, 외부 현장 재현성으로 구성할 수 있다. 특히 ‘학습 시 접하지 않음’은 작업·객체·환경·기체 중 어느 축인지 명시해야 범용성 주장을 객관적으로 검증할 수 있다.
참고문헌
원자료의 모든 인용 링크를 본문에 유지하고, 중복 문헌을 아래 목록으로 통합했다. 공개 논문·기술보고서·프리프린트의 실험 범위는 서로 다르므로 수치를 단일 순위로 비교하지 않는다.
- π₀.₅: a Vision-Language-Action Model with Open-World Generalization2025 · 이질적 데이터 공동학습과 새로운 가정환경의 조작 일반화
- X-WBC: A Cross-Embodiment Foundation Model for Humanoid Whole-Body Control2026 · 시뮬레이션 9개 기체·실제 로봇 4개의 전신제어 평가
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success2025 · OpenVLA-OFT, 병렬 디코딩·연속 행동 표현·행동 묶음
- SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning2025 / v4 2026 · CMDP 기반 안전학습; 주된 근거는 시뮬레이션본문의 한계와 향후 과제
- FAST: Efficient Action Tokenization for Vision-Language-Action Models2025 · 주파수 기반 연속 행동 토큰화
- Gemini Robotics: Bringing AI into the Physical World2025 · 체화 추론과 직접 로봇 행동 생성
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots2025 · 시각·언어 이해와 연속 행동 생성의 결합
- π*₀.₆: a VLA That Learns From Experience2025 · RECAP, 자율 수행 데이터와 전문가 개입에 기반한 개선
- Can Vision-Language-Action Models Learn from Real-World Data Continually without Forgetting?2026 · 10개 실제 조작 작업의 순차 학습과 경험 재생
- DreamGen: Unlocking Generalization in Robot Learning through Video World Models2025 · 생성 영상에서 의사 행동을 복원하는 학습 데이터 확장
- RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies2025 · 분산 실세계 환경의 이중맹검 정책 쌍 비교
- RoboCasa365: A Large-Scale Simulation Framework for Training and Benchmarking Generalist Robots2026 · 365개 작업·2,500개 주방환경의 재현 가능한 평가
편집 원자료: Universal-Physical-AI-Trends-0922.md. 정의부터 미래 연구 방향까지 11개 항목의 표·수식·연구질문·적용 범위와 한계를 반영했다. 공개 초록 및 SafeVLA의 한계 절을 대조했으며, 모든 논문의 실험을 재현한 검증은 아니다.