SUNGSOO KIM · AI RESEARCH
PHYSICAL AI / FOUNDATION MODELS · RESEARCH ESSAY

다른 몸, 다른 현장에서도
끝까지 수행하는 로봇

Robot Generalists in Physical AI: From Transferable Policies to Reliable Autonomy
전이 가능한 정책에서 검증 가능한 자율성으로

전이 가능한 정책과 검증 가능한 자율성이종 데이터와 다양한 신체의 경험이 공유 정책을 학습한다. 정책은 행동을 생성하고 가치와 실패 평가를 통해 선택과 개선을 지원받는다. 실제 실행의 결과는 검증과 새 학습 데이터로 환류한다. 문헌 종합에 따른 개념도다.이종 데이터 · 다양한 신체공유 범용 정책조향 · 실패 감지 · 가치물리 행동의 생성선택 · 실행 · 현장 경험전이 범위의 검증Alignment / coverageVLA / World Action ModelSteering / learning feedback목표 · 전략 · 제어 제약복구 · 인간 교정일반화 축 · 비용 · 실패 경계새 데이터로 환류

작은 화면에서는 다이어그램을 좌우로 스크롤할 수 있습니다.

문헌 종합에 따른 개념도 · 공유 정책, 실행 피드백, 독립 평가를 연결해야 전이 능력의 실제 범위를 알 수 있다.

이종 데이터는 공유 능력의 재료이고, 가치·실패 평가는 행동 선택과 개선의 수단이다. 실제 실행의 결과를 검증해 새로운 학습 근거로 환류한다. 모든 논문이 이 전체 구조를 구현했다는 의미는 아니다.

로봇의 범용성은 익숙한 동작을 많이 생성하는 능력에서 출발한다. 새로운 조건에서 목표를 유지하고, 실패를 인지해 복구하며, 전이의 한계를 검증하는 체계까지 연결될 때 현장 자율성으로 이어진다.

중심 질문: 무엇을 공유해 전이하고, 무엇을 현장에서 다시 학습하며, 어떤 근거로 자율성의 범위를 확인할 것인가? 본문은 요청한 11개 항목 순서를 그대로 따른다.

PART 01 · Definition

범용성은 능력의 전이 범위로 정의한다

Robot Generalist는 하나의 작업에 맞춘 로봇을 넘어, 공유된 학습 표현과 정책을 활용해 여러 작업·물체·환경·언어 지시·로봇 신체에 능력을 전이하는 로봇 정책 또는 시스템이다. 이 글은 이를 작업 정의로 사용한다. 문헌마다 generalist의 범위가 달라 보편적으로 합의된 단일 인증 기준이 있다는 뜻은 아니다. GR00T N1은 humanoid foundation model, Gemini Robotics는 VLA generalist, π₀.₅는 open-world generalization을 각각 강조한다.[1] [2] [3]

Physical AI는 물리 세계를 관측하고 행동으로 변화시키는 지능의 넓은 범주다. Robot Generalist는 그 안에서 로봇의 폭넓은 전이 능력을 다루는 축이다. VLA는 구현 방식이며, humanoid는 신체 형태다. 범용 로봇이 반드시 인간형일 필요는 없고, 인간형 플랫폼에 모델을 탑재했다고 범용 자율성이 검증되는 것도 아니다.

범용성은 단일 점수보다 “무엇을 바꾸어도 무엇을 유지하는가”로 평가해야 한다. 이 문장은 문헌을 종합한 편집 해석이다. 정책의 일반화와 시스템의 일반화도 구별한다. 정책은 관측에서 행동을 생성하지만, 시스템은 기억·계획·제어·실패 감지·재시도·사람의 개입까지 묶어 완수한다.

일반화 축구체적 변화검증 질문
Task / composition새 목표, 익숙한 기술의 새로운 순서학습에서 제외한 작업 조합을 수행하는가?
Object / environment새 물체, 새로운 집·작업대·카메라 위치단순 배경 변화와 물리적 변화에 모두 견디는가?
Language표현 변경, 개방 어휘, 모호한 지시문장 의미를 물리적 목표와 정확히 연결하는가?
Embodiment팔 길이, 관절, gripper, 양팔 구성 변경동일 목표를 다른 실행 좌표로 옮기는가?
Temporal / recovery장기 순서, 가림, 실패 후 상태 변화중간 결과를 기억하고 실패에서 회복하는가?

Zero-shot은 해당 목표 조건에 추가 학습 없이 수행하는 평가 설정이고, few-shot은 적은 예시로 적응하는 설정이다. 사전학습 전체를 안 했다는 뜻으로 zero-shot을 해석하면 안 된다. Fine-tuning, 현장 RL, prompt 기반 조향은 서로 다른 적응 비용을 가진다. 이를 명시해야 “새 로봇에 일반화했다”는 문장이 무엇을 의미하는지 판단할 수 있다.

범위 보완: 하나의 motion tracker가 여러 reference를 수행하는 범용성도 존재한다. 이를 자연어 목표를 스스로 해석하는 범용 VLA의 자율성과 구별해야 한다. InterMimicGen은 전자의 근거를 확장한다.[17]

PART 02 · Problem Definition

부분 관측·분포 변화·자원 제약을 함께 해결한다

범용 로봇의 학습 문제는 다양한 환경과 신체에서 언어 목표를 수행하는 정책을 학습하되, 새로운 조건의 오류와 현장 적응 비용을 줄이는 것이다. 카메라는 물체 내부·마찰·접촉력·사람의 다음 동작을 완전히 보여주지 않는다. 따라서 상태를 정확히 안다고 가정하는 MDP보다 관측 이력에서 믿음 상태를 추정하는 POMDP가 자연스러운 설명 틀이다. 아래 식은 특정 논문의 복제가 아닌 종합적 정식화다.

at:t+H−1 ∼ πθ( · | ht, g, e),   ht = (o≤t, a<t)

o는 영상·관절·촉각 등 관측, g는 목표, e는 embodiment 정보, H는 한 번에 생성하는 행동 구간 길이다. 실제 신체 제어에서는 정책 행동을 제어기·기구학·구동기 제약에 연결해야 한다. 모든 VLA가 위 요소를 명시적으로 입력받는다는 주장은 아니다.

maxθ E(g,e,환경)∼Dtest[완수 보상 − λ·시간 − μ·개입 비용]
subject to: 충돌·힘·관절 제약, 추론 지연 예산, 제한된 적응 데이터

핵심은 학습 분포 Dtrain에서 높은 평균 성능을 얻는 것과, 배치 분포 Dtest에서 신뢰할 수 있게 작동하는 것이 다르다는 점이다. 표준 조건 평균 성공률만 보고하면 실패가 집중되는 카메라 시점·물체 초기 상태를 놓칠 수 있다. 이를 평가 예산 안에서 찾는 것이 능동 평가의 문제다.[12]

예를 들어 “식탁을 정리하라”는 요청은 물체 인식뿐 아니라 버리면 안 되는 물건의 판단, 잡기와 놓기, 사람과의 충돌 회피, 떨어뜨린 물체에 대한 재계획을 요구한다. 목표의 의미가 공유되어도 팔과 gripper가 바뀌면 실행은 달라진다. 의미 전이와 동역학 전이를 분리해서 검증하는 것이 문제 정의의 출발점이다.

문제 정식화 보완: 현장 적응 비용에는 정책 가중치 갱신 외에도 교정 데이터 수집·표현 조향 설정·인간 대응이 포함된다. “가중치를 고정했다”와 “추가 데이터 없이 적응했다”는 서로 다른 조건이다. 평가 예산은 이 비용까지 포함해 정의할 것을 제안한다.

PART 03 · Core Concepts

표현·행동·가치·기억을 연결하는 공통 언어

핵심 개념쉬운 설명연구에서의 역할
VLA영상과 언어를 조건으로 로봇 행동을 생성VLM의 지식을 제어로 연결; 말의 이해와 동작 정확성을 각각 검증 [1] [2]
Grounding / affordance“잡는다”를 실제 잡을 위치·자세·가능성에 연결텍스트 지식만으로 얻기 어려운 물리적 실행 의미
Action chunking짧은 미래 동작 묶음을 생성시간적 일관성·효율 확보; 관측 갱신이 늦으면 위험 변화에 반응이 늦을 수 있음 [4]
Diffusion / flow action generation여러 가능한 연속 동작 중 적합한 경로를 생성GR00T의 diffusion motor module과 flow 기반 VLA 학습은 관련되지만 동일한 모델은 아님 [1] [10]
Cross-embodiment / motion transfer몸이 달라도 목표·동작 지식을 활용신체별 좌표·관절·도달 범위의 차이를 흡수 [5] [7]
World Action Model미래 영상·세계 변화와 행동을 함께 모델링실행될 움직임의 구조를 영상 사전학습에서 이전 [8]
Value / critic / progress행동의 결과 가치와 현재 진척도를 판단후보 행동 선택·학습 피드백; 진척도, Q-value, 실패 점수는 서로 다름 [13] [14]
Continual post-training실제 운용 경험을 다음 정책 개선에 활용자율 rollout과 인간 교정으로 분포 차이를 줄임 [6] [10]

관측에 이미 실행했던 사실을 보존하는 memory, 다음 목표를 고르는 planner, 그 목표를 수행하는 actor, 결과를 평가하는 critic은 서로 다른 역할을 가진다. 하나의 backbone에 통합할 수도 있고 모듈로 나눌 수도 있다. 아키텍처 이름보다 정보가 어디에 들어가고 어떤 시간 규모에서 갱신되는지를 보는 것이 유용하다.

GR00T N1의 System 2 / System 1은 의미 해석과 운동 생성의 구분이다. 이것을 사람의 숙고·직관과 완전히 동일한 메커니즘으로 해석할 근거는 없다. 구조적 역할 구분을 인지 능력의 입증과 혼동하지 않아야 한다.[1]

제어 지점의 구분: 내부 표현을 바꾸는 intervention, 실행 중 인간에게 넘기는 gate, 학습 데이터의 승인·선별은 서로 다른 제어 지점이다. 후보 행동을 평가하는 critic과 함께 비교할 때 입력 정보·운영 비용·실패 유형을 각각 명시해야 한다.

PART 04 · Introduction

2025–2026: 넓은 정책에서 실행 가능한 자율성으로

서로 다른 물체를 집는 데 성공한 로봇이, 새로운 집에서 전체 정리 작업도 완수할 수 있을까? 2025년 이후 범용 로봇 연구는 이 질문을 데이터 전이, 신체 전이, 현장 경험, 가치 평가라는 구체적인 연구 문제로 나누어 다룬다.

2025년 GR00T N1과 Gemini Robotics는 foundation model을 물리 행동과 연결하는 대표적인 경로를 보여주었다. π₀.₅는 다중 데이터 co-training을 통해 새로운 주거 환경을 시험했고, SmolVLA는 학습·추론 효율과 공개 생태계를 강조했다. Gemini Robotics 1.5는 Motion Transfer와 행동 사이의 reasoning을, π*₀.₆는 현장 경험과 교정을 통한 RL을 추가했다.[1] [2] [3] [4] [5] [6]

2026년에는 Green-VLA의 단계적 학습, DreamZero의 세계·행동 공동 모델링, π₀.₇의 다양한 context 조건화, LWD의 fleet post-training이 서로 다른 확장 방향을 보여준다. RoboDojo와 능동 평가 연구는 검증 체계, FIERCE와 SeeQ는 개선 피드백과 행동 선택을 다룬다.[7] [8] [9] [10] [11] [12] [13] [14]

편집 해석: 이 흐름은 단일한 연구 패러다임의 승리를 의미하지 않는다. 범용성을 축적하는 학습과 범용성의 한계를 드러내는 평가가 함께 발전하고 있다. 각 논문이 다루는 로봇·데이터·평가가 달라 직접적인 순위 비교는 적절하지 않다.

10월 근거 확장: RoboIRS는 고정 정책의 표현 조향, Reward-DAgger는 인간 교정 요청, InterMimicGen은 움직임 데이터의 반복적 확장을 다룬다. 편집 해석으로는 범용성을 모델의 공유 능력뿐 아니라 그 능력을 꺼내고 교정하며 검증하는 체계까지 보아야 함을 뒷받침한다.[15] [16] [17]

PART 05 · Motivation and Background

로봇의 확장 비용은 현장마다 다시 배우는 데서 발생한다

특정 작업을 위한 정밀 자동화는 구조화된 현장에서 강력하다. 그러나 물체·작업 순서·카메라·사용자의 표현이 자주 바뀌는 환경에서는 작업별 시연 수집과 튜닝이 누적된다. 범용 정책의 동기는 이 반복 비용을 공유 학습으로 낮추는 데 있다. π₀.₅와 π₀.₇의 연구 문제는 각각 새로운 환경과 다양한 맥락에서 이러한 전이가 얼마나 가능한지를 시험하는 것이다.[3] [9]

이미지·언어 사전학습은 “컵이 무엇인지”에 관한 풍부한 prior를 제공한다. 반면 컵을 특정 gripper로 잡는 접촉 조건과 관절 경로는 로봇 데이터가 필요하다. 사람 영상은 동작 목표와 물체 변화를 보여주지만 로봇 관절 명령을 직접 제공하지 않는다. 이 때문에 이종 데이터를 많이 모으는 것만큼 표현·시간·신체 간 정렬이 중요하다.[1] [7] [8]

2025년 이전의 imitation learning, 다중 작업 정책, 대규모 로봇 데이터와 VLM은 역사적 배경이다. 본문 근거 코퍼스는 최초 공개가 2025년 이후인 논문을 중심으로 제한했다. 이번 검토는 체계적 문헌고찰의 완전한 수집·배제 프로토콜을 수행한 결과가 아니라 대표 1차 자료에 대한 비판적 종합이다.

연구·전략기획 해석: 국가·기관 R&D의 성과는 모델 크기 외에도 재사용 가능한 데이터, 표준 행동 인터페이스, 실패 분석 프로토콜, 평가 장비와 운영 경험에 축적된다. 공유 능력의 재사용 비용과 신뢰성 검증 비용을 함께 줄이는 기반을 갖춰야 현장 간 확장이 가능하다.

전략기획 보완: 공유 모델을 현장에 가져오는 데 필요한 총비용을 데이터 수집·설정·실행·교정·재검증으로 나누어 계측할 것을 제안한다. 이는 모델을 직접 다시 학습하는 접근과 경량 적응 모듈을 공정하게 비교하는 기반이다.

PART 06 · Challenges

일반화를 어렵게 만드는 여섯 종류의 간극

간극실패 메커니즘필요한 검증
Data / alignment센서·명령 시간 불일치, 시연 품질 편차, 성공 데이터 편중출처·품질·지연을 보존하고 실패를 포함한 분할 평가
Embodiment동일 언어 목표가 서로 다른 관절·접촉 조건을 요구새 몸에서 추가 데이터 양·적응 시간·잔여 성능 보고
Long horizon작은 오류 누적, 하위작업 혼동, 복구 상태 미관측작업 길이별 완수율, 실패 유형, 복구·개입 횟수 [14]
Contact / hidden state보이지 않는 힘·마찰·끼임 상태시각 외 센서 ablation, 마찰·하중 변화 실험
Runtime / latency추론 중 장면 변경, 긴 행동 구간, 통신 지연평균과 tail latency, 관측 노후화, 전체 제어 주기 [4]
Evaluation / learning feedback평가기가 잘못된 진척도·가치로 정책을 유도별도 성공 판정, critic calibration, 새 실패 조건 [12] [13]

독립적인 각 단계의 성공 확률이 0.95이고 모든 20단계를 성공해야 하며 복구가 없다는 설명용 가정에서는 전체 성공 확률이 0.9520 ≈ 0.358이다. 실제 로봇 오류는 독립이 아니고 복구도 가능하므로 이 숫자는 실험 결과가 아니다. 짧은 기술의 정확도가 장기 작업의 신뢰성을 자동으로 보장하지 않는 이유를 보여주는 예다.

SeeQ는 하위작업을 잘못 예측하면 잘못된 목표에 대해 후보 행동을 평가할 수 있다고 지적한다. FIERCE는 실패 페널티가 유용한 교정 행동까지 억제할 수 있고 formal safety를 보장하지 않는다고 밝힌다. 평가기의 점수가 높다는 것과 실제로 안전하게 완수한다는 것은 별도 검증 대상이다.[13] [14]

추가 확인된 한계: 실패 후 요청하는 교정은 사전 위험 예방과 다르다. Reward-DAgger의 reactive gate를 안전 보장으로 확대할 수 없다. InterMimicGen의 성공 변형 선별은 쉬운 물체 쏠림이나 reference 오류 누적 가능성을 가진다.[16] [17]

PART 07 · Research Questions

큰 모델이 답하지 못하는 검증 가능한 질문들

다음 질문은 관련 문헌의 한계를 바탕으로 구성한 연구 제안이다. 각 질문은 실험에서 바꿀 요소와 확인할 결과를 연결한다.

연구 질문설계할 실험판단 기준
RQ1 · 데이터 다양성이 어떤 일반화 축을 개선하는가?총 데이터·compute를 맞추고 웹/사람영상/다중 로봇/실패 데이터 비율 변경물체·환경·작업·신체별 holdout 성능과 음의 전이
RQ2 · 신체 독립 표현과 실행 제약을 어떻게 분리하는가?공유 목표 표현 + 신체 adapter와 완전 통합 정책 비교새 몸의 적응 표본 수·도달성 위반·정밀도
RQ3 · actor를 키우는 것과 critic을 개선하는 것 중 무엇이 유리한가?동일 후보 정책에서 critic 변경, 동일 critic에서 후보 다양성 변경성공률/지연/후보 수의 Pareto frontier [14]
RQ4 · 세계 예측은 실제 행동 결정을 개선하는가?World Action Model과 VLA를 데이터·실행 예산 통제하에 비교미학습 motion·접촉 조건·폐루프 regret [8]
RQ5 · 실패 감지가 복구를 촉진하는가?중단·재관측·재시도·인간 호출 규칙의 ablation복구율, 오경보, 불필요한 중단, 개입 비용 [13]
RQ6 · fleet 개선이 기존 능력을 훼손하는가?새 경험 학습 전후 고정 회귀 테스트 + 새 현장 holdout개선 작업과 악화 작업, 비용과 드리프트 [10]
RQ7 · 제한된 실물 시험으로 실패 경계를 찾을 수 있는가?능동 평가와 random/층화 평가를 같은 물리 예산으로 비교실패 영역 발견율·확률 추정 오차·평가 시간 [12]

RQ3에서 정책 후보 안에 성공 가능한 행동이 없는 경우, 뛰어난 critic도 그 행동을 새로 만들 수 없다. RQ4에서는 영상 품질과 정책 효용을 분리해야 한다. RQ7에서 대리모델의 낮은 평균 오차는 희귀한 위험 영역의 정확도를 보장하지 않는다. 질문을 좁히면 연구의 실패 결과도 다음 설계에 유용한 근거가 된다.

RQ8 · 적응의 효과와 비용을 함께 식별할 수 있는가? 연구 제안으로 가중치 학습·critic 조향·내부 표현 개입을 동일 rollout 예산에서 비교하고, 실패 종류·전체 설정 비용·새 조건 전이·기존 능력 회귀를 보고한다. 데이터 증강에서는 성공 변형의 수와 새로운 작업 의미의 수를 분리해 평가한다.

PART 08 · Approaches(Methods)

대표 논문 17편: 전이·개선·평가의 상호보완적 경로

아래 표는 주요 기여와 실험 범위를 비교한다. 모두 원 논문 또는 연구팀 기술보고서의 보고에 기반하며 이 글에서 독립 재현을 수행하지 않았다. 인용 버전은 참고문헌에 표시했다. π₀.₅는 CoRL 2025 정식 proceedings를 확인했다. 나머지는 확인한 공개 버전과 참고문헌의 상태 표기를 따른다.

논문핵심 접근확인된 실험 범위 / 해석의 한계
GR00T N1 · 2025 [1]vision-language System 2 + diffusion System 1; 실물·인간영상·합성 데이터다중 embodiment 시뮬레이션, Fourier GR-1 양팔 조작. 전체 humanoid locomotion 일반화의 증명으로 확장하지 않음
Gemini Robotics · 2025 [2]VLA와 spatial/temporal Embodied Reasoning개방 어휘·환경 변화와 추가 fine-tuning 적응. 일부 새 단기 작업에서 100개 시연 보고; 모든 작업의 학습 비용으로 일반화 불가
π₀.₅ · 2025 [3]이종 작업 co-training과 하위작업 의미 예측새 집의 정리 등 장기 조작. open-world는 논문의 평가 범위이며 무제한 자율성의 입증은 아님
SmolVLA · 2025 [4]경량 VLA; 행동 실행과 지각·예측을 분리한 비동기 stack시뮬레이션·실물 시험, 공개 코드·데이터. 소비자 장치 활용과 성능 보고는 해당 설정에 한정
Gemini Robotics 1.5 · 2025 [5]Motion Transfer; 자연어 reasoning과 행동 interleave다중 신체 학습·다단계 작업. 해석 가능한 텍스트가 물리적으로 올바른 실행을 보장하지 않음
π*₀.₆ / RECAP · 2025 [6]advantage-conditioned RL; 시연·on-policy 데이터·원격 교정세탁물·상자·espresso 작업. 어려운 일부 작업에서 throughput 2배 이상·실패율 약 절반 보고; 일반적인 모든 작업의 수치는 아님
Green-VLA · 2026 [7]VLM→grounding→다중 신체 pretrain→신체 적응→RL; 진척도·OOD 감지Simpler BRIDGE WidowX, CALVIN ABC-D, 실물 시험. OOD 탐지의 존재가 형식적 안전 보장을 의미하지 않음
DreamZero · 2026 [8]영상 diffusion backbone에서 미래 영상과 행동을 공동 모델링새 작업·환경·신체 전이 실험. 새 신체에 play data를 이용하는 few-shot 적응과 작업 zero-shot을 구별
π₀.₇ · 2026 [9]명령뿐 아니라 전략·성능 metadata·subgoal image context 조건화다중 플랫폼, 조합 작업, 일부 zero-shot cross-embodiment 보고. 새로운 몸의 모든 기술을 즉시 확보한다는 결론은 불가
LWD · 2026 [10]fleet offline-to-online RL; DIVL value learning + QAM flow-policy extraction16대 양팔 로봇·8개 실물 작업, 3–5분 작업 포함. 평균 95% 성공률 보고는 이 fleet·task 집합에 한정
RoboDojo · 2026 [11]sim-and-real benchmark와 통합 평가 인터페이스42 simulation·18 real 작업; 일반화·기억·정밀·장기·언어의 다차원 측정. 전체 현실 작업의 포괄적 인증은 아님
Active Factor Evaluation · 2026 [12]확률적 성능 surrogate + 정보획득 기반 다음 실험 선택3개 작업, 작업당 700회 이상 ground truth 평가. 100회 기준 비교에서 보통 20–40회 절감 보고; 전 도메인의 보장 아님
FIERCE · 2026 [13]generalist 초기화 후 progress–failure evaluator로 specialist RL시뮬레이션·실물 접촉 작업 2개. single-seed 관측, 정책별 확률 calibration·전체 비용·formal safety는 미입증
SeeQ · 2026 [14]현재 하위작업을 언어로 추정하고 TD Q-value로 후보 chunk 선택두 양팔 플랫폼의 실물 4개 작업, 목표별 fine-tuning. 후보 질·하위작업 분할 오류에 제한됨
RoboIRS · 2026 [15]성공·실패 rollout에서 선형 분류기와 내부 표현 조향 방향 학습; 정책 가중치 고정선정한 LIBERO-PRO 15개 작업에서 44.4%→66.2% 보고. 선택 편향·설정 비용과 제한된 아키텍처 범위 고려 필요
Reward-DAgger · 2026 [16]진척도 감소·정체로 인간 교정 요청; 정책 내부에 접근하지 않는 gate시뮬레이션·실물 8개 작업. 자율 성공과 인간 복구 가능성을 포함한 시스템 성공 지표를 구별
InterMimicGen · 2026 [17]인간–물체 상호작용 retargeting, 전신 tracker, 실행 가능한 변형의 반복 선별시뮬레이션 중심 학습과 실물 전이. 알려진 상호작용 주변 coverage 확장으로, 새 목표 의미 생성의 입증은 아님

8.1 이종 데이터 학습: 지식 전이의 연결을 학습한다

웹의 시각·언어 지식, 사람 영상의 목표 동작, 로봇 시연의 실행 명령은 정보가 다르다. Co-training은 각 자료에서 학습한 공유 표현이 다른 입력·출력에서도 유용하도록 구성한다. π₀.₅는 의미 예측과 저수준 행동을 연결하며, GR00T N1은 여러 데이터 출처를 학습한다. 데이터 양과 효과를 동일시하기보다 정렬·품질·coverage를 ablation으로 확인해야 한다.[1] [3]

8.2 신체 전이: 공통 목표를 신체별 행동으로 번역한다

Gemini Robotics 1.5의 Motion Transfer와 Green-VLA의 embodiment-aware interface는 다른 신체의 경험을 공유하려는 접근이다. 목표 중심 표현을 공유하더라도 실행에는 좌표계·도달성·gripper·관절 제한이 들어간다. 같은 목표의 공유와 동일 action vector의 공유를 구별하면 신체 간 전이가 어려운 이유를 설명할 수 있다.[5] [7]

8.3 세계와 행동의 공동 예측: 움직임의 prior를 확장한다

DreamZero는 미래 세계 변화와 행동을 함께 모델링해 비디오 기반 물리 움직임 지식을 정책에 연결한다. VLA와 World Action Model의 구분은 정보를 표현하고 예측하는 방식에 있다. 미래 영상이 사실적으로 보이더라도 후보 행동에 따른 접촉·결과를 올바르게 구별하는지, 반복 폐루프 실행이 유지되는지는 별도 평가해야 한다.[8]

8.4 현장 경험을 통한 개선: 실패와 교정을 학습 신호로 만든다

RECAP은 advantage conditioning을 통해 다양한 품질의 데이터를 활용하고, LWD는 다중 로봇의 rollout·개입 경험을 정책 갱신으로 연결한다. FIERCE는 범용 정책으로 초기화한 작은 actor를 진척도·실패 피드백으로 개선하고 배치 시에는 compact actor를 남긴다. 이들은 공유 역량을 계속 유지할지, 목표 작업의 작은 전문가를 만들지에 관해 서로 다른 선택을 한다.[6] [10] [13]

8.5 후보를 고르는 가치함수: 생성과 판단을 분리한다

SeeQ는 전체 작업의 드문 성공 보상을 직접 예측하는 부담을 줄이기 위해 현재 하위작업의 Q-value를 학습한다. 배치 때는 모델이 하위작업을 추정하고 후보 action chunk를 평가한다. 목표별 fine-tuning을 거친 실물 4개 작업에서 평균 성공률 35.4%→66.7%를 보고했다. 전체 현실 작업의 평균이 아니며, zero-shot critic transfer 결과로도 해석할 수 없다.[14]

a* = arg maxa ∈ {a₁,…,aN}, aᵢ∼π Q(h, gsub, a)

이 식은 best-of-N 조향의 개념 설명이다. 후보 수 N을 늘리면 탐색 범위와 추론 비용이 함께 커진다. Critic이 현재 하위작업의 성공을 높여도 다음 작업에 필요한 물체를 넘어뜨릴 수 있다. 그러므로 장기 결과와 현재 진척도를 결합하는 연구가 필요하다.[14]

8.6 평가를 연구 방법으로 삼는다

RoboDojo는 시뮬레이션과 실물을 연결해 다양한 역량을 측정하고, factor-based active evaluation은 불확실한 조건을 우선 시험한다. 평가의 목적은 평균 점수와 더불어 실패 영역·순위 신뢰성·운영 비용을 드러내는 것이다. 능동적으로 수집한 trial의 단순 평균은 실제 배치 분포 평균과 다를 수 있으므로 표본 선택 규칙과 추정 절차를 명시해야 한다.[11] [12]

8.7 내부 표현·인간 교정·데이터 선별: 세 가지 추가 제어 지점

RoboIRS · 논문 보고: 정책을 재학습하지 않고 residual representation에 task-specific 방향을 주입한다. 실험은 원래 LIBERO에서 fine-tuning한 π₀.₅를 사용하며, 성공률이 거의 0 또는 100%인 조건을 제외한 15개 작업에서 평가한다. 설정용 rollout 후 3개 seed로 측정했다. 실물 조작은 2개 작업이다. 조향 강도·방향의 경험적 선택이 필요하고 성공 예측 방향이 인과적으로 유효하다는 보장은 없다.[15]

Reward-DAgger · 논문 보고: 짧은·긴 관측 창의 진척도 신호로 intervention을 요청한 뒤 interactive imitation learning으로 정책을 개선한다. 같은 gate 설정을 8개 작업에 사용했다. 실패를 관측한 뒤 반응하므로 수초의 지연이 생길 수 있다. 인간 개입의 효율과 downstream 자율 성공률을 함께 평가해야 한다.[16]

InterMimicGen · 논문 보고: 손–물체 관계를 유지하는 retargeting과 전신 motion imitation을 연결하고, 작은 변형을 실행해 성공한 reference를 다음 반복의 seed로 사용한다. 실물 구현 중 G1은 저수준 전신 제어기와 손 궤적 재생을 이용한다. 따라서 sim tracker와 모든 실물 플랫폼의 실행 구조를 동일하게 볼 수 없다.[17]

편집 해석: 세 연구는 기존 능력의 표현, 복구 경험의 수집, 실행 가능한 데이터의 확대를 각각 다룬다. 이는 actor·critic 개선을 대체하는 단일 해법보다 비교 가능한 추가 설계 축으로 이해할 수 있다.

PART 09 · Key Applications

실증된 조작과 확장 가능한 적용을 구별한다

응용현재 근거현장으로 확장할 때의 조건
가정·서비스 조작새 집 정리, 세탁물·espresso 등 논문 보고 [3] [6] [9]가정·사용자·물체의 held-out 평가, 장기 무개입 시간, 오작동 복구
물류·재고·포장상자 조립, grocery restocking 등 [6] [10]완수율과 throughput, reset·개입을 포함한 전체 비용
Humanoid 양팔 조작GR-1와 다중 embodiment 조작 연구 [1] [7]보행·균형·운반을 포함하면 별도의 전신 검증 필요
정밀 접촉 조작FIERCE의 제한된 접촉 작업 실험 [13]힘·마찰·공차 변동, 재학습 seed와 반복 생산 신뢰성
공동 연구 평가 인프라RoboDojo와 능동 실물 평가 [11] [12]표준 hardware·reset·로그·split로 기관 간 비교 가능성 확보
Autonomous laboratory / 다중 로봇 협업본 글의 확장 제안; 위 논문이 직접 검증한 보편 능력은 아님시료·도구 식별, 오염·작업 권한·관측 출처·동시 자원 관리

창의적 응용 제안: AI Co-Scientist가 실험을 제안하면 Robot Generalist가 검증된 도구 조작을 수행하고, 결과·실패·교정을 지식 구조로 환류시키는 과학 실험 플랫폼을 고려할 수 있다. 단, 의미적으로 합리적인 실험 계획과 물리적으로 실행 가능한 절차를 각각 확인해야 한다. 조작 시연이 성공했다고 실험의 과학적 타당성까지 확보되는 것은 아니다.

적용의 우선순위는 목표 작업의 데이터 coverage와 실패 비용, 관측 가능성, 사람이 교정할 수 있는 방식에 따라 달라진다. 부분 범용성을 활용해 검증 가능한 업무부터 확장하는 전략이 연구 성과를 실제 가치로 연결하는 현실적인 경로다.

응용 구분 보완: 제조·서비스 환경에서는 교정 요청 후 복구 가능한 실패와 즉시 정지해야 하는 실패를 별도 업무 명세로 관리할 것을 제안한다. 전신 reference 실행 능력의 도입에서는 이동·균형·손 조작을 포함하되, 목표를 새로 계획하는 능력은 별도로 검증한다.

PART 10 · Open Problems

좋은 데모와 신뢰할 수 있는 자율성 사이에 남은 문제

1 · 범용성의 측정 단위. 특정 벤치마크의 높은 점수, 낯선 집에서의 성공, 새 embodiment 적응은 서로 다른 근거다. 일반화 축과 적응 예산, 평가 환경의 독립성을 함께 보고하는 공통 능력 명세가 필요하다. Sim-and-real 평가도 배치 분포 전체를 대체하지 못한다.[11] [12]

2 · 장기 목적과 국소 가치의 불일치. 하위작업 진척도를 높이는 행동이 나머지 작업을 어렵게 할 수 있다. SeeQ의 논의는 하위작업 단위 학습의 효율과 전체 목표 가치 사이의 trade-off를 드러낸다. 세밀한 분할이 항상 좋은 것은 아니며 복구 상태에서는 경계가 모호하다.[14]

3 · 숨은 물리 상태와 불확실성. 관측된 영상이 같아도 마찰·접촉력·내부 상태가 달라 결과가 바뀔 수 있다. 실패를 예측하는 score가 확률적으로 calibration되어 있는지, 정책이 바뀐 뒤에도 유지되는지 불명확하다. FIERCE의 failure-risk penalty는 실험적 학습 신호이며 안전 인증이 아니다.[13]

4 · 계속 학습하는 시스템의 회귀와 출처. Fleet의 새 경험이 다른 현장의 기술을 악화시키거나 편향된 교정을 증폭할 수 있다. LWD는 경험 환류의 실증 사례지만 모든 분포에서 영구적인 개선을 입증하지 않는다. 모델·데이터·개입·평가 버전을 묶어 어떤 변경이 어떤 능력을 바꾸었는지 추적해야 한다.[10]

5 · 물리 실행과 의미 설명의 차이. 자연어 reasoning은 목표 분해에 도움이 될 수 있지만, 출력된 설명이 실제 계산과 결과를 충실히 설명하는지는 별도 문제다. VLA와 WAM의 미래 예측도 실제 개입 효과 및 시스템 제약과 맞물려야 한다.[5] [8]

6 · 총비용과 재현성. Actor inference latency, 성공한 작업당 시간, 평가기 학습 비용, 로봇 운영 시간은 서로 다른 지표다. FIERCE의 single-seed 관측과 배치 actor 비용을 전체 신뢰성·운영 비용 절감으로 확대하면 안 된다. 모델·데이터 공개 여부와 별도로 독립 반복 실험이 필요하다.[13]

범용적 행동 생성 능력과 범용적 검증 능력의 격차가 남아 있다. 이것은 여러 논문을 연결한 편집 해석이며, 모든 연구에 대한 실험적으로 입증된 보편 법칙은 아니다.

추가 미해결 문제: 성공을 예측하는 표현 방향의 인과적 유효성, 개입 지연 중 손상 가능성, 증강으로 늘어난 동작 수와 목표 다양성의 불일치를 별도 검증 대상으로 삼아야 한다. 이는 이번에 추가한 세 연구의 제약을 연결한 해석이며, 통합 해결책의 효과를 이미 검증했다는 의미는 아니다.

PART 11 · Future Directions

능력의 확장과 검증의 확장을 함께 설계한다

아래는 원문 결과를 바탕으로 구성한 창의적 연구·전략기획 제안이다. 확립된 표준이나 이미 검증된 해결책으로 제시하지 않는다.

11.1 목표·사건·실행 상태를 연결하는 temporal scene graph

연속 영상 표현 위에 “컵을 옮겼다”, “뚜껑이 잠겼다”, “실패 후 재시도 중이다” 같은 시간적 사건 그래프를 결합한다. 관측 사실, 추정 상태, 실행 의도, 검증 결과를 구별해 저장한다. 목적은 설명 장식보다 오래된 목표나 잘못된 하위작업으로 진행하는 오류를 줄이는 것이다. Memory 없는 정책, latent memory, 사건 그래프 결합 모델을 같은 작업·데이터 예산으로 비교하고 복구율·오판율을 측정할 수 있다.

11.2 불확실성을 행동 결정에 연결한다

불확실할 때 더 큰 모델을 매번 호출하기보다 추가 관측, 촉각 탐색, 재계획, 안전한 정지, 인간 요청 중 적합한 선택을 한다. 평균 성공률 외에 오경보·미탐·개입 횟수·지연을 함께 측정한다. Uncertainty score가 실제 실패 확률과 맞는지 새로운 정책·환경에서 재확인한다.

11.3 공유 generalist와 현장 specialist를 함께 운영한다

광범위한 foundation policy는 새로운 목표와 전략의 출발점으로, 작은 specialist는 반복되는 정밀 실행에 활용한다. 승격·fallback 조건과 도달 가능한 행동 범위를 명시한다. FIERCE의 전문가 정련, π₀.₇의 context 조향, LWD의 공유 개선은 관련 근거지만 이 통합 구조 전체의 유효성을 검증한 것은 아니다.[9] [10] [13]

11.4 능력과 근거를 함께 관리하는 평가 체계

각 능력에 작업·물체·환경·신체·데이터·추론 예산과 검증 로그를 연결한다. Critic score, 실제 성공 판정, 위험 제약 위반을 별도 열로 기록하고, 평가 분포의 coverage를 공개한다. 능동 평가로 실패 가능 영역을 찾아 새 데이터와 회귀 테스트로 연결한다. 이런 능력 명세는 다중 기관 공동 연구에서 모델 자체와 함께 공유할 수 있는 자산이다.

단계실행할 연구검증 산출물
1 · 기준선VLA·WAM·critic 조향을 공통 split와 예산에서 비교일반화 축별 보고서, 데이터·모델 버전, 실패 로그
2 · 복구기억·하위작업 불확실성·재관측·인간 개입 실험장기 완수율, 복구율, 개입·지연 trade-off
3 · fleet 환류새 현장 경험을 검증 후 공유 모델에 반영학습 전후 회귀 결과, 비용·drift 분석
4 · 기관 간 확장공유 행동 인터페이스와 실물 평가 프로토콜 적용새 embodiment·새 기관 holdout, 재현 가능한 근거 묶음

평가할 핵심 성과는 성공적인 기술 시연의 수에서, 검증된 전이 범위·복구 능력·현장 적응 비용으로 확장해야 한다. 연구 투자는 행동 모델, 경험 데이터, 가치·실패 평가기, 공통 실물 평가 기반을 서로 연결하는 형태로 구성할 수 있다. 이는 모델 개발과 인프라 구축을 함께 설계하는 제안이다.

11.5 현장 적응 모듈의 공정한 평가와 실패 분포 관리

연구 제안: 고정 actor를 대상으로 critic 선택·표현 intervention·인간 gate를 각각 적용하고, 동일한 교정 예산에서 개선·악화 작업과 전체 비용을 비교한다. 이어 전신 reference 증강 데이터에서 선택되지 않은 실패도 보존하고, held-out 물체·지형·새 작업 의미를 별도 분할한다. 성공 변형의 확대와 새로운 목표에 대한 범용성을 구별해야 한다.

SOURCES & SCOPE

원 논문과 근거의 범위

검토 기준일: 2026-10-07 KST. 공개일은 arXiv 최초 제출일(UTC)을 기록했으며 게시일의 KST와 구별한다. 원문 초록·주요 방법·실험·한계 중심의 대표 자료 검토로, 모든 논문을 망라하지 않는다. 독립 재현은 수행하지 않았다. π₀.₅의 CoRL 2025 정식 proceedings를 확인했으며, 추가한 10월 논문 세 편은 arXiv v1 프리프린트로 별도 출판·동료심사 완료를 확인하지 못했다. 나머지 자료의 상태는 확인된 공개 원문 버전에 한정한다. 최신 개정일이 별도 미확인인 두 자료는 확인한 HTML 본문에 한정해 인용했다. 기존 14편의 제출·개정 정보를 재확인했으며, 능동 평가·FIERCE·SeeQ 세 편은 이번 재조회에서 원문을 가져오지 못해 기존에 확인한 버전과 한정 설명을 유지했다. TUD(2610.05025)는 1차 본문을 가져오지 못해 핵심 근거에서 제외했다.

  1. GR00T N1: An Open Foundation Model for Generalist Humanoid Robots최초 공개 2025-03-18 UTC · v2 · 2025-03-27 · arXiv 공개 논문/기술보고서VLA의 의미 이해와 운동 생성, 이종 데이터 학습https://arxiv.org/abs/2503.14734
  2. Gemini Robotics: Bringing AI into the Physical World최초 공개 2025-03-25 UTC · v1 · arXiv 공개 논문/기술보고서VLA와 Embodied Reasoning, 추가 학습에 의한 적응https://arxiv.org/abs/2503.20020
  3. π₀.₅: a Vision-Language-Action Model with Open-World Generalization최초 공개 2025-04-22 UTC · v1 · arXiv 공개 논문/기술보고서다중 로봇·웹·의미 예측 co-training과 미학습 주거 환경https://arxiv.org/abs/2504.16054정식 출판 확인: CoRL 2025 · PMLR 305:17–40https://proceedings.mlr.press/v305/black25a.html
  4. SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics최초 공개 2025-06-02 UTC · v1 · arXiv 공개 논문/기술보고서경량 VLA와 비동기 추론https://arxiv.org/abs/2506.01844
  5. Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer최초 공개 2025-10-02 UTC · v3 · 2025-11-28 · arXiv 공개 논문/기술보고서Motion Transfer, 자연어 사고와 행동의 결합https://arxiv.org/abs/2510.03342
  6. π*₀.₆: a VLA That Learns From Experience최초 공개 2025-11-18 UTC · v2 · 2025-11-19 · arXiv 공개 논문/기술보고서RECAP: 시연·자율 실행·전문가 교정의 RL 결합https://arxiv.org/abs/2511.14759
  7. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots최초 공개 2026-01-31 UTC · v2 · 2026-03-07 · arXiv 공개 논문/기술보고서단계적 학습, embodiment-aware 인터페이스, 실행 진척도https://arxiv.org/abs/2602.00919
  8. World Action Models are Zero-shot Policies최초 공개 2026-02-17 UTC · v1 · arXiv 공개 논문/기술보고서DreamZero: 영상과 행동의 공동 미래 모델링https://arxiv.org/abs/2602.15922
  9. π₀.₇: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities최초 공개 2026-04-16 UTC · v2 · 2026-04-24 · arXiv 공개 논문/기술보고서목표·전략·성능 메타데이터·하위목표 이미지 조건화https://arxiv.org/abs/2604.15483
  10. Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies최초 공개 2026-05-01 UTC · v4 · 2026-09-16 · arXiv 공개 논문/기술보고서다중 로봇 fleet 경험으로 계속하는 post-traininghttps://arxiv.org/abs/2605.00416
  11. RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies최초 공개 2026-07-05 UTC · v3 · 2026-07-08 · arXiv 공개 논문/기술보고서시뮬레이션·실물 로봇을 연결한 다차원 평가https://arxiv.org/abs/2607.04434
  12. Active Real-World Factor-Based Evaluation for Generalist Robot Policies최초 공개 2026-07-16 UTC · v1 · arXiv 공개 논문/기술보고서확률적 대리모델과 정보획득 기반 실물 능동 평가https://arxiv.org/abs/2607.14439
  13. FIERCE: From Generalist Robot Policies to Fast Specialists via Progress–Failure Feedback최초 공개 2026-09-16 UTC · 본문 HTML 확인 · 최신 개정일 별도 미확인 · arXiv 공개 논문/기술보고서진척도·실패 피드백으로 compact specialist 정련https://arxiv.org/abs/2609.18651 · 확인한 HTML 본문
  14. SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation최초 공개 2026-09-18 UTC · 본문 HTML 확인 · 최신 개정일 별도 미확인 · arXiv 공개 논문/기술보고서하위작업 Q-value와 best-of-N 정책 조향https://arxiv.org/abs/2609.22085 · 확인한 HTML 본문
  15. RoboIRS: Inference-Time Internal Representation Steering for Generalist Robot Policies최초 공개 2026-10-03 UTC · v1 · arXiv 프리프린트; 별도 학회·학술지 출판 및 동료심사 완료 미확인정책 가중치 고정과 현장 조향 비용을 구별https://arxiv.org/abs/2610.04681 · 확인한 v1 본문
  16. Reward-DAgger: Robot-Gated Interactive Imitation Learning with General-Purpose Progress-Based Reward Models최초 공개 2026-10-02 UTC · v1 · arXiv 프리프린트; 별도 학회·학술지 출판 및 동료심사 완료 미확인진척도 기반 인간 교정 요청과 반응 지연https://arxiv.org/abs/2610.04054 · 확인한 v1 본문
  17. InterMimicGen: Scaling Humanoid Loco-Manipulation through Self-Evolving Motion Imitation최초 공개 2026-10-05 UTC · v1 · arXiv 프리프린트; 별도 학회·학술지 출판 및 동료심사 완료 미확인전신 상호작용 데이터 확장과 reference 실행 범위https://arxiv.org/abs/2610.06850 · 확인한 v1 본문

증거 표기: “보고”는 논문 저자의 결과이며 “편집 해석”은 문헌 종합이다. “연구 제안”은 추가 검증이 필요한 설계 아이디어다. 원문 URL은 확인했으나 본문에 연결된 모든 외부 코드·데이터 링크를 별도로 재검증한 것은 아니다.