범용 로봇의 성능을
검증 가능한 국가 R&D로
Physical AI Robot Generalists
2025–2026 연구 근거와 2028–2032 한국 전략연구의 연결
공유 데이터로 전이와 예측을 학습하고 실물 실행의 안전·운영 증거로 확산 여부를 판단한다. 좁은 화면에서는 그림을 좌우로 이동할 수 있다.
낯선 현장에서도 안전하게 끝내는 능력을 어떻게 국가 연구사업의 목표와 검증 기준으로 바꿀 것인가?
공유 능력의 전이와 안전한 실물 운용을 함께 검증해야 한다. 이 글은 공개 1차 문헌에서 확인한 연구 결과와 독립적인 전략 제안을 연결한다. 외부 인용이 제한된 원자료의 문장·그림·시장 전망 수치는 재현하지 않는다. 가격·시장 보급·규제·국내 정책은 연구 성능과 별도의 검증 항목이다.
전이 가능한 능력과 검증 가능한 운용
작업 정의. Physical AI는 센서로 물리 상태를 관측하고, 상태와 목적을 추론하며, 행동으로 환경을 바꾸는 폐루프 지능이다. 로봇뿐 아니라 자율 이동체와 지능형 인프라도 포함할 수 있다. 여기서 Robot Generalist는 여러 작업·물체·환경·지시·신체에서 공유한 지식과 기술을 전이하는 로봇 정책 또는 시스템으로 정의한다. 학계 전체가 합의한 단일 표준 정의라는 뜻은 아니다.
VLA는 영상과 언어, 필요에 따라 로봇 상태를 받아 행동을 출력한다. GR00T N1은 시각·언어 해석과 운동 행동 생성을 결합하고, Gemini Robotics는 조작 정책과 embodied reasoning의 관계를 보여 준다. π₀.₅는 학습하지 않은 가정에서의 작업을 통해 현장 일반화를 검토한다. [2] [3] [4]
| 구분 | 정확한 의미 | 평가상의 함정 |
|---|---|---|
| Generalist / specialist | 여러 분포에 걸친 공유 능력 / 제한된 업무에 최적화한 능력 | 작업 수가 많아도 새 환경 전이가 검증되지 않을 수 있음 |
| Humanoid / polyfunctional | 인간형 형태 / 여러 기능을 수행하는 성질 | 형태와 범용성은 별도 축. 이동형 양팔과 고정형 팔도 일반화 평가 대상 |
| Zero-shot / adaptation | 목표 현장 데이터 없이 수행 / 시연·미세조정 후 수행 | 새 신체에 적응한 결과를 무학습 전이로 표현하면 안 됨 |
| Model / system | 학습 정책 / 센서·계획·제어·안전·운영을 포함한 통합체 | 모델 성공률로 장기간 시스템 신뢰성을 대신할 수 없음 |
해석. 한국의 목표형상은 “범용 로봇 모델 보유”보다 “여러 국내 현장과 기종에서 안전하게 임무를 완료하는 공통 기반”으로 구체화하는 편이 평가 가능하다.
미지의 현장에서 안전한 임무 완료
중심 문제는 관측이 불완전하고 동역학이 달라지는 현장에서 자연어 임무를 안정된 행동으로 변환하는 것이다. 물체 안쪽의 상태, 마찰, 인간의 다음 행동은 완전히 보이지 않는다. 따라서 단일 프레임 분류보다 이력과 불확실성을 가진 의사결정 문제로 다뤄야 한다.
hₜ: 관측·행동 이력 · g: 임무 · e: 신체와 제어 인터페이스
제안 목적: 낯선 현장 분포에서 기대 임무 보상 최대화, 위험·지연·에너지 제약 충족
이는 논문들을 연결한 POMDP 관점의 설명 틀이며 특정 논문의 수식을 재현한 것이 아니다. 실험은 작업, 물체, 배경, 현장, 기종을 각각 홀드아웃하고, 공개 학습 데이터와 평가 데이터의 중복을 점검해야 한다. 현장 미세조정 시간과 사람 개입도 평가 비용에 넣는다.
임무 성공과 안전한 실행을 별도로 측정해야 한다. SafeVLA-Bench는 완료한 궤적에도 과도한 접촉이나 주변 물체 교란이 남을 수 있음을 보여 준다. 다중 로봇에서는 한 대의 성공이 전체 시스템의 충돌 회피나 교착 해소를 보장하지 않는다. [7] [12]
데이터·세계·행동·신체·안전의 연결
| 개념 | 작동 원리 | 연구·평가 포인트 |
|---|---|---|
| VLA / action representation | 시각·언어 의미를 연속 행동 또는 행동 토큰으로 변환 | FAST의 주파수 공간 압축과 diffusion/flow의 차이 [1] [2] |
| World model | 행동에 따른 다음 관측·잠재 상태를 예측 | 영상 품질과 행동 조건부 물리 타당성을 분리 [10] [14] |
| Cross-embodiment | 공통 기술과 기종별 자유도·좌표계·행동 출력을 연결 | 기종 어댑터의 데이터 비용과 음의 전이 [2] [3] |
| Dexterity / touch | 미끄러짐·접촉·물체 자세를 촉각과 고유감각으로 추정 | 형상을 모방하는 것과 접촉을 유지하는 것은 다름 [11] |
| Action chunking / asynchronous execution | 행동 묶음을 실행하면서 다음 묶음을 계산 | 청크 경계의 급격한 동작과 오래된 관측의 영향 [5] [6] |
| Multi-robot orchestration | 임무 분해·역할 할당과 실제 공간·자원 제약을 결합 | 언어 합의 뒤 실행 가능성 검증 필요 [7] |
| Safety layer / constrained learning | 위험 행동을 제약하거나 정책 자체를 안전하게 학습 | 안전 필터의 가정, 분포이탈, 실제 제동 검증 [8] [9] |
설계 제안. 월드모델에 시간별 객체 관계 그래프를 결합하면 “누가 무엇을 잡았는가”, “어느 구역이 점유됐는가”를 로봇들 사이에 공유할 수 있다. 그래프는 접촉 동역학을 대체하지 않고, 연속 상태와 임무 제약을 연결하는 기록층으로 사용한다. 이 결합의 효과는 별도 실험으로 검증해야 한다.
2025년 정책 일반화에서 2026년 평가·통합으로
2025년 대표 연구는 대규모 시각·언어 사전학습을 행동에 연결하고 이종 데이터로 전이 범위를 넓혔다. GR00T N1은 이중 시스템과 혼합 데이터를, Gemini Robotics는 공간 추론과 조작 적응을, π₀.₅는 새로운 가정에서의 장기 작업을 제시한다. 각각의 실험이 모든 산업 작업이나 모든 신체의 일반화를 증명하는 것은 아니다. [2] [3] [4]
동시에 FAST는 행동 표현, SmolVLA는 비용과 비동기 추론, RTC는 실행 지연을 다룬다. 이 흐름은 범용성을 모델 정확도 하나로 측정하기 어렵다는 점을 드러낸다. [1] [5] [6]
2026년에는 인간 영상에서 월드모델을 학습하는 DreamDojo, 언어·미래·행동을 묶는 WLA, 시뮬레이터 평가의 신뢰성을 다루는 RoboWorld, 궤적 안전을 따로 평가하는 SafeVLA-Bench가 연구 범위를 확장한다. 9월의 소형 정책 증류 연구는 미래 영상을 매번 생성하지 않고도 월드모델 표현을 정책에 전달하는 접근을 제안한다. [10] [12] [13] [14] [15]
종합 해석. 정책, 예측, 평가, 실행이 서로 연결되는 방향이 관찰된다. 다만 위 흐름을 성숙한 상용 플랫폼의 완성이나 특정 연도의 시장 보급률로 해석할 근거는 부족하다.
연구 성능을 현장의 재사용 가능성으로
로봇의 데이터를 얻으려면 실제 장비, 사람의 시연, 센서 동기화, 복구 시간이 필요하다. 웹 지식과 인간 영상은 의미와 행동의 구조를 제공하지만 로봇의 토크와 접촉 상태를 직접 알려 주지는 않는다. 이 간극 때문에 이종 데이터 공동학습, 잠재 행동, 소량 목표 기종 데이터의 활용이 연구 동기가 된다. [2] [4] [10]
현장에서는 품종 변경, 물체 변형, 사람의 개입이 생길 때 재프로그래밍 비용이 늘어난다. 전략 해석: 국내 제조·물류의 경쟁력은 로봇을 한 번 배치하는 성능뿐 아니라, 새로운 공정으로 옮길 때의 추가 데이터·통합 비용을 줄이는 데서 나올 수 있다. 제조 효과나 비용 절감률을 여기서 확정하지 않는다.
ETRI 역할 제안. 여러 기업이 사용할 공통 데이터 규격, 실행 인터페이스, 네트워크·엣지 운용 기술, 독립 검증 체계를 공공 연구 기반으로 개발한다. 로봇 완제품과 개별 공정 수익모델은 산업체와 공동 검증한다. 이는 본 글의 연구기획 제안이며 공식 국가정책이나 ETRI 확정 사업이 아니다.
Build–Partner–Buy 판단도 전체 국산화 비율보다 전환 가능성으로 구체화한다. 데이터 이동, 기종 교체, 모델 교체, 재검증에 드는 시간과 비용을 측정하면 기술 자립의 실질적인 정도를 평가할 수 있다.
실험실 성공과 지속 운용 사이의 간극
| 도전 | 실패 메커니즘 | 필요한 검증 |
|---|---|---|
| 데이터의 분포 편향 | 성공 시연에 치우치면 실패 징후와 복구를 학습하기 어려움 | 새 현장·실패·반례 표본 분리, 데이터 계보 추적 [4] |
| 접촉과 sim-to-real | 마찰·마모·미끄러짐·촉각 센서 특성이 시뮬레이션과 다름 | 실측 접촉·힘, 센서 변동, 기종별 전이 [11] |
| 월드모델의 오류 | 그럴듯한 미래 영상이 잘못된 행동 선택을 유도할 수 있음 | 행동 개입 테스트, 예측 순위와 실물 정책 순위 비교 [14] |
| 실시간·엣지 비용 | 추론 중 환경 변화, 지연 꼬리, 발열·전력 제한 | 센서부터 행동까지 p95/p99, 통신 단절, 전력 기록 [5] [6] |
| 여러 로봇의 협업 | 상태 불일치·자원 경쟁·교착·통신 손실 | 규모별 임무 완료와 충돌·교착·복구 비용 [7] |
| 성공–안전 간극 | 완료 과정에서 과도한 접촉이나 주변 물체 교란 | success-but-unsafe와 위반 심각도 [12] |
| 운영 경제성 | 설치·환경 개조·정비·사람 개입이 모델 성능을 상쇄 | 성공 임무당 총비용, 가동률, 복구 시간 |
해석. Mamba, liquid 계열 모델, 뉴로모픽 장치는 비교할 후보 기술이다. 특정 계열이 범용 로봇의 필수 조건이라는 실증 근거는 이 선정 문헌에서 확인되지 않는다. 엣지 여부는 모델 이름보다 목표 장치에서의 실제 지연·전력·품질로 판단한다.
기술 및 시장 전망은 서로 다른 근거가 필요하다. 보급률, 공급업체 순위, 장비 가격, RaaS 비중, 규제 지연 연수는 위 로봇 학습 논문들만으로 확인할 수 없다. 별도 시장 조사와 정책 원문 검증 대상으로 유지한다.
사업으로 번역할 수 있는 검증 질문
| 질문 | 창의적 가설 · 제안 | 반증 가능한 실험 |
|---|---|---|
| RQ1. 어떤 데이터가 현장 전이에 기여하는가? | 작업 수보다 실패·접촉·환경 다양성이 중요할 수 있음 | 같은 수집 비용에서 성공 시연과 실패 포함 데이터 비교 |
| RQ2. 월드모델이 제어에 언제 도움이 되는가? | 추가 관측 또는 재계획이 필요한 순간에만 사용하면 비용 감소 | VLA 단독·항상 예측·불확실성 조건부 예측 비교 |
| RQ3. 기종 전이의 최소 공통 표현은 무엇인가? | 기술 의도와 접촉 제약을 공유하고 관절 출력을 분리 | 서로 다른 팔·그리퍼에서 추가 시연 수와 성능 비교 |
| RQ4. 지연을 견디는 정책은 어떻게 설계하는가? | 비동기 청크와 촉각 반응을 결합하면 지연 영향 완화 | 고정·변동 지연과 패킷 손실을 넣어 안전 완료율 비교 |
| RQ5. 협업 지식의 어떤 부분을 공유해야 하는가? | 원시 영상보다 객체·접촉·점유 상태 공유가 유용할 수 있음 | 같은 대역폭에서 중앙·분산·부분 공유 비교 |
| RQ6. 개선을 안전하게 배포할 수 있는가? | 정책·안전 규칙·증거 버전을 함께 묶으면 회귀 탐지 용이 | 업데이트 전후 동일 반례 집합, 롤백 시간, 새 위험 평가 |
질문은 기존 논문의 합의된 결론이 아니라 연구 설계를 위한 가설이다. 각 가설은 성능 향상과 함께 추가 계산, 데이터 비용, 안전 악화 가능성도 측정해야 한다.
서로 다른 병목을 겨냥하는 방법의 조합
이종 데이터 공동학습과 신체 적응
π₀.₅는 웹 및 로봇 데이터, 의미적 하위작업과 저수준 행동을 결합한다. GR00T N1은 실물·인간 영상·합성 데이터를 사용한다. 공통 의미 표현과 기종별 행동 출력을 연결하고, 새로운 기종에서 요구되는 적응 데이터의 양을 기록하는 설계가 중요하다. [2] [4]
행동 표현과 실행 시간의 분리
FAST는 DCT 기반 행동 압축을 사용한다. RTC는 현재 묶음을 실행하면서 다음 행동을 생성하고 이미 실행할 부분을 보존한다. SmolVLA는 경량 모델과 비동기 실행을 결합한다. 이는 별개의 병목을 다루는 방법들이며 FAST의 학습 시간 개선을 센서부터 액추에이터까지의 지연 감소로 바꿔 말하면 안 된다. [1] [5] [6]
월드모델 통합과 증류
DreamDojo는 인간 영상과 잠재 행동으로 상호작용을 학습한 뒤 목표 로봇 데이터로 적응한다. WLA는 하위작업, 하위목표 영상, 행동을 함께 다룬다. 소형 정책 증류는 월드모델 특징을 학습 신호로 사용하고 추론 때 교사를 제거한다. [10] [13] [15]
촉각 전이와 위험 제약
PTLD는 완전한 촉각 시뮬레이션 대신 실물의 특권 센서 데이터로 촉각 상태 추정기를 증류한다. 안전은 ATACOM 같은 별도 행동 계층, SafeVLA 같은 제약 학습, SafeVLA-Bench 같은 사후 궤적 평가로 각각 접근할 수 있다. 한 계층의 결과가 다른 계층의 검증을 면제하지 않는다. [8] [9] [11] [12]
보고 수치의 해석 범위
| 연구 | 저자 보고 결과 | 해석 제한 |
|---|---|---|
| Gemini Robotics | 일부 새로운 단기 작업에서 최소 100개 시연으로 학습 [3] | 모든 작업·모든 기종에 필요한 시연 수가 아님 |
| DreamDojo | 44k 시간 인간 영상, 증류 후 10.93 FPS [10] | 월드모델 영상 생성 속도. 고주파 제어 또는 안전 보증이 아님 |
| SafeVLA-Bench | 평균 성공 90% 초과 테이블탑 정책 15개도 unsafe episode 18–28% [12] | 정의된 시뮬레이션 안전 절에 따른 결과. 산업 사고율로 해석 불가 |
| RoboWorld | 실물 평가와 Pearson r=0.989, Spearman ρ=0.970 [14] | 평가된 작업·정책 범위의 상관. 새 현장 인증을 대신하지 못함 |
| 소형 정책 증류 | RTX 5090에서 32ms·1.86GB, 0.8B 학생의 LIBERO 97.9% [15] | 소비자 GPU 측정. 로봇 엣지 SoC의 종단 지연·전력 결과가 아님 |
위 문헌 가운데 학회 상태를 명시한 항목은 원 출판처나 논문 페이지에서 확인했다. 나머지는 본 조사에서 arXiv 공개본을 확인한 연구이며, 이를 모두 동료심사 완료 논문으로 표시하지 않는다. 선정 15편은 의제별 대표 근거이며 전수 체계적 문헌고찰이 아니다.
현장별 실증과 전략 응용의 구분
| 영역 | 연구에서 확인한 능력 또는 제안 | 현장 적용에 추가로 필요한 검증 |
|---|---|---|
| 가정·서비스 조작 | 새로운 가정의 장기 조작, 복잡한 양손 조작 실험 [3] [4] | 다양한 사용자·장시간 운용·실패 복구·사생활 데이터 관리 |
| 정밀 제조 | 촉각 조작을 조립·체결에 연결하는 전략 제안 [11] | 공차·힘 제한·불량률·사이클 타임. 손 안 회전 실험으로 조립 성능 확정 불가 |
| 물류·창고 | 자연어 역할 배분과 이종 로봇 조작을 연결하는 제안 [7] | AMR-팔 인수인계, 교착, 작업자 혼재, 피크 처리량 |
| 검사·인프라 | 공간 추론과 협업을 점검 임무에 적용하는 제안 [3] [7] | 실외 센서 손실·위치 오차·탐지 신뢰도·복귀 절차 |
| 원격 운용·정책 평가 | 월드모델 기반 원격 운용·계획·평가 연구 [10] [14] | 지연 시 상태 예측 오류와 실물 재검증 |
| 자율 실험·재난 대응 | 안전 계층과 장기 임무 관리의 확장 제안 | 화학·재난 영역별 위험 모델과 규정, 사람 승인 및 복구 실증 |
사업화 제안. 플랫폼을 정책 API, 기종 어댑터, 운용 기록, 평가 결과 묶음으로 구성한다. RaaS 및 성과 기반 계약은 기술과 별도의 사업 가설이다. 성공 임무당 비용은 장비 감가, 설치·개조, 데이터·학습, 추론·통신, 정비, 사람 개입 비용의 합을 안전하게 완료한 임무 수로 나눠 산정한다. 측정된 현장 자료 없이 가격 하락이나 수익률을 단정하지 않는다.
현재 근거로 아직 답할 수 없는 문제
일반화의 경계. 새 물체, 새 현장, 새 신체, 새 임무를 동시에 바꾸면 어느 요인이 성능 저하를 만드는지 구별하기 어렵다. 평가 분해와 조합 평가가 함께 필요하다. 목표 기종 데이터의 최소량과 기존 능력의 유지도 미해결이다.
월드모델의 타당도. 학습 데이터 밖의 힘과 접촉을 정확하게 예측할 수 있는지, 정책이 모델의 허점을 이용하는지, 평가 모델과 정책이 같은 편향을 갖는지 검증해야 한다. 높은 정책 순위 상관만으로 위험한 개별 행동이 사라지지는 않는다. [10] [14]
장기 운용과 안전. 센서 마모, 사람 행동 변화, 업데이트 이후 회귀를 포함한 지속적 운용 증거가 부족하다. 학습 기반 안전, 행동 필터, 물리적 비상정지는 각각 어떤 가정 아래 유효한지 명시해야 한다. [8] [9] [12]
협업과 거버넌스. 여러 로봇의 신념 불일치, 책임 분담, 최소 데이터 공유, 네트워크 단절 중 독립 운용이 남는다. 안전한 행동 공간 연구가 모델 공급망, 명령 권한, 사이버 침해까지 해결한 것으로 해석해서는 안 된다. [7]
경제성·정책. 이 문헌들은 시장 침투율, 공급업체의 우열, 국내 정책의 확정 일정, 규제 승인을 입증하지 않는다. 특히 2028–2032년 일정은 연구기획 시나리오다. 시장·정부 정책 근거를 추가한 뒤 예산과 보급 목표를 결정해야 한다.
2028–2032년 목표형상과 여섯 개 연계 사업
제안 목표형상. 이종 로봇이 낯선 국내 제조·물류 현장에서 지식을 재사용하고, 통신 장애와 작업 실패에도 안전하게 임무를 완료하는 검증 가능한 Physical AI 공통 기반.
아래는 공식 사업 계획이나 논문이 보장하는 예측이 아닌, 선정 근거를 바탕으로 설계한 전략연구 포트폴리오다. 여섯 사업은 같은 데이터 계보, 기종 인터페이스, 안전 임무 평가를 공유한다.
| 연계 사업 | 산출물·연계 | 핵심 검증 |
|---|---|---|
| P1. 산업 행동 데이터 기반 | 영상·촉각·힘·행동·실패의 동기화 및 계보. P2/P3/P4의 학습·평가 입력 | 권리·버전 기록, 홀드아웃 현장, 수집 비용당 개선 |
| P2. 현장 적응형 경량 VLA | 공통 정책, 기종 어댑터, 월드모델 표현 증류. P5의 실행 엔진 | 새 기종 적응 데이터량, 전문 정책 대비 품질, 전력과 p99 지연 |
| P3. 접촉 기반 월드모델·검증 | 실측으로 보정한 동역학·신경 시뮬레이터. P2/P4의 사전 평가 | 행동 개입 정확성, 정책 순위 보존, 위험 사례 탐지 |
| P4. 촉각·힘 기반 정밀 조작 | 불확실성 추정과 고주파 반응 제어. P2의 행동을 실물로 연결 | 공차·접촉 안정성·힘 제한·복구율 |
| P5. 이종 로봇 협업·엣지 운용 | 임무 그래프, 분산 상태, 자원 예약·교착 복구. P6 로그 연계 | 규모 확장, 통신 손실, 현장 완료율과 가동률 |
| P6. 안전 증거·운영 검증 | 안전 규칙·반례·서명된 업데이트·롤백과 운용 비용 평가 | 안전 완료율, 위반 심각도, 사람 개입, 재검증·교체 비용 |
연차별 가설과 통과 조건
| 기간 | 계획 제안 | 단계 통과 근거 |
|---|---|---|
| 2028 | 제조·물류 대표 작업 선정. 데이터·안전 규격, 공개 기준선, 첫 실물 검증 | 고정된 업무 범위에서 전문 정책 기준선과 반복 실험. 미충족 시 작업 범위 축소 |
| 2029–2030 | 서로 다른 기종·현장으로 전이. 촉각·월드모델·협업 연계 | 홀드아웃 현장의 추가 데이터 비용, 실물 성능, 장애·위험 평가가 함께 개선 |
| 2031–2032 | 장기 운용과 검증된 업데이트, 산업체 확산 | 독립 현장 재현, 안전 회귀 방지, 성공 임무당 총비용과 유지보수 개선 |
평가 설계 제안. 안전 완료율 = 목표를 달성하고 정의된 안전 위반이 없는 에피소드 / 전체 에피소드. Sim-to-real 성능 격차는 동일한 임무 정의에서 시뮬레이션과 실물 성공률 차이를 퍼센트포인트로 보고한다. 접촉 힘, 물체군, 표본 수, 신뢰구간을 함께 적는다. 단일 “전이 정확도”는 상태 오차와 임무 성공을 혼동하기 쉽다.
지연은 모델 추론, 센서 전처리, 통신, 안전 필터, 명령 적용 시간을 분해한다. 고주파 안정화는 로컬 제어로 유지하고 고수준 계획과 VLA를 다른 시간척도로 운용한다. 숫자 목표는 작업 위험 분석과 장치 측정 뒤 정한다. 연구 논문의 특정 GPU 속도를 모든 엣지 플랫폼 목표로 일반화하지 않는다.
Build–Partner–Buy와 분기별 판단
Build: 공통 데이터·평가 규격, 기종 교체 인터페이스, 네트워크 장애 대응, 안전 증거 연결. Partner: 산업체의 장비·현장·공정 전문성을 결합한 실제 운용 검증. Buy 또는 license: 비교 가능한 외부 모델·장비·시뮬레이터를 도입하고 데이터 반환, 기술 교체, 재검증 비용을 계약 조건으로 검토한다. 특정 공급업체의 순위나 가치 점유율은 전제하지 않는다.
확대: 독립 현장 재현, 안전 유지, 적응 비용 감소, 운용 경제성이 함께 확인될 때 확대한다. 전환: 일반화 이득이 미약하면 공유 데이터·안전·운영 기반을 유지하면서 작업 특화 정책으로 전환한다. 중단: 치명적인 위험을 반복하거나 교정할 수 없는 데이터 권리·공급 의존·현장 비용 문제가 확인되면 해당 실증을 보류한다. 분기별 증거 검토에서 중요 안전 실패를 점수 합산으로 상쇄하지 않는다.
창의적 후속 과제. 작업·접촉·점유 정보를 갖는 시간 그래프와 연속 월드모델의 결합, 불확실성에 따른 선택적 추론, 실제 실패로 갱신하는 반례 저장소, 안전 증거를 동반한 기종 간 기술 교환을 연구한다. 효과는 통신·계산 예산을 고정한 비교실험과 외부 현장 재현으로 입증한다.
전체 의제의 연결과 근거 범위
| 검토 의제 | 본 글의 연결 | 근거 성격 |
|---|---|---|
| 정의·기술 성숙도·로드맵 | PART 01/04/11 | 논문 능력과 제안 일정을 구분 |
| VLA·데이터·기종 전이 | PART 03/08, P1/P2 | 공개 연구 |
| 월드모델·촉각·sim-to-real | PART 06/08, P3/P4 | 공개 연구와 검증 제안 |
| 엣지·협업·안전·사이버 운용 | PART 06/10, P5/P6 | 공개 연구와 별도 시스템 설계 제안 |
| 형태·제품·플랫폼·RaaS·시장 채택 | PART 01/09/10 | 사업 가설. 가격·보급률은 미확정 |
| 국내 전략·Build–Partner–Buy·공급망 | PART 05/11 | 연구기획 제안. 정책 확정으로 표현하지 않음 |
| 반례·중단 조건·신뢰도 | PART 08/10/11 | 실험별 한계, 단계 심사 |
| 부록의 물리 에이전트 범위·투자·TCO·기술 레이더 | PART 01/06/09/11 | 개념 의제를 연결. 제한된 원본 그림과 투자 수치 미재현 |
최초 자료의 정책·시장 의제를 놓치지 않되 공개된 연구 성능으로 시장 예측을 정당화하지 않는다. 기술 예측, 한국 적용, 포트폴리오 일정은 본문에 제안 또는 해석으로 표시했다. 최신 연구의 등장과 독립 재현에 따라 판단을 갱신한다.
대표 1차 문헌 15편
2025-01-01–2026-10-07 KST 공개 자료. 날짜는 최초 arXiv 제출일이며 DreamDojo는 확인한 학회 출판연도. 초록·출판 메타데이터와 공개 연구 설명을 중심으로 검토했으며 모든 논문의 원 실험을 재현한 결과가 아니다. 세부 수치의 전체 표본·통계 검증은 후속 재현 과제다.
- FAST: Efficient Action Tokenization for Vision-Language-Action Models2025-01-16 · 행동 표현과 학습 효율 · arXivhttps://arxiv.org/abs/2501.09747
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots2025-03-18 · 이중 시스템 VLA와 이종 데이터 · 기술보고서https://arxiv.org/abs/2503.14734
- Gemini Robotics: Bringing AI into the Physical World2025-03-25 · 공간 추론, 조작, 새로운 신체 적응 · 기술보고서https://arxiv.org/abs/2503.20020
- π₀.₅: a Vision-Language-Action Model with Open-World Generalization2025-04-22 · 새로운 가정으로의 전이 · CoRL 2025 Oral 확인https://arxiv.org/abs/2504.16054
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics2025-06-02 · 경량 VLA와 비동기 실행 · arXivhttps://arxiv.org/abs/2506.01844
- Real-Time Execution of Action Chunking Flow Policies2025-06-09 · 실행 지연을 견디는 RTC · NeurIPS 2025 확인https://arxiv.org/abs/2506.07339
- Large Language Models for Multi-Robot Systems: A Survey2025-02-06 · 역할 배분·협업·벤치마크 · 조사논문, 2026-05-03 개정https://arxiv.org/abs/2502.03814
- Towards Safe Robot Foundation Models2025-03-10 · ATACOM 안전 계층 · arXivhttps://arxiv.org/abs/2503.07404
- SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning2025-03-05 · 제약 학습과 위험 유도 평가 · NeurIPS 2025 Spotlight 확인https://arxiv.org/abs/2503.03480
- DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos2026 · 행동 조건부 월드모델 · ICML 2026 / PMLRhttps://proceedings.mlr.press/v306/gao26q.html
- PTLD: Sim-to-real Privileged Tactile Latent Distillation for Dexterous Manipulation2026-03-04 · 실측 촉각을 통한 상태 추정 증류 · arXivhttps://arxiv.org/abs/2603.04531
- SafeVLA-Bench: A Benchmark for the Success-Safety Gap in Vision-Language-Action Models2026-05-30 · 궤적 안전과 성공의 분리 · arXivhttps://arxiv.org/abs/2606.00773
- World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis2026-06-04 · 언어 하위목표·미래·행동 통합 · arXivhttps://arxiv.org/abs/2606.05979
- RoboWorld: Fast and Reliable Neural Simulators for Generalist Robot Policy Evaluation2026-07-01 · 신경 시뮬레이터의 정책 평가 · arXivhttps://arxiv.org/abs/2607.01060
- Think Like a World Model, Act Like a VLA: Distilling World-Model Representations into Compact Robot Policies2026-09-21 · 월드모델 표현을 소형 정책으로 증류 · arXiv, 2026-09-22 개정https://arxiv.org/abs/2609.24682