SUNGSOO'S AI BLOGPHYSICAL AI · 2026.09.28
ROBOT MASTER / VISION · TOUCH · TOOLS · AUTONOMY

손끝에서 배우는
제조의 지능

Robot Master: Tactile Intelligence for Generalist Precision Manufacturing

작업지시를 이해하는 언어 모델과 접촉을 읽는 손끝, 실패 뒤 다시 시도하는 계획을 하나의 제조 폐루프로 묶는다. “로봇 명장”이라는 목표 아래 2025–2026년의 촉각·VLA·월드모델 연구를 읽는다.

BRIEFING UPDATE & PUBLICATION DATE · 2026-09-28

로봇 명장의 작업지시 이해, 감각, 접촉 예측, 숙련 실행 폐루프왼쪽의 작업지시와 계획에서 중앙의 시각, 촉각, 힘 감각과 접촉 예측을 거쳐 오른쪽의 다지손과 도구 조작으로 이어진다. 아래의 실패 진단과 복구가 다시 계획을 갱신한다.MANUFACTURING PHYSICAL AI / CLOSED LOOPINSTRUCTIONCONTACT STATEEXECUTION작업지시 · 계획시각 + 촉각 + 힘접촉상태 예측다지손 · 공구정밀 조작LANGUAGE → TASK GRAPHWORLD MODEL + FAST REFLEXSKILL EXECUTIONFAILURE DETECTION · RECOVERY · LEARNING
언어 계획, 접촉 상태, 공구 조작, 복구의 통합 연구 구상. 특정 논문에서 이미 완성한 시스템을 뜻하지 않는다.
EDITORIAL ABSTRACT

로봇 명장은 확립된 단일 학술 분야명이 아니라 제조 정밀조작의 통합 목표다. 자료의 정의·문제·핵심 개념·10개 연구질문·7개 방법층·6개 적용사례·8개 미해결 문제·7개 미래 방향과 논문 지도를 모두 담았다. 근거가 있는 논문 결과와 연구부서의 목표 수치를 구분해 제시한다.

이해INSTRUCTION · TASK GRAPH
감각VISION · TOUCH · FORCE
예측CONTACT WORLD MODEL
복구SKILL · REFLEX · LEARNING
글 목차 · 7개 Part
  1. 연구 목표와 정의
  2. 제조 문제와 핵심 개념
  3. 정밀조작이 어려운 이유
  4. 질문에서 시스템 아키텍처로
  5. 제조 적용과 남은 문제
  6. 다음 연구 방향
  7. 2025–2026 논문 지도와 종합
PART 01 / TARGET · DEFINITION

연구 목표와 정의

읽는 법 · “로봇 명장”은 이 자료의 통합 목표 개념이다. 2030·2032년 단계, 0.5·0.1 mm, 8시간, 공구 5종은 연구부서의 목표이며 검증된 현장 성능이 아니다. 논문별 결과는 해당 실험 조건에 한정한다.

앞선 연구부서 자료에서 말하는 “로봇 명장(Robot Master)”은 학계에서 이미 정착된 표준 학술용어라기보다, 최근의 정밀조작·촉각지능·VLA·도구사용·장기작업·인간 숙련전이 연구를 하나의 제조 Physical AI 목표형상으로 통합한 개념으로 보는 것이 가장 정확합니다.

연구부서 안에서는 2030년의 “손끝 감각에 능숙한 로봇 기능공”에서 2032년의 “도구사용이 능숙한 로봇 명장”으로 발전시키고, 작업지시서만으로 미경험 공정을 수행하고 다지 핸드로 정밀공구를 사용하며 제조현장에서 장시간 무개입으로 일하는 것을 목표로 제시하고 있습니다. 〔첨부 연구부서 목표·편집 해석〕 또한 1단계는 시·촉각 협응 기반 0.5 mm급 정밀조작, 2단계는 미경험 다수공정과 0.1 mm급 정밀조작 및 도구활용으로 고도화하는 구상입니다. 〔첨부 연구부서 목표·편집 해석〕

이를 2025년 이후 연구 흐름과 연결하면, 로봇 명장 = “언어로 작업을 이해하고, 눈과 손끝으로 접촉을 예측·보정하며, 다양한 도구를 쓰고, 긴 작업을 스스로 계획·복구하면서 새로운 제조공정에 빠르게 적응하는 범용 정밀조작 Physical AI”라고 정의하는 것이 가장 설득력 있습니다.


1. Definition

학술적으로 재정의하면 다음과 같습니다.

Robot Master는 작업지시서나 자연어 목표를 이해하고, 시각·촉각·힘·고유감각을 융합하여 접촉상태를 추론하며, 다지/양손 조작과 도구사용을 통해 sub-mm급 정밀작업을 수행하고, 미경험 공정에서도 계획·실행·오류복구·학습을 폐루프로 수행하는 범용 제조 정밀조작 지능체이다.

이 정의에는 최근 연구의 네 흐름이 결합됩니다.

첫째는 tactile dexterity입니다. 2025년 T3는 서로 다른 촉각센서와 작업 사이의 표현을 공유하도록 학습해 sub-mm 다중 핀 삽입에서 촉각 사전학습의 효과를 보였고, SaTA는 촉각 특징을 손의 운동학 좌표계에 정렬하여 USB-C 체결처럼 sub-mm 정렬이 필요한 작업을 다뤘습니다. 〔원문 T3 · SaTA〕

둘째는 generalist VLA입니다. DexVLA는 단일팔·양손·다지손 등 서로 다른 embodiment에서 언어지시 기반 장기작업을 수행하도록 diffusion action expert와 VLA를 결합했습니다. 〔원문 DexVLA〕

셋째는 human skill transfer입니다. DexUMI와 MimicTouch는 인간의 손동작·촉각시범을 로봇 정책학습으로 이전하는 방향을 보여줍니다. 〔원문 DexUMI · MimicTouch〕

넷째는 predictive + reactive tactile intelligence입니다. 2026년 TouchWorld, VT-WAM, ContactWorld는 촉각을 단순 입력센서가 아니라 미래 접촉을 예측하고 미끄럼·힘·오정렬에 즉시 대응하는 world/action model의 구성요소로 발전시키고 있습니다. 〔원문 TouchWorld · VT-WAM · ContactWorld〕


PART 02 / PROBLEM · CONCEPTS

제조 문제와 핵심 개념

2. Problem Definition

로봇 명장의 핵심 문제는 단순한 “정확한 로봇팔 제어”가 아닙니다.

실제 제조현장에서는 작업지시서만 주어지고,

  • 부품 위치와 공차가 매번 조금씩 다르고,
  • 손이나 공구가 시야를 가리며,
  • 접촉력·마찰·미끄럼은 영상으로는 보이지 않고,
  • 여러 공정을 긴 순서로 수행해야 하며,
  • 실패하면 스스로 알아차리고 복구해야 합니다.

이를 형식적으로 표현하면 정책은

\[ \pi: (I,\;V_{\le t},\;T_{\le t},\;F_{\le t},\;P_{\le t},\;E,\;M_t) \rightarrow a_t \]

를 학습해야 합니다.

여기서 \(I\)는 작업지시, \(V\)는 시각, \(T\)는 촉각, \(F\)는 힘/토크, \(P\)는 로봇 상태, \(E\)는 로봇·손·공구 embodiment, \(M_t\)는 현재 작업·접촉 상태입니다.

목표는 단순 성공률 최대화가 아니라 동시에

정밀도 + 접촉 안정성 + 도구 일반화 + 미경험 작업 일반화 + 장기 임무 성공 + 실패복구 + 안전성

을 만족하는 것입니다.

2025년 ARCH가 지적하듯 고정밀 조립에서는 end-to-end imitation learning은 대규모 시범데이터를 필요로 하고 정밀도에서 약점을 보이며, RL은 고정밀 제어에는 강하지만 장기작업에서 데이터 효율 문제가 큽니다. 그래서 ARCH는 상위정책과 하위 정밀 skill을 분리한 계층형 접근을 제안합니다. 〔원문 ARCH〕


3. Core Concepts

핵심개념 로봇 명장에서의 의미 최근 연구 방향
시·촉각 협응 눈으로 접근하고 손끝으로 최종 정렬·체결 3D-ViTac, ViTacFormer, SaTA
접촉풍부 조작 삽입·체결·나사조임처럼 접촉상태가 성패를 결정 T3, MimicTouch, ContactWorld
촉각 기반 반사제어 미끄럼·과도한 힘·오정렬을 ms 수준에서 보정 T-Rex, TouchWorld
촉각 월드모델 행동 후 힘·접촉·변형이 어떻게 변할지 예측 VT-WAM, TouchWorld, ViTacWorld
VLA 작업지시서를 시각과 행동으로 연결 DexVLA, OmniVTLA
다지·양손 조작 공구 파지·회전·고정·조립을 사람처럼 수행 3D-ViTac, DexUMI, SaTA
도구사용 screwdriver·wrench·plier 등을 별도 전용기구 없이 활용 NOD-TAMP, articulated-tool manipulation
장기작업 계획 여러 공정·Skill을 순차적으로 수행 ARCH, SPIN, RoboHorizon
숙련전이 사람의 손기술을 데이터로 변환 DexUMI, MimicTouch, UniTacHand
Cross-embodiment 다른 손·센서·로봇에도 Skill 재사용 DexVLA, FTP-1
실패탐지·복구 slip·jam·misalignment를 감지하고 재시도 TouchWorld, world-model 계열
지속학습 현장 수행결과를 다시 정책 개선에 사용 tactile foundation / world-model 방향

특히 2026년 FTP-1은 약 3,000시간의 이질적 tactile data와 21종 센서를 바탕으로 촉각정책 자체를 foundation policy로 만들려는 단계까지 나아갔습니다. 〔원문 FTP-1〕


PART 03 / CONTEXT · CHALLENGES

정밀조작이 어려운 이유

4. Introduction

2025년 이후 로봇조작 연구는 크게 바뀌고 있습니다.

이전에는

Vision → Grasp → Move

가 중심이었다면, 최근에는

Language → Plan → Vision → Contact Prediction → Touch/Force → Fine Control → Recovery → Learning

으로 이동하고 있습니다.

특히 제조 정밀작업에서는 마지막 몇 mm가 가장 어렵습니다. 카메라는 물체의 큰 위치와 형상은 잘 보지만, 삽입 직전의 정렬오차, 접촉면의 압력, 마찰, 나사산 맞물림, 케이블 장력, slip은 영상만으로 충분히 알기 어렵습니다.

3D-ViTac은 시각과 촉각을 동일한 3차원 표현공간에 결합하여 양손 정밀작업에서 vision-only 정책보다 우수한 결과를 보였고, ViTacFormer는 tactile future prediction과 cross-modal representation을 이용해 최대 11단계의 장기 dexterous manipulation을 수행했습니다. 〔원문 3D-ViTac · ViTacFormer〕

따라서 로봇 명장은 “더 좋은 robot hand”가 아니라 “Task Intelligence + Tactile Intelligence + Tool Intelligence + Long-Horizon Autonomy”의 통합문제입니다.


5. Motivation and Background

5.1 숙련 제조인력의 지식은 대부분 암묵적이다

숙련자는 작업지시서에 없는 미세한 기술을 사용합니다.

예를 들어 커넥터 삽입에서도

“살짝 비틀면서 들어가는 감각”,
“나사산이 맞는 순간의 힘 변화”,
“공구가 미끄러질 직전의 촉감”

을 이용합니다.

이 지식은 언어만으로 완전히 기술하기 어렵기 때문에 촉각·힘·동작 trajectory를 함께 학습해야 합니다.

MimicTouch와 DexUMI가 인간 손 기반 demonstration을 활용하는 이유가 여기에 있습니다. 〔원문 MimicTouch · DexUMI〕

5.2 기존 VLA는 ’무엇을 할지’는 강하지만 ’어떻게 접촉할지’는 아직 약하다

VLA는 language instruction에서 행동을 생성하는 능력을 빠르게 확장하고 있지만, tactile modality가 충분히 포함되지 않은 경우 contact-rich 작업에서 약해집니다.

OmniVTLA는 이 문제를 직접 지적하고 tactile encoder를 VLA에 통합했으며, gripper와 dexterous hand에서 성능개선을 보고했습니다. 〔원문 OmniVTLA〕

5.3 제조에서는 평균성능보다 반복가능성과 회복력이 중요하다

데모에서 90% 성공하는 것과 8시간 동안 연속 제조공정을 수행하는 것은 전혀 다른 문제입니다.

내부 Robot Master 목표도 단일 시연이 아니라 장시간 무개입 제조 유용성까지 포함합니다. 〔첨부 연구부서 목표·편집 해석〕

따라서 학술연구에서 산업시스템으로 넘어가기 위해서는

Precision × Reliability × Recovery × Duration

이 동시에 중요합니다.


6. Challenges

6.1 촉각센서 이질성

GelSight형 영상촉각, 힘센서, 압력 array, 전자피부 등은 데이터 형식이 매우 다릅니다.

T3와 FTP-1의 핵심 문제도 바로 sensor-specific tactile intelligence를 어떻게 transferable tactile intelligence로 바꿀 것인가입니다. 〔원문 T3 · FTP-1〕

6.2 Sub-mm 정밀도와 일반화의 충돌

고전적인 model-based control은 특정 공정에서 매우 정밀할 수 있지만 일반화가 어렵고, learning policy는 일반화 가능성이 크지만 sub-mm 수준 geometry에는 약할 수 있습니다.

SaTA는 이 문제를 tactile representation을 robot hand의 kinematic frame에 명시적으로 anchoring하는 방식으로 접근했습니다. 〔원문 SaTA〕

6.3 접촉은 부분관측이다

카메라가 보지 못하는 내부 접촉에서

  • slip
  • stiction
  • backlash
  • friction
  • misalignment

이 발생합니다.

관절형 공구인 scissors, pliers, stapler를 다룰 때에는 시야 밖 접촉과 공구 관절 상태를 추정해야 하며, 실제 힘·촉각 피드백에 따른 보정이 중요합니다. 〔원문 NOD-TAMP〕

6.4 장기작업의 누적오차

10단계 작업에서 각 단계가 95% 성공하더라도 전체 성공률은 단순 계산으로 약 60%까지 내려갑니다.

그래서 ARCH·SPIN·RoboHorizon 계열은 전체 행동을 한 번에 예측하기보다 skill hierarchy, subgoal, world model, replanning을 활용합니다. 〔원문 ARCH〕

6.5 Embodiment gap

사람 손, 5지 robot hand, 3지 hand, gripper는 운동학도 다르고 촉각센서 위치도 다릅니다.

DexUMI는 wearable exoskeleton과 영상변환으로 human-to-robot gap을 줄이고, FTP-1은 morphology-aware tactile latent space로 sensor/embodiment gap을 줄입니다. 〔원문 DexUMI · FTP-1〕

6.6 실패의 의미를 알아야 한다

“실패했다”보다

misalignment인가?
slip인가?
torque 부족인가?
잘못된 tool인가?
앞 단계가 틀렸는가?

를 구분해야 복구가 가능합니다.

이 때문에 단순 reactive policy에서 contact/world model + failure diagnosis + recovery policy로 연구가 이동하고 있습니다. 〔원문 ContactWorld〕


PART 04 / RESEARCH QUESTIONS · METHODS

질문에서 시스템 아키텍처로

7. Research Questions

로봇 명장을 논문 수준의 연구주제로 발전시킨다면 다음 RQ들이 핵심적입니다.

RQ1. 서로 다른 촉각센서와 robot hand에서 재사용 가능한 공통 tactile representation을 만들 수 있는가?

RQ2. vision·touch·force·proprioception을 어떤 좌표계와 시간축에서 결합해야 sub-mm precision이 가능한가?

RQ3. 자연어 작업지시를 Skill sequence + contact goal + force/precision constraint로 자동 변환할 수 있는가?

RQ4. 미경험 공정에서도 기존 skill을 조합하여 zero/few-shot manufacturing manipulation을 수행할 수 있는가?

RQ5. 공구의 형상·관절·마찰 특성이 달라도 하나의 policy가 screwdriver, wrench, plier 등의 사용법을 일반화할 수 있는가?

RQ6. slow VLA reasoning과 fast tactile reflex를 어떻게 분리·통합해야 하는가?

RQ7. 장기작업에서 실패확률의 누적을 줄이기 위해 world model, replanning, skill library를 어떻게 결합해야 하는가?

RQ8. 인간 숙련자의 tactile demonstration을 어떤 방식으로 robot embodiment로 이전하는 것이 가장 data-efficient한가?

RQ9. sim-to-real에서 contact dynamics의 차이를 얼마나 줄일 수 있으며, 무엇을 real data로 반드시 보정해야 하는가?

RQ10. 평균 성공률이 아니라 8시간 연속운전·복구시간·공정간 전환비용을 어떻게 benchmark할 것인가?


8. Approaches (Methods)

제가 보기에는 Robot Master를 하나의 end-to-end giant policy로 설계하기보다 계층형 구조로 가는 것이 최근 연구 흐름과 가장 잘 맞습니다.

A. 작업 이해층 — Instruction → Task Graph

작업지시서를 입력받아

목표 → 공정 → Subtask → Skill → Tool → 제약조건

으로 분해합니다.

DexVLA나 IALP 같은 연구는 language instruction을 행동·계획과 연결하는 기반을 제공합니다. 〔원문 DexVLA〕


B. 시·촉각 공동인지층

입력:

RGB/RGB-D + point cloud + tactile + F/T + proprioception

출력:

object/contact geometry + slip + force distribution + confidence

3D-ViTac, SaTA, ViTacFormer가 이 축에 해당합니다. 〔원문 3D-ViTac · SaTA · ViTacFormer〕


C. 촉각 Foundation Encoder/Policy

여러 sensor를 각각 별도 학습하기보다

Sensor-specific Encoder
→ Shared Tactile Latent Space
→ Manipulation Policy

로 구성합니다.

T3와 FTP-1이 대표적인 방향입니다. 〔원문 T3 · FTP-1〕


D. Contact World Model

현재 접촉상태와 행동으로부터

\[ (s_t,a_t)\rightarrow(\hat{s}_{t+1},\hat{T}_{t+1}) \]

을 예측합니다.

즉 “이만큼 밀면 다음 순간 접촉이 어떻게 바뀔 것인가?”를 학습합니다.

VT-WAM, TouchWorld, ContactWorld, ViTacWorld가 이 흐름을 빠르게 확장하고 있습니다. 〔원문 VT-WAM · TouchWorld · ContactWorld〕


E. 고주파 촉각 반사층

설계 예시로 VLA가 5–20 Hz 수준의 상위 행동을 결정한다면, tactile reflex는 훨씬 빠르게

slip → grip correction
misalignment → micro-motion
force spike → retract

를 수행하도록 분리하는 것이 합리적입니다.

T-Rex와 TouchWorld가 이러한 fast tactile feedback loop 방향을 보여줍니다. 〔원문 T-Rex · TouchWorld〕


F. Skill Library + Hierarchical Planner

정밀 제조는

grasp → align → insert → rotate → tighten → inspect

같은 skill composition 문제입니다.

ARCH는 model-based/RL low-level primitive와 high-level imitation policy를 결합하고, SPIN은 독립 Skill을 connector와 planner로 연결합니다. 〔원문 ARCH〕


G. Human-to-Robot Skill Transfer

숙련자의 손동작과 tactile profile을 수집한 뒤

Human Demonstration
→ Embodiment Alignment
→ Robot Skill
→ Residual Adaptation

으로 전이합니다.

DexUMI, MimicTouch, UniTacHand가 이 구조와 직접 연결됩니다. 〔원문 DexUMI · MimicTouch · UniTacHand〕


PART 05 / APPLICATIONS · OPEN PROBLEMS

제조 적용과 남은 문제

9. Key Applications

Robot Master와 가장 잘 맞는 적용영역은 “고정밀·다품종·숙련의존·접촉풍부 제조”입니다.

① 커넥터·하네스 삽입

시야가 가려지고 힘·정렬정보가 중요합니다. 내부안에서도 배선 하네스와 커넥터 삽입을 대표 실증으로 제시합니다. 〔첨부 연구부서 목표·편집 해석〕

② 전자부품·정밀 조립

T3가 다룬 sub-mm multi-pin insertion과 직접 연결됩니다. 〔원문 T3〕

③ 나사·볼트·체결

screwdriver/wrench 사용에는 힘·회전·접촉상태를 동시에 다뤄야 합니다.

④ 공구사용

plier, scissors, stapler 같은 articulated tool은 고정된 gripper 작업보다 훨씬 높은 tactile intelligence를 요구합니다. 〔원문 NOD-TAMP〕

⑤ 양손 조립

한 손은 고정하고 다른 손은 체결하거나 두 손이 서로 다른 힘을 가하는 작업입니다.

⑥ 혼류생산

제품이 바뀔 때마다 전용 치구·전용 end-effector를 새로 만들지 않고 작업지시와 tool만 바꾸는 방향입니다. 연구부서 안도 “치구 제거 정밀조작, Zero-shot 작업, 정밀공구 5종, 혼류공정 동시수행”을 최종상으로 제시합니다. 〔첨부 연구부서 목표·편집 해석〕


10. Open Problems

1. 진정한 zero-shot 정밀조작은 아직 멀다

언어적으로 새로운 작업을 이해하는 것과 0.1 mm급으로 처음 보는 부품을 체결하는 것은 난이도가 전혀 다릅니다.

2. tactile foundation model의 규모법칙이 아직 불명확하다

Vision/LLM처럼 “data와 model을 키우면 얼마만큼 좋아지는가”가 촉각에서는 아직 확립되지 않았습니다.

3. Sensor 표준화 부재

촉각센서마다 해상도·형태·신호물리가 달라 foundation tactile model을 만들기 어렵습니다. FTP-1은 이를 정면으로 다루지만 아직 초기 단계입니다. 〔원문 FTP-1〕

4. Tool generalization

새로운 tool의 geometry와 dynamics를 몇 번의 demonstration만으로 학습하는 문제는 여전히 개방적입니다.

5. 장시간 안정성

대부분 논문은 수분 단위 실험입니다. 8시간 continuous production과 같은 산업 KPI를 다루는 공개 benchmark는 매우 부족합니다.

6. Failure recovery benchmark 부족

성공률은 많이 보고하지만 “실패 후 스스로 복구했는가?”를 정량화하는 benchmark는 상대적으로 부족합니다.

7. 촉각 World Model의 실제 장기예측

ContactWorld도 장기계획에서 representation choice가 중요하다고 보여주며, tactile 정보를 단순 추가한다고 자동으로 성능이 오르지 않는다는 점을 보여줍니다. 〔원문 ContactWorld〕

8. 안전한 online learning

현장 배포 후 스스로 숙련되는 것은 필요하지만 제조라인에서 uncontrolled exploration은 허용하기 어렵습니다.


PART 06 / FUTURE DIRECTIONS

다음 연구 방향

11. Future Directions

방향 1 — Vision-Language-Action에서 Vision-Tactile-Language-Action으로

앞으로의 정밀제조 foundation policy는

\[ Vision + Language + Tactile + Force + Action \]

구조가 자연스럽습니다.

OmniVTLA는 이미 이 방향을 제시했고, 2026년 tactile foundation policy가 이어지고 있습니다. 〔원문 OmniVTLA · FTP-1〕


방향 2 — Reactive Touch에서 Predictive Tactile Intelligence로

단순히 “닿았다”를 감지하는 것이 아니라

“0.2초 뒤에 slip이 발생할 가능성이 높다” (예시 예측 지평)

를 예측하는 tactile world model이 핵심이 될 가능성이 큽니다.

TouchWorld와 VT-WAM이 대표적입니다. 〔원문 TouchWorld · VT-WAM〕


방향 3 — 하나의 촉각센서가 아니라 Universal Tactile Representation

T3 → FTP-1 흐름은 sensor-specific policy에서 sensor-general tactile foundation policy로 이동하고 있음을 보여줍니다. 〔원문 T3 · FTP-1〕

Robot Master가 실제 산업플랫폼이 되려면 이 방향이 매우 중요합니다.


방향 4 — 인간 숙련데이터를 대규모 robot training data로 변환

Robot data만 모으는 것은 비용이 큽니다.

DexUMI, UniTacHand, DexTouch-WM이 제시하는 방향은

100시간의 인간 숙련 데이터 → robot tactile/world model → robot policy

와 같은 새로운 data scaling 경로입니다. DexTouch-WM의 인간 시연 데이터를 0–100시간까지 늘린 실험은 이 방향의 개별 사례이며, 위 화살표 전체가 이미 상용 공정으로 검증됐다는 뜻은 아닙니다. 〔원문 DexUMI · DexTouch-WM〕


방향 5 — “하나의 giant policy”보다 Slow Brain + Fast Reflex

로봇 명장에는 서로 다른 시간척도의 지능이 필요합니다.

Slow Brain > 작업지시 이해 → 계획 → tool 선택 → subtask 결정

Fast Reflex > 접촉력 → slip → micro-correction → safety stop

TouchWorld가 이 계층형 구조를 명시적으로 보여줍니다. 〔원문 TouchWorld〕


방향 6 — Skill 단위 제조지능

장기적으로는 특정 공정 policy를 하나씩 만드는 방식보다

Insert
Tighten
Route Cable
Align
Polish
Cut
Inspect

같은 Composable Manufacturing Skill Library가 필요합니다.

Nature Machine Intelligence의 2025 tactile skill taxonomy도 industrial process를 formal specification과 재사용 가능한 tactile skill로 연결하는 방향을 제시합니다. 〔원문 Process-centric tactile skill taxonomy〕


방향 7 — 성공률에서 숙련도(Skill Maturity) 평가로

Robot Master는 단순 success rate보다 다음 평가가 더 적절합니다.

정밀도 — positional/force error
숙련도 — tool change 없이 다양한 공정 수행
일반화 — unseen part/process/tool
회복력 — failure detection/recovery
지속성 — uninterrupted operation time
교시비용 — demonstrations/task
재사용성 — skill transfer across robots
안전성 — damage/contact-force violation

즉 연구평가의 단위도 “Task Success”에서 “Manufacturing Mastery”로 올라갈 필요가 있습니다.


PART 07 / RESEARCH MAP · SYNTHESIS

2025–2026 논문 지도와 종합

12. 2025–2026 핵심 논문과 Robot Master와의 연결 (MimicTouch는 2023년 선행연구)

논문 연도 Robot Master에서 중요한 이유
Transferable Tactile Transformers (T3) 2025 다중센서 tactile transfer, sub-mm insertion
3D-ViTac 2025 3D vision+tactile, 양손 정밀조작
MimicTouch 2023 인간 tactile demonstration → robot policy
DexUMI 2025 인간 손 숙련의 cross-hand transfer
DexVLA 2025 언어지시·cross-embodiment·장기작업
ViTacFormer 2025 future tactile prediction, 장기 dexterous manipulation
SaTA 2025 sub-mm tactile geometric reasoning
ARCH 2025 장기·고정밀 assembly의 계층형 skill architecture
DexSkin 2025 그리퍼 손가락 표면을 폭넓게 덮는 tactile skin
FTP-1 2026 범용 tactile foundation policy
T-Rex 2026 high-frequency tactile-reactive manipulation
TouchWorld 2026 tactile prediction + fast reflex + VLA planning
VT-WAM 2026 tactile dynamics를 포함한 world-action model
ContactWorld 2026 contact-rich world model representation benchmark
DexTouch-WM 2026 인간 touch를 robot tactile world model에 활용

주요 원문은 다음에서 확인할 수 있습니다: T3 논문(PMLR), 3D-ViTac 논문, DexUMI 논문, DexVLA 논문, SaTA 논문, ARCH 논문, FTP-1 논문, TouchWorld 논문, VT-WAM 논문, ContactWorld 논문.


종합

현재의 연구 흐름을 한 문장으로 압축하면,

“로봇 명장”의 경쟁력은 더 정교한 손 자체보다, 작업지시 이해(VLA) → 3D 시·촉각 인지 → 접촉예측(world model) → 고주파 촉각반사 → 다지·양손·도구조작 → 장기 skill planning → 실패복구 → 인간 숙련의 지속학습을 하나의 제조 폐루프로 묶는 데서 나온다.

따라서 연구부서가 제시한 Robot Master를 전략연구사업 수준으로 다듬는다면, 단순 “0.1 mm 정밀로봇”으로 정의하기보다

“미경험 제조공정을 작업지시서만으로 이해하고, 사람의 손끝과 같은 시·촉각 물리지능으로 다양한 공구를 활용하며, 실패를 스스로 감지·복구하고 현장에서 지속적으로 숙련되는 범용 정밀조작 Physical AI”

로 정의하는 것이 현재 2025–2026 연구 프런티어와 가장 잘 맞습니다.

SOURCE READING

논문 원문

본문의 연구부서 목표는 첨부 자료에 귀속된다. 아래 목록은 본문에서 연결한 공개 연구의 원문이다. arXiv는 사전 공개본을 포함한다.

  1. T3연구 원문 · arXiv
  2. 3D-ViTac연구 원문 · arXiv
  3. MimicTouch연구 원문 · arXiv
  4. DexUMI연구 원문 · arXiv
  5. DexVLA연구 원문 · arXiv
  6. ViTacFormer연구 원문 · arXiv
  7. SaTA연구 원문 · arXiv
  8. ARCH연구 원문 · arXiv
  9. DexSkin연구 원문 · arXiv
  10. FTP-1연구 원문 · arXiv
  11. T-Rex연구 원문 · arXiv
  12. TouchWorld연구 원문 · arXiv
  13. VT-WAM연구 원문 · arXiv
  14. ContactWorld연구 원문 · arXiv
  15. DexTouch-WM연구 원문 · arXiv
  16. OmniVTLA연구 원문 · arXiv
  17. UniTacHand연구 원문 · arXiv
  18. NOD-TAMP연구 원문 · arXiv
  19. Process-centric tactile skill taxonomy연구 원문 · arXiv