손끝에서 배우는
제조의 지능
Robot Master: Tactile Intelligence for Generalist Precision Manufacturing
작업지시를 이해하는 언어 모델과 접촉을 읽는 손끝, 실패 뒤 다시 시도하는 계획을 하나의 제조 폐루프로 묶는다. “로봇 명장”이라는 목표 아래 2025–2026년의 촉각·VLA·월드모델 연구를 읽는다.
로봇 명장은 확립된 단일 학술 분야명이 아니라 제조 정밀조작의 통합 목표다. 자료의 정의·문제·핵심 개념·10개 연구질문·7개 방법층·6개 적용사례·8개 미해결 문제·7개 미래 방향과 논문 지도를 모두 담았다. 근거가 있는 논문 결과와 연구부서의 목표 수치를 구분해 제시한다.
글 목차 · 7개 Part
연구 목표와 정의
앞선 연구부서 자료에서 말하는 “로봇 명장(Robot Master)”은 학계에서 이미 정착된 표준 학술용어라기보다, 최근의 정밀조작·촉각지능·VLA·도구사용·장기작업·인간 숙련전이 연구를 하나의 제조 Physical AI 목표형상으로 통합한 개념으로 보는 것이 가장 정확합니다.
연구부서 안에서는 2030년의 “손끝 감각에 능숙한 로봇 기능공”에서 2032년의 “도구사용이 능숙한 로봇 명장”으로 발전시키고, 작업지시서만으로 미경험 공정을 수행하고 다지 핸드로 정밀공구를 사용하며 제조현장에서 장시간 무개입으로 일하는 것을 목표로 제시하고 있습니다. 〔첨부 연구부서 목표·편집 해석〕 또한 1단계는 시·촉각 협응 기반 0.5 mm급 정밀조작, 2단계는 미경험 다수공정과 0.1 mm급 정밀조작 및 도구활용으로 고도화하는 구상입니다. 〔첨부 연구부서 목표·편집 해석〕
이를 2025년 이후 연구 흐름과 연결하면, 로봇 명장 = “언어로 작업을 이해하고, 눈과 손끝으로 접촉을 예측·보정하며, 다양한 도구를 쓰고, 긴 작업을 스스로 계획·복구하면서 새로운 제조공정에 빠르게 적응하는 범용 정밀조작 Physical AI”라고 정의하는 것이 가장 설득력 있습니다.
1. Definition
학술적으로 재정의하면 다음과 같습니다.
Robot Master는 작업지시서나 자연어 목표를 이해하고, 시각·촉각·힘·고유감각을 융합하여 접촉상태를 추론하며, 다지/양손 조작과 도구사용을 통해 sub-mm급 정밀작업을 수행하고, 미경험 공정에서도 계획·실행·오류복구·학습을 폐루프로 수행하는 범용 제조 정밀조작 지능체이다.
이 정의에는 최근 연구의 네 흐름이 결합됩니다.
첫째는 tactile dexterity입니다. 2025년 T3는 서로 다른 촉각센서와 작업 사이의 표현을 공유하도록 학습해 sub-mm 다중 핀 삽입에서 촉각 사전학습의 효과를 보였고, SaTA는 촉각 특징을 손의 운동학 좌표계에 정렬하여 USB-C 체결처럼 sub-mm 정렬이 필요한 작업을 다뤘습니다. 〔원문 T3 · SaTA〕
둘째는 generalist VLA입니다. DexVLA는 단일팔·양손·다지손 등 서로 다른 embodiment에서 언어지시 기반 장기작업을 수행하도록 diffusion action expert와 VLA를 결합했습니다. 〔원문 DexVLA〕
셋째는 human skill transfer입니다. DexUMI와 MimicTouch는 인간의 손동작·촉각시범을 로봇 정책학습으로 이전하는 방향을 보여줍니다. 〔원문 DexUMI · MimicTouch〕
넷째는 predictive + reactive tactile intelligence입니다. 2026년 TouchWorld, VT-WAM, ContactWorld는 촉각을 단순 입력센서가 아니라 미래 접촉을 예측하고 미끄럼·힘·오정렬에 즉시 대응하는 world/action model의 구성요소로 발전시키고 있습니다. 〔원문 TouchWorld · VT-WAM · ContactWorld〕
제조 문제와 핵심 개념
2. Problem Definition
로봇 명장의 핵심 문제는 단순한 “정확한 로봇팔 제어”가 아닙니다.
실제 제조현장에서는 작업지시서만 주어지고,
- 부품 위치와 공차가 매번 조금씩 다르고,
- 손이나 공구가 시야를 가리며,
- 접촉력·마찰·미끄럼은 영상으로는 보이지 않고,
- 여러 공정을 긴 순서로 수행해야 하며,
- 실패하면 스스로 알아차리고 복구해야 합니다.
이를 형식적으로 표현하면 정책은
\[ \pi: (I,\;V_{\le t},\;T_{\le t},\;F_{\le t},\;P_{\le t},\;E,\;M_t) \rightarrow a_t \]
를 학습해야 합니다.
여기서 \(I\)는 작업지시, \(V\)는 시각, \(T\)는 촉각, \(F\)는 힘/토크, \(P\)는 로봇 상태, \(E\)는 로봇·손·공구 embodiment, \(M_t\)는 현재 작업·접촉 상태입니다.
목표는 단순 성공률 최대화가 아니라 동시에
정밀도 + 접촉 안정성 + 도구 일반화 + 미경험 작업 일반화 + 장기 임무 성공 + 실패복구 + 안전성
을 만족하는 것입니다.
2025년 ARCH가 지적하듯 고정밀 조립에서는 end-to-end imitation learning은 대규모 시범데이터를 필요로 하고 정밀도에서 약점을 보이며, RL은 고정밀 제어에는 강하지만 장기작업에서 데이터 효율 문제가 큽니다. 그래서 ARCH는 상위정책과 하위 정밀 skill을 분리한 계층형 접근을 제안합니다. 〔원문 ARCH〕
3. Core Concepts
| 핵심개념 | 로봇 명장에서의 의미 | 최근 연구 방향 |
|---|---|---|
| 시·촉각 협응 | 눈으로 접근하고 손끝으로 최종 정렬·체결 | 3D-ViTac, ViTacFormer, SaTA |
| 접촉풍부 조작 | 삽입·체결·나사조임처럼 접촉상태가 성패를 결정 | T3, MimicTouch, ContactWorld |
| 촉각 기반 반사제어 | 미끄럼·과도한 힘·오정렬을 ms 수준에서 보정 | T-Rex, TouchWorld |
| 촉각 월드모델 | 행동 후 힘·접촉·변형이 어떻게 변할지 예측 | VT-WAM, TouchWorld, ViTacWorld |
| VLA | 작업지시서를 시각과 행동으로 연결 | DexVLA, OmniVTLA |
| 다지·양손 조작 | 공구 파지·회전·고정·조립을 사람처럼 수행 | 3D-ViTac, DexUMI, SaTA |
| 도구사용 | screwdriver·wrench·plier 등을 별도 전용기구 없이 활용 | NOD-TAMP, articulated-tool manipulation |
| 장기작업 계획 | 여러 공정·Skill을 순차적으로 수행 | ARCH, SPIN, RoboHorizon |
| 숙련전이 | 사람의 손기술을 데이터로 변환 | DexUMI, MimicTouch, UniTacHand |
| Cross-embodiment | 다른 손·센서·로봇에도 Skill 재사용 | DexVLA, FTP-1 |
| 실패탐지·복구 | slip·jam·misalignment를 감지하고 재시도 | TouchWorld, world-model 계열 |
| 지속학습 | 현장 수행결과를 다시 정책 개선에 사용 | tactile foundation / world-model 방향 |
특히 2026년 FTP-1은 약 3,000시간의 이질적 tactile data와 21종 센서를 바탕으로 촉각정책 자체를 foundation policy로 만들려는 단계까지 나아갔습니다. 〔원문 FTP-1〕
정밀조작이 어려운 이유
4. Introduction
2025년 이후 로봇조작 연구는 크게 바뀌고 있습니다.
이전에는
Vision → Grasp → Move
가 중심이었다면, 최근에는
Language → Plan → Vision → Contact Prediction → Touch/Force → Fine Control → Recovery → Learning
으로 이동하고 있습니다.
특히 제조 정밀작업에서는 마지막 몇 mm가 가장 어렵습니다. 카메라는 물체의 큰 위치와 형상은 잘 보지만, 삽입 직전의 정렬오차, 접촉면의 압력, 마찰, 나사산 맞물림, 케이블 장력, slip은 영상만으로 충분히 알기 어렵습니다.
3D-ViTac은 시각과 촉각을 동일한 3차원 표현공간에 결합하여 양손 정밀작업에서 vision-only 정책보다 우수한 결과를 보였고, ViTacFormer는 tactile future prediction과 cross-modal representation을 이용해 최대 11단계의 장기 dexterous manipulation을 수행했습니다. 〔원문 3D-ViTac · ViTacFormer〕
따라서 로봇 명장은 “더 좋은 robot hand”가 아니라 “Task Intelligence + Tactile Intelligence + Tool Intelligence + Long-Horizon Autonomy”의 통합문제입니다.
5. Motivation and Background
5.1 숙련 제조인력의 지식은 대부분 암묵적이다
숙련자는 작업지시서에 없는 미세한 기술을 사용합니다.
예를 들어 커넥터 삽입에서도
“살짝 비틀면서 들어가는 감각”,
“나사산이 맞는 순간의 힘 변화”,
“공구가 미끄러질 직전의 촉감”
을 이용합니다.
이 지식은 언어만으로 완전히 기술하기 어렵기 때문에 촉각·힘·동작 trajectory를 함께 학습해야 합니다.
MimicTouch와 DexUMI가 인간 손 기반 demonstration을 활용하는 이유가 여기에 있습니다. 〔원문 MimicTouch · DexUMI〕
5.2 기존 VLA는 ’무엇을 할지’는 강하지만 ’어떻게 접촉할지’는 아직 약하다
VLA는 language instruction에서 행동을 생성하는 능력을 빠르게 확장하고 있지만, tactile modality가 충분히 포함되지 않은 경우 contact-rich 작업에서 약해집니다.
OmniVTLA는 이 문제를 직접 지적하고 tactile encoder를 VLA에 통합했으며, gripper와 dexterous hand에서 성능개선을 보고했습니다. 〔원문 OmniVTLA〕
5.3 제조에서는 평균성능보다 반복가능성과 회복력이 중요하다
데모에서 90% 성공하는 것과 8시간 동안 연속 제조공정을 수행하는 것은 전혀 다른 문제입니다.
내부 Robot Master 목표도 단일 시연이 아니라 장시간 무개입 제조 유용성까지 포함합니다. 〔첨부 연구부서 목표·편집 해석〕
따라서 학술연구에서 산업시스템으로 넘어가기 위해서는
Precision × Reliability × Recovery × Duration
이 동시에 중요합니다.
6. Challenges
6.1 촉각센서 이질성
GelSight형 영상촉각, 힘센서, 압력 array, 전자피부 등은 데이터 형식이 매우 다릅니다.
T3와 FTP-1의 핵심 문제도 바로 sensor-specific tactile intelligence를 어떻게 transferable tactile intelligence로 바꿀 것인가입니다. 〔원문 T3 · FTP-1〕
6.2 Sub-mm 정밀도와 일반화의 충돌
고전적인 model-based control은 특정 공정에서 매우 정밀할 수 있지만 일반화가 어렵고, learning policy는 일반화 가능성이 크지만 sub-mm 수준 geometry에는 약할 수 있습니다.
SaTA는 이 문제를 tactile representation을 robot hand의 kinematic frame에 명시적으로 anchoring하는 방식으로 접근했습니다. 〔원문 SaTA〕
6.3 접촉은 부분관측이다
카메라가 보지 못하는 내부 접촉에서
- slip
- stiction
- backlash
- friction
- misalignment
이 발생합니다.
관절형 공구인 scissors, pliers, stapler를 다룰 때에는 시야 밖 접촉과 공구 관절 상태를 추정해야 하며, 실제 힘·촉각 피드백에 따른 보정이 중요합니다. 〔원문 NOD-TAMP〕
6.4 장기작업의 누적오차
10단계 작업에서 각 단계가 95% 성공하더라도 전체 성공률은 단순 계산으로 약 60%까지 내려갑니다.
그래서 ARCH·SPIN·RoboHorizon 계열은 전체 행동을 한 번에 예측하기보다 skill hierarchy, subgoal, world model, replanning을 활용합니다. 〔원문 ARCH〕
6.5 Embodiment gap
사람 손, 5지 robot hand, 3지 hand, gripper는 운동학도 다르고 촉각센서 위치도 다릅니다.
DexUMI는 wearable exoskeleton과 영상변환으로 human-to-robot gap을 줄이고, FTP-1은 morphology-aware tactile latent space로 sensor/embodiment gap을 줄입니다. 〔원문 DexUMI · FTP-1〕
6.6 실패의 의미를 알아야 한다
“실패했다”보다
misalignment인가?
slip인가?
torque 부족인가?
잘못된 tool인가?
앞 단계가 틀렸는가?
를 구분해야 복구가 가능합니다.
이 때문에 단순 reactive policy에서 contact/world model + failure diagnosis + recovery policy로 연구가 이동하고 있습니다. 〔원문 ContactWorld〕
질문에서 시스템 아키텍처로
7. Research Questions
로봇 명장을 논문 수준의 연구주제로 발전시킨다면 다음 RQ들이 핵심적입니다.
RQ1. 서로 다른 촉각센서와 robot hand에서 재사용 가능한 공통 tactile representation을 만들 수 있는가?
RQ2. vision·touch·force·proprioception을 어떤 좌표계와 시간축에서 결합해야 sub-mm precision이 가능한가?
RQ3. 자연어 작업지시를 Skill sequence + contact goal + force/precision constraint로 자동 변환할 수 있는가?
RQ4. 미경험 공정에서도 기존 skill을 조합하여 zero/few-shot manufacturing manipulation을 수행할 수 있는가?
RQ5. 공구의 형상·관절·마찰 특성이 달라도 하나의 policy가 screwdriver, wrench, plier 등의 사용법을 일반화할 수 있는가?
RQ6. slow VLA reasoning과 fast tactile reflex를 어떻게 분리·통합해야 하는가?
RQ7. 장기작업에서 실패확률의 누적을 줄이기 위해 world model, replanning, skill library를 어떻게 결합해야 하는가?
RQ8. 인간 숙련자의 tactile demonstration을 어떤 방식으로 robot embodiment로 이전하는 것이 가장 data-efficient한가?
RQ9. sim-to-real에서 contact dynamics의 차이를 얼마나 줄일 수 있으며, 무엇을 real data로 반드시 보정해야 하는가?
RQ10. 평균 성공률이 아니라 8시간 연속운전·복구시간·공정간 전환비용을 어떻게 benchmark할 것인가?
8. Approaches (Methods)
제가 보기에는 Robot Master를 하나의 end-to-end giant policy로 설계하기보다 계층형 구조로 가는 것이 최근 연구 흐름과 가장 잘 맞습니다.
A. 작업 이해층 — Instruction → Task Graph
작업지시서를 입력받아
목표 → 공정 → Subtask → Skill → Tool → 제약조건
으로 분해합니다.
DexVLA나 IALP 같은 연구는 language instruction을 행동·계획과 연결하는 기반을 제공합니다. 〔원문 DexVLA〕
B. 시·촉각 공동인지층
입력:
RGB/RGB-D + point cloud + tactile + F/T + proprioception
출력:
object/contact geometry + slip + force distribution + confidence
3D-ViTac, SaTA, ViTacFormer가 이 축에 해당합니다. 〔원문 3D-ViTac · SaTA · ViTacFormer〕
C. 촉각 Foundation Encoder/Policy
여러 sensor를 각각 별도 학습하기보다
Sensor-specific Encoder
→ Shared Tactile Latent Space
→ Manipulation Policy
로 구성합니다.
T3와 FTP-1이 대표적인 방향입니다. 〔원문 T3 · FTP-1〕
D. Contact World Model
현재 접촉상태와 행동으로부터
\[ (s_t,a_t)\rightarrow(\hat{s}_{t+1},\hat{T}_{t+1}) \]
을 예측합니다.
즉 “이만큼 밀면 다음 순간 접촉이 어떻게 바뀔 것인가?”를 학습합니다.
VT-WAM, TouchWorld, ContactWorld, ViTacWorld가 이 흐름을 빠르게 확장하고 있습니다. 〔원문 VT-WAM · TouchWorld · ContactWorld〕
E. 고주파 촉각 반사층
설계 예시로 VLA가 5–20 Hz 수준의 상위 행동을 결정한다면, tactile reflex는 훨씬 빠르게
slip → grip correction
misalignment → micro-motion
force spike → retract
를 수행하도록 분리하는 것이 합리적입니다.
T-Rex와 TouchWorld가 이러한 fast tactile feedback loop 방향을 보여줍니다. 〔원문 T-Rex · TouchWorld〕
F. Skill Library + Hierarchical Planner
정밀 제조는
grasp → align → insert → rotate → tighten → inspect
같은 skill composition 문제입니다.
ARCH는 model-based/RL low-level primitive와 high-level imitation policy를 결합하고, SPIN은 독립 Skill을 connector와 planner로 연결합니다. 〔원문 ARCH〕
G. Human-to-Robot Skill Transfer
숙련자의 손동작과 tactile profile을 수집한 뒤
Human Demonstration
→ Embodiment Alignment
→ Robot Skill
→ Residual Adaptation
으로 전이합니다.
DexUMI, MimicTouch, UniTacHand가 이 구조와 직접 연결됩니다. 〔원문 DexUMI · MimicTouch · UniTacHand〕
제조 적용과 남은 문제
9. Key Applications
Robot Master와 가장 잘 맞는 적용영역은 “고정밀·다품종·숙련의존·접촉풍부 제조”입니다.
① 커넥터·하네스 삽입
시야가 가려지고 힘·정렬정보가 중요합니다. 내부안에서도 배선 하네스와 커넥터 삽입을 대표 실증으로 제시합니다. 〔첨부 연구부서 목표·편집 해석〕
② 전자부품·정밀 조립
T3가 다룬 sub-mm multi-pin insertion과 직접 연결됩니다. 〔원문 T3〕
③ 나사·볼트·체결
screwdriver/wrench 사용에는 힘·회전·접촉상태를 동시에 다뤄야 합니다.
④ 공구사용
plier, scissors, stapler 같은 articulated tool은 고정된 gripper 작업보다 훨씬 높은 tactile intelligence를 요구합니다. 〔원문 NOD-TAMP〕
⑤ 양손 조립
한 손은 고정하고 다른 손은 체결하거나 두 손이 서로 다른 힘을 가하는 작업입니다.
⑥ 혼류생산
제품이 바뀔 때마다 전용 치구·전용 end-effector를 새로 만들지 않고 작업지시와 tool만 바꾸는 방향입니다. 연구부서 안도 “치구 제거 정밀조작, Zero-shot 작업, 정밀공구 5종, 혼류공정 동시수행”을 최종상으로 제시합니다. 〔첨부 연구부서 목표·편집 해석〕
10. Open Problems
1. 진정한 zero-shot 정밀조작은 아직 멀다
언어적으로 새로운 작업을 이해하는 것과 0.1 mm급으로 처음 보는 부품을 체결하는 것은 난이도가 전혀 다릅니다.
2. tactile foundation model의 규모법칙이 아직 불명확하다
Vision/LLM처럼 “data와 model을 키우면 얼마만큼 좋아지는가”가 촉각에서는 아직 확립되지 않았습니다.
3. Sensor 표준화 부재
촉각센서마다 해상도·형태·신호물리가 달라 foundation tactile model을 만들기 어렵습니다. FTP-1은 이를 정면으로 다루지만 아직 초기 단계입니다. 〔원문 FTP-1〕
4. Tool generalization
새로운 tool의 geometry와 dynamics를 몇 번의 demonstration만으로 학습하는 문제는 여전히 개방적입니다.
5. 장시간 안정성
대부분 논문은 수분 단위 실험입니다. 8시간 continuous production과 같은 산업 KPI를 다루는 공개 benchmark는 매우 부족합니다.
6. Failure recovery benchmark 부족
성공률은 많이 보고하지만 “실패 후 스스로 복구했는가?”를 정량화하는 benchmark는 상대적으로 부족합니다.
7. 촉각 World Model의 실제 장기예측
ContactWorld도 장기계획에서 representation choice가 중요하다고 보여주며, tactile 정보를 단순 추가한다고 자동으로 성능이 오르지 않는다는 점을 보여줍니다. 〔원문 ContactWorld〕
8. 안전한 online learning
현장 배포 후 스스로 숙련되는 것은 필요하지만 제조라인에서 uncontrolled exploration은 허용하기 어렵습니다.
다음 연구 방향
11. Future Directions
방향 1 — Vision-Language-Action에서 Vision-Tactile-Language-Action으로
앞으로의 정밀제조 foundation policy는
\[ Vision + Language + Tactile + Force + Action \]
구조가 자연스럽습니다.
OmniVTLA는 이미 이 방향을 제시했고, 2026년 tactile foundation policy가 이어지고 있습니다. 〔원문 OmniVTLA · FTP-1〕
방향 2 — Reactive Touch에서 Predictive Tactile Intelligence로
단순히 “닿았다”를 감지하는 것이 아니라
“0.2초 뒤에 slip이 발생할 가능성이 높다” (예시 예측 지평)
를 예측하는 tactile world model이 핵심이 될 가능성이 큽니다.
TouchWorld와 VT-WAM이 대표적입니다. 〔원문 TouchWorld · VT-WAM〕
방향 3 — 하나의 촉각센서가 아니라 Universal Tactile Representation
T3 → FTP-1 흐름은 sensor-specific policy에서 sensor-general tactile foundation policy로 이동하고 있음을 보여줍니다. 〔원문 T3 · FTP-1〕
Robot Master가 실제 산업플랫폼이 되려면 이 방향이 매우 중요합니다.
방향 4 — 인간 숙련데이터를 대규모 robot training data로 변환
Robot data만 모으는 것은 비용이 큽니다.
DexUMI, UniTacHand, DexTouch-WM이 제시하는 방향은
100시간의 인간 숙련 데이터 → robot tactile/world model → robot policy
와 같은 새로운 data scaling 경로입니다. DexTouch-WM의 인간 시연 데이터를 0–100시간까지 늘린 실험은 이 방향의 개별 사례이며, 위 화살표 전체가 이미 상용 공정으로 검증됐다는 뜻은 아닙니다. 〔원문 DexUMI · DexTouch-WM〕
방향 5 — “하나의 giant policy”보다 Slow Brain + Fast Reflex
로봇 명장에는 서로 다른 시간척도의 지능이 필요합니다.
Slow Brain > 작업지시 이해 → 계획 → tool 선택 → subtask 결정
Fast Reflex > 접촉력 → slip → micro-correction → safety stop
TouchWorld가 이 계층형 구조를 명시적으로 보여줍니다. 〔원문 TouchWorld〕
방향 6 — Skill 단위 제조지능
장기적으로는 특정 공정 policy를 하나씩 만드는 방식보다
Insert
Tighten
Route Cable
Align
Polish
Cut
Inspect
같은 Composable Manufacturing Skill Library가 필요합니다.
Nature Machine Intelligence의 2025 tactile skill taxonomy도 industrial process를 formal specification과 재사용 가능한 tactile skill로 연결하는 방향을 제시합니다. 〔원문 Process-centric tactile skill taxonomy〕
방향 7 — 성공률에서 숙련도(Skill Maturity) 평가로
Robot Master는 단순 success rate보다 다음 평가가 더 적절합니다.
정밀도 — positional/force error
숙련도 — tool change 없이 다양한 공정 수행
일반화 — unseen part/process/tool
회복력 — failure detection/recovery
지속성 — uninterrupted operation time
교시비용 — demonstrations/task
재사용성 — skill transfer across robots
안전성 — damage/contact-force violation
즉 연구평가의 단위도 “Task Success”에서 “Manufacturing Mastery”로 올라갈 필요가 있습니다.
2025–2026 논문 지도와 종합
12. 2025–2026 핵심 논문과 Robot Master와의 연결 (MimicTouch는 2023년 선행연구)
| 논문 | 연도 | Robot Master에서 중요한 이유 |
|---|---|---|
| Transferable Tactile Transformers (T3) | 2025 | 다중센서 tactile transfer, sub-mm insertion |
| 3D-ViTac | 2025 | 3D vision+tactile, 양손 정밀조작 |
| MimicTouch | 2023 | 인간 tactile demonstration → robot policy |
| DexUMI | 2025 | 인간 손 숙련의 cross-hand transfer |
| DexVLA | 2025 | 언어지시·cross-embodiment·장기작업 |
| ViTacFormer | 2025 | future tactile prediction, 장기 dexterous manipulation |
| SaTA | 2025 | sub-mm tactile geometric reasoning |
| ARCH | 2025 | 장기·고정밀 assembly의 계층형 skill architecture |
| DexSkin | 2025 | 그리퍼 손가락 표면을 폭넓게 덮는 tactile skin |
| FTP-1 | 2026 | 범용 tactile foundation policy |
| T-Rex | 2026 | high-frequency tactile-reactive manipulation |
| TouchWorld | 2026 | tactile prediction + fast reflex + VLA planning |
| VT-WAM | 2026 | tactile dynamics를 포함한 world-action model |
| ContactWorld | 2026 | contact-rich world model representation benchmark |
| DexTouch-WM | 2026 | 인간 touch를 robot tactile world model에 활용 |
주요 원문은 다음에서 확인할 수 있습니다: T3 논문(PMLR), 3D-ViTac 논문, DexUMI 논문, DexVLA 논문, SaTA 논문, ARCH 논문, FTP-1 논문, TouchWorld 논문, VT-WAM 논문, ContactWorld 논문.
종합
현재의 연구 흐름을 한 문장으로 압축하면,
“로봇 명장”의 경쟁력은 더 정교한 손 자체보다, 작업지시 이해(VLA) → 3D 시·촉각 인지 → 접촉예측(world model) → 고주파 촉각반사 → 다지·양손·도구조작 → 장기 skill planning → 실패복구 → 인간 숙련의 지속학습을 하나의 제조 폐루프로 묶는 데서 나온다.
따라서 연구부서가 제시한 Robot Master를 전략연구사업 수준으로 다듬는다면, 단순 “0.1 mm 정밀로봇”으로 정의하기보다
“미경험 제조공정을 작업지시서만으로 이해하고, 사람의 손끝과 같은 시·촉각 물리지능으로 다양한 공구를 활용하며, 실패를 스스로 감지·복구하고 현장에서 지속적으로 숙련되는 범용 정밀조작 Physical AI”
로 정의하는 것이 현재 2025–2026 연구 프런티어와 가장 잘 맞습니다.
논문 원문
본문의 연구부서 목표는 첨부 자료에 귀속된다. 아래 목록은 본문에서 연결한 공개 연구의 원문이다. arXiv는 사전 공개본을 포함한다.
- T3연구 원문 · arXiv
- 3D-ViTac연구 원문 · arXiv
- MimicTouch연구 원문 · arXiv
- DexUMI연구 원문 · arXiv
- DexVLA연구 원문 · arXiv
- ViTacFormer연구 원문 · arXiv
- SaTA연구 원문 · arXiv
- ARCH연구 원문 · arXiv
- DexSkin연구 원문 · arXiv
- FTP-1연구 원문 · arXiv
- T-Rex연구 원문 · arXiv
- TouchWorld연구 원문 · arXiv
- VT-WAM연구 원문 · arXiv
- ContactWorld연구 원문 · arXiv
- DexTouch-WM연구 원문 · arXiv
- OmniVTLA연구 원문 · arXiv
- UniTacHand연구 원문 · arXiv
- NOD-TAMP연구 원문 · arXiv
- Process-centric tactile skill taxonomy연구 원문 · arXiv