관찰하는 AI에서
행동하는 세계모델로
Cosmos 3: Physical AI, Omnimodal World Models, and Action-Centric Systems
로봇이 행동하기 전에, 그 행동의 결과를 예측할 수 있을까. Cosmos 3는 이해·생성·행동을 공유하는 옴니모달 세계모델로 이 질문에 접근한다.
첨부 cosmos3.md의 입문서, 심층 기술 분석, 통합 청사진을 한 편의 해설로 재구성했다. 모든 주제와 원문 기록을 포함하되 중복을 정리했다. 공식 기술보고서·모델 참조·저장소와 대조한 수정 사항은 해당 절에 표시한다. 설명용 개념도와 도입 기준은 이 글의 해석이며, 벤치마크 성과·공식 사양과 구분한다.
현실 세계의 행동은 데이터 문제다
입문: 물리 AI, 수집 비용, 희귀 상황, 세계 기반모델의 역할.
화면의 답변에서 환경의 변화로
물리 AI(Physical AI)는 로봇·자율주행차·드론·산업 시스템처럼 환경을 관찰하고 실제 행동으로 바꾸는 AI를 가리킨다. 돌을 어디에 둘지 계산하는 것과 돌을 실제로 집어 올리는 것은 다르다. 후자에는 접촉·마찰·관성·센서 오차와 주변 사람의 움직임이 개입한다. 모델의 인식과 계획이 좋더라도 구동기·제어기·안전장치가 함께 작동해야 한다.
첨부문서는 세 난제를 제시한다. 환경과 상태 조합이 매우 크고, 새 상황의 결과를 미리 알기 어려우며, 실물 수집에는 비용과 위험이 든다는 점이다. 텔레오퍼레이션은 행동 라벨을 얻는 데 유용하지만 사람의 작업시간에 묶인다. 인터넷 비디오는 다양하지만 제어신호가 부족하다. 명시적 물리 시뮬레이션은 상태와 정답을 제공하지만 유체·변형체·접촉 및 시각적 도메인 차이를 완전히 재현하기 어렵다.
| 데이터 경로 | 장점 | 남는 한계 |
|---|---|---|
| 실물·원격조종 | 현장 관측과 행동의 연결 | 수집 비용·운영 안전·희귀 상황의 부족 |
| 물리 시뮬레이터 | 상태·접촉·운동량을 명시하고 실험을 반복 | 모델링 오차·환경 구축·실세계 전이 |
| 관측 비디오 | 다양한 장면과 큰 규모 | 행동·힘·내부 상태의 부재 |
| 학습형 세계모델 | 관측·행동 조건부 미래와 합성 시나리오 생성 | 물리 일관성·분포 범위·실물 검증의 필요 |
“연산이 데이터가 된다”의 정확한 범위
세계모델은 관찰된 상태와 행동을 바탕으로 다음 관측이나 환경의 변화를 예측하는 모델이다. 세계 기반모델(World Foundation Model)은 여러 장면·과제에 재사용할 수 있는 학습 기반을 지향한다. Cosmos 3는 여기에 언어·이미지·비디오·오디오·행동을 결합하는 옴니모달 구조를 제시한다. [1, 2]
Compute is Data는 연산으로 학습자료의 다양성을 확장한다는 전략이다. 데이터 부족이 사라졌다는 뜻은 아니다. 합성 데이터도 초기 실물 관측, 생성모델의 편향, 평가 비용, 품질 기준에 의존한다. 시각적으로 그럴듯한 영상과 실제 행동에 유효한 데이터는 별개다.
추론과 생성을 잇는 두 타워
아키텍처: 자기회귀 Reasoner, 확산 Generator, 공유 어텐션.
Mixture of Transformers를 어떻게 읽을 것인가
Cosmos 3의 MoT(Mixture of Transformers)는 관측을 해석하는 자기회귀(AR) 타워와 영상·오디오·행동을 생성하는 확산 타워를 결합한다. 첨부의 ‘건축가와 시공자’ 비유는 두 역할을 이해하는 데 도움이 되지만, 내부 표현 전체를 사람이 읽을 수 있는 계획으로 간주해서는 안 된다.
Reasoner는 시각·언어 맥락을 해석하고 응답 또는 조건 표현을 제공한다. Generator는 그 표현을 이용해 노이즈를 제거하며 미래 관측과 행동을 생성한다. 공유 어텐션은 관측 이해와 생성의 조건을 모델 내부에서 연결하는 통로이다. 별도 모델 사이의 연동을 줄일 수 있지만 전체 로봇 시스템의 인터페이스·시간 동기화·안전제어까지 자동 해결하지는 않는다. 공식 설명상 Reasoner는 독립 호출할 수 있고, Generator 호출은 두 타워를 함께 활성화한다. [2]
| 실행 경로 | 입력·출력 | 주요 활용 |
|---|---|---|
| Reasoner | 텍스트·시각 관측 → 텍스트 | 장면 이해, 공간·시간 추론, 상위 과제 계획 |
| Generator | 텍스트·시각·소리·행동 조건 → 시각·소리·행동 | 세계 생성, 미래 예측, 행동 조건부 rollout, 정책 학습 |
Nano와 Super, 그리고 현재 목록
첨부는 Nano 16B(8B 추론 타워+8B 생성 타워)와 Super 64B(32B+32B)를 중심으로 설명한다. 16B와 64B는 두 타워를 합친 규모이므로 추론 타워만 사용하는 경우의 규모와 혼동하지 않아야 한다. 공식 모델 참조에는 Edge 4B와 추가 작업별 변형도 포함된다. [3]
| 모델·변형 | 역할 | 선정할 때 볼 것 |
|---|---|---|
| Cosmos3-Nano · 16B | 워크스테이션 수준의 추론·생성 기반 | 전체 생성 비용과 Reasoner 단독 비용 구분 |
| Cosmos3-Super · 64B | 데이터센터 기반 고품질 생성·추론 | GPU 메모리·분산 추론·처리량 |
| Cosmos3-Edge · 4B | 현재 공식 문서에 포함된 소형 계열 | 실제 공개 아티팩트와 지원 런타임 확인 |
| Super-Text2Image / Image2Video | 텍스트 조건부 이미지·초기 프레임 조건부 비디오 | Agentic prompting과 모델명 구분; 4-step 변형 포함 |
| Nano-Policy-DROID / Edge-Policy-DROID | DROID 조작 데이터에 맞춘 정책 변형 | 로봇 형태·좌표계·관측·행동 스키마의 일치 |
첨부의 ‘5대 모델’은 완결된 최신 목록이 아니다. ‘Agentic Super’라는 설명만으로 별도 정식 모델명이나 안전성이 입증되지는 않는다. Nano라는 이름도 임의의 엣지 장치에서 저전력·실시간 실행을 보장하지 않는다. [3]
액션을 모델의 언어로 만든다
순방향 역학, 역방향 역학, 정책과 체화 형태별 투영.
미래를 예측하고, 행동을 복원하고, 행동을 선택한다
| 모드 | 입력 → 출력 | 사용 목적·한계 |
|---|---|---|
| Forward dynamics | 관측 프레임+행동 시퀀스 → 미래 비디오 | 행동 결과의 미리보기·정책 평가. 신경망 rollout을 실물 역학의 정답으로 간주하지 않는다. |
| Inverse dynamics | 관측된 비디오 → 행동 표현 | 시연 주석과 궤적 추론. 영상만으로 힘·관절 토크 등을 유일하게 복원하기는 어렵다. |
| Policy | 현재 관측+과제 지시 → 미래 행동 청크 | 조작 정책의 학습·실행 후보 생성. 출력에 하위 제어기와 안전 검사가 필요하다. |
액션을 ‘1급 시민’으로 다룬다는 것은 후처리 태그로 덧붙이는 대신 입력·출력 표현과 학습목표에 포함한다는 뜻이다. 모든 기존 로봇 모델이 행동을 사후 부가물로 다뤘다는 일반화는 피한다. 정책학습과 VLA 연구는 이미 행동을 직접 모델링해 왔다.
행동 청킹은 여러 미래 제어 시점을 묶어 출력한다. 첨부가 설명하는 tick은 시간적 조직 단위이며, 실제 제어 주기와 예측 지평은 데이터·설정에 따라 정의해야 한다. 청크를 예측한 뒤 새 관측으로 다시 계획하는 것이 실용적 폐루프의 핵심이다. 청킹만으로 진동이나 누적오차가 제거되지는 않는다.
서로 다른 로봇의 행동을 공유 공간에 연결한다
도메인별 투영층은 로봇마다 다른 행동 벡터를 공유 잠재공간에 넣고 다시 해당 행동 차원으로 돌려준다. 이 원리를 다음의 개념식으로 나타낼 수 있다.
여기서 k는 체화 도메인, x는 정규화된 행동, z는 잠재 토큰이다. 관절각·말단 위치·상대 자세·그리퍼 상태는 같은 물리량이 아니므로 좌표·단위·제어 의미를 맞춰야 한다. 로봇 형태가 달라졌다고 투영만 바꾸면 곧바로 작동하는 것은 아니다.
첨부의 ‘모든 액션 토큰 4,096차원’과 ‘20개 이상 도메인에 즉시 적용’은 범용 사양으로 확정하지 않는다. 기술보고서는 잠재 차원을 d_model로 표현하고 도메인별 투영을 사용한다. 6D 회전은 SO(3)의 3자유도를 과매개변수화한 표현이며, 표현의 연속성이 실물 안전성을 보증하지는 않는다. 쿼터니언도 오일러 각과 같은 짐벌락 문제를 갖는다고 설명하면 부정확하다. [1]
좋은 영상과 좋은 제어는 따로 평가한다
리더보드, 물리 일관성, 정책 성공률을 구별한다.
벤치마크의 역할을 분리한다
| 평가군 | 다루는 능력 | 읽을 때의 경계 |
|---|---|---|
| VANTAGE-Bench / TAR | 고정 카메라 장면·사건·공간·시간·교통 이상 추론 | 관측 이해와 실제 안전제어는 다르다. |
| Artificial Analysis | 이미지·비디오 생성의 비교 | 순위는 버전·평가 시점·공개/비공개 모델 범위에 의존한다. |
| PAI-Bench / R-Bench / Physics-IQ | 물리 상식·로봇 영상·세계 생성의 타당성 | 영상 평가는 모든 접촉·힘·장기 전이를 보증하지 않는다. |
| RoboLab / RoboArena | 시뮬레이션·실세계 조작 정책 평가 | 작업·언어 지시·로봇·평가 프로토콜을 함께 읽어야 한다. |
| DROID | 정책 사후학습용 로봇 시연 데이터 | 독립 리더보드와 혼동하지 않는다. |
첨부의 ‘11개 이상 벤치마크, 9개 리더보드 1위’는 세부 산정 목록이 제시되지 않은 요약 주장이다. 이 글에서는 전체 개수를 검증된 성능 지표로 사용하지 않고, 공식 자료가 설명하는 평가군과 보고 당시의 성과를 구분한다. ‘LureLab’ 표기는 확인된 RoboLab·RoboArena로 바로잡는다. [1, 2, 4]
기술보고서의 RoboLab-120 결과 중 구체적 지시 조건에서 Nano-Policy-DROID의 평균 성공률은 39.7%이며, 비교값은 π0.5 28.1%, DreamZero 25.2%이다. 120개 과제에서 과제당 10회 rollout 조건의 보고 결과다. 성능 개선과 ‘실패 없음’은 전혀 다른 주장임을 이 수치 자체가 보여준다. [1, §6.2.5]
물리 일관성 검사의 통과가 의미하는 것
물체 지속성, 조건 충족, 공간 대응, 시간 일관성은 중요하다. 그러나 환각 검사나 VLM 점수는 특정 실패를 검출하는 수단이지 보존법칙과 모든 물리 상태의 증명기가 아니다. 영상의 사실감, 정책 성공, 안전성을 한 가지 점수로 대체할 수 없다.
첨부의 ‘환각 원천 차단’, ‘물리적으로 완벽한 미래’, ‘완전한 Sim-to-Real’은 개선 목표로 읽어야 한다. 실물에서의 분포 이동, 미관측 접촉, 제어 지연, 다단계 오차는 별도 시험 대상이다.
데이터에서 배포까지 연결하는 도구
Curator → Framework → Evaluator, 그리고 실제 환류.
세 도구가 맡는 책임
| 도구 | 첨부의 개발 흐름 | 검증·운영해야 할 항목 |
|---|---|---|
| Cosmos Curator | GPU 가속 디코딩·장면 분할·필터링·중복 제거·VLM 캡셔닝 | 캡션 오류, 개인정보, 데이터 권리, 샘플링 편향. 수개월→수일은 보편적 시간 보증이 아니다. |
| Cosmos Framework | 추론 설정·프롬프트 확장·비전 생성 SFT·Reasoner 정렬·정책 SFT | 코드 버전과 checkpoint, 관측·행동 형식, 재현 가능한 실행 설정. |
| Cosmos Evaluator | 생성 영상의 품질·객체 대응·환경 조건 검사 | 검출 범위와 기준자료의 품질. 평가 결과를 보존하고 실패를 추적한다. |
Prompt Upsampler는 짧은 요청을 조명·재질·동작·카메라 조건 등 생성에 유용한 표현으로 확장한다. 내용이 자세해졌다고 관측에 없는 사실을 마음대로 추가해도 되는 것은 아니다. 첨부의 inputs/omni/ JSON 예시는 구성 방식의 설명으로 남기되, 특정 버전의 현재 경로는 공식 저장소에서 확인해야 한다. [5]
첨부가 열거한 Vision SFT, Reasoner Alignment SFT, Policy SFT는 목적을 구분해 선택한다. 비디오 품질 개선, 응답 형식 정렬, 로봇 행동 적응은 서로 다른 학습 목표다. DROID 샘플은 자체 로봇 적용의 출발점이며 즉시 작동하는 범용 제어기가 아니다.
세 공개 검사기와 사용자 정의 검증의 차이
확인한 Evaluator README는 3종 검사를 명시한다. Hallucination Check는 원본·변형 영상의 움직임 마스크를 비교하고, Objects Check는 기준 객체 위치와 생성영상의 대응을 평가하며, Attribute Verification Check는 VLM을 사용해 속성을 확인한다. REST 서비스·Python API와 결과 저장·조정 계층도 제공한다. [6]
따라서 첨부의 Obstacle Checker·VLM Checker는 각각 객체 대응·속성 검증과 관련된 설명으로 다듬는다. ‘Physical Consistency Suite’라는 네 번째 기본 검사기를 현재 공개 구성으로 확인할 수 없으므로 중력·충돌·운동량 검증은 별도 설계할 평가로 둔다. 검증을 통과한 데이터도 일부 실물 시험과 전문가 검토를 거친 뒤 재학습에 사용해야 오류 증폭을 줄일 수 있다.
추론 타워와 세 컴퓨터의 역할을 나눈다
산업 적용, 클라우드·시뮬레이션·온보드 배치, 라이선스.
영상을 생성하지 않고 현장을 이해한다
Reasoner 단독 경로는 CCTV·창고·교통 영상에서 사건을 설명하거나, 비디오 캡션을 만들거나, 로봇의 상위 과제를 나누는 용도로 사용할 수 있다. 전체 생성 경로를 생략하므로 해당 계산을 줄일 수 있으나, 서브세컨드 응답은 GPU·정밀도·영상 길이·동시 요청에 따라 달라진다. 첫 토큰 시간과 응답 완료시간, 제어 폐루프 지연도 구분해야 한다. [2]
Milestone Systems는 공식 발표의 Cosmos 플랫폼 활용 기업에 포함된다. 다만 첨부의 XProtect 통합 상세와 성과 수치는 이 글에서 독립 검증하지 않았다. Levitas의 송전탑 기울기·전선 장력 분석은 첨부가 든 사례로 소개하되, 이번에 확인한 공식 발표에서 해당 Cosmos 3 도입을 확인하지 못했다. 사례의 설명과 검증된 도입 실적을 구분한다. [4]
로봇 조작, 위험 주행 시나리오, 창고 이상상황, 스마트 시티, UAM·드론, 인프라 점검은 첨부가 제시한 적용군이다. 이때 영상만으로 장력을 확정하기보다는 센서·물리모델·현장 측정과 결합하는 방식이 타당하다. 이는 시스템 설계상의 해석이다.
학습·시뮬레이션·현장 실행을 구분한다
| 컴퓨팅 역할 | 첨부의 예시 | 시스템 설계의 판단 |
|---|---|---|
| 학습·사후학습 | H100/B200 클러스터, Brev | 대규모 학습과 소규모 SFT를 구별하고 지원 정밀도·메모리·코드 버전을 확인한다. |
| 시뮬레이션·평가 | Omniverse, Isaac Sim, Isaac Lab | 명시적 환경 상태·제어 결과와 생성 영상을 비교한다. Cosmos 실행 자체와 전체 시뮬레이션 연동을 구분한다. |
| 추론·현장 실행 | Jetson Orin, 온보드 컴퓨터, DGX Spark | 실제 장치에 맞는 모델·런타임과 최악 지연을 측정한다. DGX Spark를 임의의 로봇 탑재 장치와 같은 것으로 취급하지 않는다. |
‘세 컴퓨터’는 역할을 나누는 배포 패턴이다. 모든 프로젝트에 장비 세 대가 반드시 필요하다는 뜻은 아니다. Isaac Teleop·ROS·드라이버와의 연결은 관측, 좌표계, 상태시간, 행동 큐, 비상정지의 구체 인터페이스를 구현해야 한다. 첨부의 ‘ROS/Cross’에서 Cross의 대상은 불명확하므로 특정 제품으로 단정하지 않는다.
모델·코드·데이터의 권리는 각각 확인한다
첨부는 OpenMDW-1.1을 통해 모델과 데이터를 상업·연구 목적으로 사용할 수 있다고 설명한다. 이를 ‘아무 조건 없이 전체 플랫폼을 자유롭게 사용’으로 확대하면 부정확하다. 공개 모델은 해당 모델 카드와 라이선스를, 데이터는 각 데이터셋 카드를, 실행 코드와 의존성은 각 저장소의 라이선스를 읽어야 한다. 예를 들어 Cosmos Evaluator는 Apache-2.0이다. [6]
첨부의 대규모 공개 데이터는 디지털 휴먼·물리 상호작용·체화 로봇·자율주행·창고 장면을 포함하는 합성 데이터군을 가리킨다. 공개 합성 데이터가 전체 사전학습 코퍼스와 같다는 뜻은 아니다. 용량·배포 조건·아티팩트는 컬렉션과 개별 카드에서 확인한다. [2, 5]
실행 로드맵과 검증 경계
입문·심층 분석·통합 청사진을 실무 체크포인트로 정리한다.
네 단계 도입 계획
| 단계 | 구체적 작업 | 완료 기준 · 이 글의 설계 제안 |
|---|---|---|
| 1. 데이터 준비 | 실물 관측·행동·시간정보 수집, Curator 정제·캡셔닝 | 좌표·단위·권리·센서 동기화와 표본 검수 통과 |
| 2. 모델·계산 선정 | Nano/Super/Edge 및 작업별 변형 선택, 학습·시뮬레이션·추론 자원 배치 | 실제 장비에서 메모리와 처리량 측정, 버전 고정 |
| 3. 사후학습 | Vision·Reasoner·Policy의 목적별 SFT, 프롬프트 확장 규칙 고정 | 현장과 분리된 평가셋에서 개선·퇴행 확인 |
| 4. 폐루프 검증·배포 | Evaluator와 물리 시뮬레이터, 안전한 실물 시험, ROS·장비 연결 | 과제 성공률·충돌·최악 지연·OOD 실패와 중단 기준 충족 |
합성 데이터를 실물 데이터와 비교하고, 성능이 나빠지는 조건을 기록하며, 실패 샘플을 데이터·프롬프트·정책 개선에 되돌린다. 검증→환류→재학습의 반복을 구현하는 것이 첨부 청사진의 실용적 가치다. 모델이 통합되더라도 검증 책임은 없어지지 않는다.
세 가지 핵심과 네 가지 남은 문제
첫째, 세계모델은 비싼 실물 데이터의 부족을 보완할 수 있다. 둘째, MoT는 관측 이해와 생성의 표현을 내부에서 연결한다. 셋째, 액션 표현과 공개 도구는 세계모델을 정책학습·현장 비전으로 확장하는 출발점이다.
남는 과제는 물리적 타당성, 새로운 로봇·환경으로의 전이, 실시간 폐루프 비용, 평가·라이선스의 정확한 적용이다. 가능한 미래를 생성하는 능력은 그 미래를 안전하게 실행하는 능력과 함께 검증해야 한다.
자료와 첨부 원문
주된 구성 자료는 사용자 제공 cosmos3.md 전체다. [1]–[6]은 기술적 사양과 단정 표현을 대조한 1차 자료다. 게시일은 한국시간 2026-09-30이다.
- Cosmos 3: Omnimodal World Models for Physical AI아키텍처·액션 표현과 보고된 정책 성과의 확인에 사용한다.
- Develop Physical AI Reasoning, World, and Action Models with NVIDIA Cosmos 3독립 Reasoner 경로, Generator 경로와 개발 흐름.
- Cosmos 3 Model Reference현재 모델 계열과 작업별 변형. 2026-09-30 확인.
- NVIDIA Launches Cosmos 3발표 당시 성과와 산업 활용 목록. 일반적인 실증 보증으로 해석하지 않는다.
- NVIDIA Cosmos GitHub모델·Framework·Curator·문서·데이터의 연결점.
- Cosmos Evaluator3개 공개 검사와 Apache-2.0 라이선스를 확인한다.
첨부 원문 전체 보기 · 입문서 / 심층 분석 / 통합 청사진
아래는 제공된 cosmos3.md의 전체 기록이다. 원문의 반복·표기·단정도 그대로 보존했다. 검증된 사실의 재진술이 아니며, 수정·확인 사항은 위 해설을 기준으로 읽는다.
물리 AI와 세계 모델(World Model) 입문: NVIDIA Cosmos 3로 이해하는 현실 세계 AI의 미래
1. 물리 AI(Physical AI)의 개념과 도전 과제: 현실 세계로 나온 AI
우리가 일상에서 쉽게 접하는 인공지능(AI)은 주로 모니터나 스마트폰 화면 안에서 글을 써주거나 그림을 그려주는 '소프트웨어 AI'입니다. 이 소프트웨어 AI를 **'바둑판 위 최적의 수를 계산해 화면에 보여주는 AI 체스 기사'**에 비유할 수 있습니다.
반면, **'물리 AI(Physical AI)'**는 **'실제 바둑돌의 무게, 손가락 마찰력, 테이블로 불어오는 바람, 상대방의 돌발 행동까지 계산해 바둑돌을 오차 없이 집어 올려놓는 체조 선수 로봇'**과 같습니다. 로봇, 자율주행차, 스마트 공장, 지능형 드론처럼 물리 AI는 모니터를 벗어나 우리가 살아가는 현실 세계의 물리적 법칙(중력, 마찰력, 충돌 등)과 직접 상호작용하며 작동합니다. 이들은 스스로 주변 환경을 인식하고, 추론하며, 적절한 물리적 행동을 결정하는 '뇌' 역할을 하는 신경망 모델을 탑재합니다.
하지만 화면 속 소프트웨어 AI와 달리, 물리 AI를 학습시키는 데는 매우 치명적인 장벽이 존재합니다. 바로 '데이터 희소성(Data Scarcity)' 문제입니다.
현실 세계 데이터 수집은 사람이 직접 로봇을 원격 조종하며 기록하는 방식(Teleoperation)에 의존해야 하므로 막대한 시간과 비용이 소요됩니다. 무엇보다 도로 위 갑작스러운 빙판길 사고나 공장 내 설비 폭발처럼 위험하고 극도로 희귀한 시나리오의 데이터는 현실에서 안전하게 수집하는 것이 물리적으로 불가능에 가깝습니다.
💡 물리 AI 학습의 핵심 난제 3가지
1. 무한성(Infinity): 현실 세계의 상태와 가짓수는 무한하므로 기존의 인간 수동 수집 방식만으로는 데이터를 모두 담을 수 없습니다.
2. 예측 불가능성(Unpredictability): 마찰력, 날씨, 충돌 등 이전에 단 한 번도 보지 못한 초유의 상황이 상시 발생합니다.
3. 수집 비용(Collection Cost): 실물 로봇 조종 및 데이터 수집은 리소스 집약적이며 막대한 비용과 안전 위험을 동반합니다.
그렇다면 이처럼 데이터가 부족하고 예측 불가능한 현실 세계를 AI에게 어떻게 가르칠 수 있을까요? 그 해답이 바로 '세계 모델'에 있습니다.
2. 왜 단순 비디오를 넘어 '세계 기초 모델(World Foundation Model)'인가?
기존의 단순 영상 생성 모델은 눈으로 보이는 픽셀 패턴을 관찰하고 시각적으로 유사하게 복제하는 데 집중했습니다. 반면 **'세계 기초 모델(World Foundation Model)'**은 단순히 비디오를 흉내 내는 수준을 넘어, 현실 세계의 물리 법칙을 내재화하여 그 기반 위에서 일어날 수 있는 미래의 상황을 정밀하게 예측하고 물리적 행동까지 연산해 생성합니다.
이러한 맥락에서 물리 AI 분야에는 가치관을 바꾸는 결정적인 명제가 존재합니다.
"물리 AI에 있어 컴퓨팅은 곧 데이터이다 (For physical AI compute is data)"
이 문장의 **'So What?(학습자 관점의 핵심 가치)'**은 기존 AI 학습의 최대 병목이었던 '인간이 일일이 찍고 수집하는 데이터의 물리적 한계'가 완전히 무너졌음을 의미합니다. 이제는 현실에서 위험을 무릅쓰고 데이터를 직접 '수집(Collect)'하는 대신, 컴퓨팅 연산력(Compute)을 활용해 물리 법칙을 완벽히 준수하는 고품질의 가상 시뮬레이션 및 합성 비디오(Synthetic Video)를 무한히 '생성(Compute)'하여 AI의 학습 교재(Data)로 삼는 시대로 전환된 것입니다.
전통적 학습 방식 vs 세계 기초 모델 (Cosmos 3) 학습 방식 비교
전통적 학습 방식 세계 기초 모델 (Cosmos 3) 학습 방식
데이터 출처<br>사람의 수동 조종(Teleoperated) 데이터 및 단순 인터넷 비디오 수집에 의존 데이터 출처<br>컴퓨팅(Compute) 연산력 기반의 고품질 가상 시뮬레이션 및 물리 합성 비디오 무한 생성
물리 법칙 이해 여부<br>겉모습(픽셀)의 변화 패턴 위주 학습으로 물리적 인과관계 및 법칙 이해 부족 물리 법칙 이해 여부<br>물리 법칙을 내재화(Physics-aware)하여 현실 상태 파악 및 미래의 시각적/동적 상태를 정밀하게 예측
희귀 상황 대응력<br>현실에서 쉽게 일어나지 않는 위험·희귀 시나리오 수집의 물리적 한계 존재 희귀 상황 대응력<br>컴퓨팅을 통해 존재하지 않던 다채롭고 가치 있는 고위험 시나리오를 가상으로 자유롭게 생성하여 대응
이제 세계 기초 모델이 무엇인지 알았으니, 최신 혁신 사례인 NVIDIA Cosmos 3가 이를 어떻게 실제로 구현해냈는지 그 내부 원리를 살펴보겠습니다.
3. Cosmos 3의 입출력 파이프라인: 다채로운 감각과 행동의 통합
인간이 눈으로 보고, 귀로 듣고, 언어로 생각한 뒤 몸을 움직이는 것처럼, NVIDIA Cosmos 3는 다양한 감각 정보(Modality)를 유기적으로 받아들이고 처리합니다.
[다채로운 입력 감각] [Cosmos 3 파이프라인] [물리 기반 출력]
텍스트, 이미지, 비디오, ───► 이성적 추론 (Autoregressive) ───► 추론 텍스트, 미래 비디오,
오디오, 액션 시각적 상상 (Diffusion) 오디오, 로봇 제어 액션
다양한 감각 정보의 흐름 (단계별 프로세스)
1. 다중 감각 입력 수용: 모델은 텍스트, 이미지, 비디오, 오디오, 그리고 액션(Action) 정보를 한 번에 수용합니다.
2. 상황 인식 및 이성적 추론: 오토레그레시브(Autoregressive) 트랜스포머가 들어온 입력을 바탕으로 현재 장면을 파악하고, 물리적 상황을 분석하여 계획을 세웁니다.
3. 물리 기반 생성 및 출력: 추론된 결과를 바탕으로 확산(Diffusion) 트랜스포머가 미래 시점의 비디오, 오디오가 포함된 비디오, 그리고 로봇의 구체적인 움직임인 **'액션'**을 생성합니다.
'액션(Action)'의 1등 시민(First-class Citizen) 화와 3가지 핵심 모드
기존 모델에서 액션은 모델을 모두 만든 후 별도로 덧붙이는 '사후 부가물'에 불과했습니다. 하지만 Cosmos 3에서 액션은 '1등 시민(First-class Citizen)', 즉 초기 학습 단계부터 픽셀 및 언어와 동등한 핵심 모달리티로 통합 처리됩니다.
Cosmos 3는 로봇의 정밀 제어를 위해 액션의 3가지 핵심 모드를 지원합니다:
1. Forward Dynamics (신경망 시뮬레이터): 첫 번째 프레임과 로봇의 액션 명령을 입력받아, 해당 행동을 수행했을 때 벌어질 미래의 시각적 비디오를 예측/생성합니다.
2. Inverse Dynamics (신경망 주석기): 기존에 녹화된 비디오를 입력받아, 비디오 속 로봇이나 물체가 취했던 물리적 액션(궤적 및 제어 신호)을 역으로 추출하여 주석(Annotation)을 답니다.
3. Policy (신경망 계획기): 현재의 관찰 상태(비디오/이미지)와 작업 텍스트 프롬프트가 주어지면, 로봇이 목표를 달성하기 위해 취해야 할 미래의 제어 액션을 bezpośrednio 예측합니다.
모델 내부의 '도메인 인식 선형 투영(Domain-aware linear projection)' 기술은 4,096차원의 거대한 공유 잠재 액션 토큰(Shared Latent Action Token)을 로봇 팔, 자율주행차 등 각 하드웨어의 형태(Embodiment)에 맞는 위치(X, Y, Z), 6D 회전 벡터, 관절 각도 제어 신호로 정밀하게 변환해 줍니다. 결과적으로 파편화된 로봇 제어 파이프라인이 단일 모델로 통합되는 혁신을 이룹니다.
다양한 감각 입력을 처리하고 행동을 예측하는 Cosmos 3의 놀라운 능력 뒤에는 두 개의 트랜스포머가 협업하는 독특한 아키텍처가 숨어 있습니다.
4. Cosmos 3의 핵심 아키텍처: 두 개의 뇌 (Mixture of Transformers)
Cosmos 3는 사람의 뇌처럼 서로 다른 장점을 가진 두 개의 트랜스포머를 결합한 'Mixture of Transformers' 아키텍처를 채택했습니다.
이 구조는 **'현장을 분석하고 물리적 설계를 지시하는 수석 건축가(Autoregressive Reasoner)'**와 **'건축가의 지침을 받아 완벽하게 현실 법칙을 따르는 3D 정밀 모형을 짓는 전문 시공자(Diffusion Generator)'**의 협업에 비유할 수 있습니다.
┌────────────────────────────────────────────────────────┐
│ Autoregressive Reasoner (이성적 추론기 / 수석 건축가) │
│ - 입력 데이터를 바탕으로 물리적 상황 분석 및 논리적 계획 수립 │
└───────────────────────────┬────────────────────────────┘
│ Shared Attention Layer
▼ (공유 주의 레이어: 인식 토큰 직접 주입)
┌────────────────────────────────────────────────────────┐
│ Diffusion Generator (시각적 상상기 / 전문 시공자) │
│ - 추론기의 가이드를 받아 물리 법칙을 준수하는 미래 영상 구체화 │
└───────────────────────────┘
공유 주의 레이어(Shared Attention Layer)의 작동 메커니즘
이성적 추론기가 장면을 분석하여 생성한 **인식 및 상황 이해 텐서(Perception Tokens)**는 두 트랜스포머를 연결하는 **'공유 주의 레이어(Shared Attention Layer)'**를 통해 시각적 상상기의 노이즈 제거(Denoising) 과정으로 직접 주입됩니다. 이를 통해 환각(Hallucination) 현상을 근본적으로 제어하며 실제 물리 법칙에 부합하는(Physics-aware) 정교한 비디오와 액션을 만들어냅니다.
핵심 아키텍처 요약 카드
* Autoregressive Reasoner (이성적 추론기):
* 역할: 물리적 상황 파악 및 논리적 계획 수립 (수석 건축가)
* 특징: 시각 언어 모델(VLM) 역할을 수행하여 장면을 설명하고, 물리적 인과관계를 추론하며, 다음 행동의 지침 토큰을 생성합니다.
* Diffusion Generator (시각적 상상기):
* 역할: 물리 법칙에 부합하는 미래 상태 시각화 (전문 시공자)
* 특징: 추론기로부터 주입된 토큰 가이드를 바탕으로 노이즈를 제거하여 픽셀을 정제하고, 물리 기반의 고품질 비디오를 완성합니다.
Cosmos 3 파라미터 구성 및 검증된 성과
Cosmos 3는 요구되는 컴퓨팅 환경과 용도에 맞춰 두 가지 규모로 제공됩니다.
* Cosmos 3 Nano (16B): 총 160억 개 파라미터 (8B 추론기 + 8B 생성기). 비교적 경량화되어 뛰어난 추론 효율성을 제공합니다.
* Cosmos 3 Super (64B): 총 640억 개 파라미터 (32B 추론기 + 32B 생성기). 대규모 매개변수를 바탕으로 대단히 강력하고 정밀한 물리 세계 추론 능력을 보여줍니다.
Cosmos 3는 그 우수성을 입증하여 11개 이상의 주요 벤치마크 및 9개 리더보드에서 1위를 차지했습니다. 특히 고정 카메라 영상의 물리적 정황과 객체 이해도를 평가하는 **'Vantage Bench'**에서 오픈 모델 중 최고의 성과를 거두었습니다.
이처럼 강력한 모델 아키텍처를 갖춘 Cosmos 3는 단순히 모델 하나로 끝나지 않고, 개발자들이 마음껏 활용할 수 있는 전체 플랫폼 생태계로 확장됩니다.
5. 오픈 생태계와 활용 도구: 개발자를 위한 Cosmos 3 플랫폼
NVIDIA는 Cosmos 3를 개방형 라이선스인 Open MDW 1.1 License로 공개했습니다. 개발자들은 모델 가중치뿐만 아니라 학습에 사용된 멀티 테라바이트(TB) 규모의 물리 AI 데이터셋과 사후 학습(Post-training) 코드 스크립트 전체를 자유롭게 수정하고 상업적으로 활용할 수 있습니다.
┌─────────────────────────────────────┐
│ Cosmos 3 Open Platform Ecosystem │
└──────────────────┬──────────────────┘
┌───────────────────────────┼───────────────────────────┐
▼ ▼ ▼
[ Framework ] [ Curator ] [ Evaluator ]
• 추론 및 SFT 수행 • GPU 가속 데이터 가공 • 헐루시네이션 검증
• 행동 정책 파이프라인 • VLM 자동 캡셔닝 • 물리 오류 체커 (4종)
Cosmos 플랫폼을 구성하는 핵심 3대 도구
* Framework (프레임워크):
* 모델 추론 실행 및 사용자의 독자적인 데이터셋을 학습시킬 수 있는 사후 학습(Post-training/SFT) 코드를 제공합니다. 비전 및 추론기 정렬 학습뿐만 아니라 로보틱스 액션 정책 학습을 지원합니다.
* Curator (큐레이터):
* 방대한 양의 비디오 데이터를 GPU 가속 기반으로 빠르게 분할 및 디코딩하고, 최신 VLM을 활용해 가공 및 캡셔닝(Captioning)을 자동화합니다. 수개월이 걸리던 데이터 가공 프로세스를 단 며칠로 단축시킵니다.
* Evaluator (에발루에이터):
* 생성된 비디오가 물리 법칙을 잘 따르는지 검증합니다. 헐루시네이션(환각) 체커, 장애물 지속성 체커, VLM 조건 체커 등 4가지 자동 검사 도구를 통해 물리적 오류가 있는 합성 데이터를 선별해냅니다.
주요 활용 사례 및 샘플 모델
* 로보틱스 (Robotics): 로봇 팔의 물체 조작(Manipulation) 정책 학습에 활용됩니다. 특히 Hugging Face에 공개된 **NanoPolicyDroid**는 오픈 로보틱스 데이터셋인 Droid를 기반으로 사후 학습된 대표적인 로봇 조작 정책 샘플 모델로, 개발자들이 즉시 참조할 수 있는 훌륭한 이정표입니다.
* 자율주행 (Autonomous Vehicles): 도로 위 폭우, 빙판길, 돌발 충돌 등의 위험 시나리오를 가상 생성하고 주행 액션 궤적을 안전하게 사전 검증합니다.
* 스마트 시티 및 스마트 공장 (Smart Cities & Industry): Milestone(비디오 관리 시스템)이나 Levitas(전력망 점검)와 같은 기업들은 Cosmos 3를 활용해 전신주 기울어짐 감지, 전력선 손상 등 물리적 이상 징후를 감지하고 자율 분석하는 시스템을 구축하고 있습니다.
6. 결론 및 학습 요약: 물리 AI 시대를 맞이하는 학습자의 자세
이번 입문서를 통해 우리는 화면 속 AI를 넘어 현실 세계의 물리 법칙을 이해하고 작동하는 물리 AI와 세계 모델의 핵심 원리를 함께 살펴보았습니다.
📝 물리 AI 학습자를 위한 3가지 핵심 인사이트
1. 물리 AI와 데이터 한계 극복: 데이터 수집이 어렵고 위험한 현실 세계의 한계를 극복하기 위해, 세계 모델은 연산(Compute)을 데이터로 변환하여 물리 법칙에 부합하는 가상 시뮬레이션 학습을 가능하게 합니다.
2. Cosmos 3의 추론+생성 연합 아키텍처: 이성적 추론기(Autoregressive Reasoner)와 시각적 상상기(Diffusion Generator)가 공유 주의 레이어로 결합된 'Mixture of Transformers' 구조를 통해 물리적 환각 없는 미래를 예측합니다.
3. 액션 중심의 오픈 생태계: 액션(Action)을 1등 시민으로 다루어 3가지 모드(Forward, Inverse, Policy)로 정밀 제어를 수행하며, Open MDW 1.1 라이선스를 통해 프레임워크·큐레이터·에발루에이터 플랫폼 전체를 개발자에게 전면 개방합니다.
물리 AI는 이제 막 거대한 변화의 문을 열었습니다. 컴퓨터 화면 속에서 텍스트와 이미지를 다루던 AI가, 이제는 중력과 마찰력을 이해하고 현실 세계의 로봇과 기계들을 직접 안전하게 움직이는 시대로 진입한 것입니다. Open MDW 라이선스로 개방된 세계 기초 모델과 플랫폼 도구들을 직접 탐구해 보면서, 현실 세계를 바꿀 차세대 AI 혁신의 주인공으로 첫걸음을 내딛으시기를 응원합니다!
NVIDIA Cosmos 3 심층 기술 역량 분석서: 트랜스포머 혼합(MoT) 아키텍처와 물리 AI 시뮬레이션의 혁신
1. 서론: 물리 AI 데이터 부족 문제와 세계 기반 모델(World Foundation Model)의 필요성
물리 AI(Physical AI)는 자율주행차, 다기능 로보틱스, 스마트 시티 인프라, 도심 감시 스마트 카메라 및 드론 등 물리적 실체와 실시간으로 상호작용하는 지능형 체화 에이전트(Embodied Agents)의 중추적인 뇌 역할을 수행합니다. 그러나 물리 AI 시스템을 학습시키는 과정에서 가장 본질적인 걸림돌은 실제 실세계 데이터의 치명적인 희소성(Data Scarcity)입니다. 무한하고 예측 불가능한 현실 세계의 모든 시나리오를 직접 수집하고 데이터화하는 것은 경제적·시간적 비용 측면에서 한계가 명확하며, 시스템의 안전성과 직결된 희귀 상황(Edge Cases)을 실물로 안전하게 포착하는 것은 사실상 불가능합니다.
기존 데이터 수집 파이프라인의 한계점은 다음과 같이 진단할 수 있습니다:
* 원거리 조종(Tele-operation): 작업자가 인터페이스를 통해 직접 행동을 연기하고 기록하는 수동적 방식으로, 데이터 수집 속도가 사람의 작업 시간에 고정되어 확장성(Scalability)이 낮고 막대한 인적 비용이 발생합니다.
* 물리적 시뮬레이션(Physical Simulation): 제어된 수식 환경을 제공하지만, 복잡한 비선형적 실세계 물리 현상, 유체·변형체 상호작용 및 시각적 질감의 무한한 변수를 완전하게 모사하는 데 한계가 존재합니다.
* 인터넷 스케일 데이터(YouTube 등) 및 자체 수집 데이터: 대용량 비디오 확보는 용이하나, 로봇 제어 및 체화된 상호작용에 필수적인 고차원 제어 신호(Action)와 정밀한 물리적 인과관계 주석이 결여되어 있습니다.
이러한 수집 한계를 극복하기 위해 물리 AI 연구 및 아키텍처 설계 영역에서는 **"연산이 곧 데이터다(Compute is Data)"**라는 패러다임 전환이 강력히 요구되고 있습니다. 즉, 실제 환경에서의 위험하고 비효율적인 수집 대신 계산 자원을 활용하여 물리법칙에 부합하는 고품질 데이터와 미래 상태를 직접 생성하는 세계 기반 모델(World Foundation Model)이 전략적 핵심 요소로 부상했습니다.
기존 파이프라인의 파편화 한계 Cosmos 3 중심의 통합 파이프라인
시각 이해(VLM), 시뮬레이션(Generator), 행동 제어(Policy) 모델이 파편화되어 데이터 전달 단절 및 지연 발생 단일 세계 기반 모델 내에서 의미론적 시각 추론, 물리 일관적 미래 생성, 엔드투엔드 액션 제어를 통합
실세계 데이터 수집 비용 폭증 및 엣지 케이스 확보 불가 연산 기반 합성 데이터 생성 및 고정밀 시뮬레이션을 통한 완전한 폐루프(Closed-loop) 학습 달성
NVIDIA Cosmos 3는 시각 언어 모델(VLM), 비디오 생성기, 물리 시뮬레이터, 제어 정책 모델로 파편화되어 있던 이종 파이프라인을 단일 시스템 내로 흡수하는 오픈 프론티어 옴니모달(Omnimodal) 세계 기반 모델입니다. 데이터 부족 문제를 연산 기반 시뮬레이션으로 해결하는 Cosmos 3의 학습 패러다임은 아키텍처 설계 단계에서부터 추론과 생성을 하나로 결합하는 혁신적인 구조적 변화를 이끌어냈습니다.
2. 트랜스포머 혼합(Mixture of Transformers, MoT) 아키텍처의 심층 분석
Cosmos 3는 오토레그레시브(Auto-Regressive, AR) 트랜스포머와 디퓨전(Diffusion) 트랜스포머를 유기적으로 결합한 트랜스포머 혼합(Mixture of Transformers, MoT) 아키텍처를 최초로 도입했습니다. 기존 세계 모델들이 시각적 미래 생성을 위해 디퓨전 모델에만 의존하거나 상황 인식을 위해 AR 모델만을 독립적으로 사용했던 구조적 한계를 넘어서, MoT 아키텍처는 깊이 있는 인과적 추론 능력과 물리 일관적 영상 생성 능력을 단일 네트워크 내에서 동시에 구현합니다.
[ 입력 모달리티: 텍스트 / 이미지 / 비디오 / 오디오 / 액션 토큰 ]
│
▼
┌──────────────────────────────────────────────┐
│ AR Transformer Tower (Reasoner) │
│ - 시각/언어/액션 상계 인과 추론 및 행동 계획 │
└──────────────────────┬───────────────────────┘
│ Shared Attention Layers
│ (공유 어텐션 레이어를 통한 신호 제어)
▼
┌──────────────────────────────────────────────┐
│ Diffusion Transformer Tower (Generator) │
│ - 물리적 일관성 유지 고품질 픽셀/비디오 디노이징 │
└──────────────────────┬───────────────────────┘
│
▼
[ 출력 모달리티: 비디오 / 오디오 결합 비디오 / 액션 궤적 토큰 ]
이중 타워(Two-Tower) 메커니즘 분석
Cosmos 3의 MoT 아키텍처는 두 개의 특화된 트랜스포머 타워로 구성됩니다:
1. AR 트랜스포머 타워 (Reasoner): 입력된 픽셀, 액션, 오디오, 텍스트 흐름을 공간적·시간적 토큰으로 변환하여 매 타임스텝마다 시공간적 인과관계, 물리 법칙 준수 여부, 행동 시퀀스를 자발적으로 추론하고 정교한 내부 지시어(Internal Guidance)를 형성합니다.
2. 디퓨전 트랜스포머 타워 (Generator): AR 타워가 생성한 공간적 추론 및 조건부 표현을 인계받아 잠재 노이즈로부터 물리 법칙에 부합하는 정밀한 미래 시각 프레임과 비디오를 역확산(Denoising) 과정을 거쳐 모사·생성합니다.
두 타워 사이에는 **공유 어텐션 레이어(Shared Attention Layers)**가 촘촘히 배치되어 있습니다. AR 타워의 시각적·물리적 인지 토큰과 고차원 인과 신호는 공유 어텐션 메커니즘을 통해 디퓨전 타워의 이미지/비디오 생성 프로세스 전체를 밀착 제어합니다. 이를 통해 디퓨전 단독 모델에서 빈번히 발생하는 물리적 환각(Hallucination) 현상을 획기적으로 억제하고, 정밀한 원인-결과 기반의 상태 변화를 시각화할 수 있습니다.
모델 스케일 및 파라미터 규격 비교
Cosmos 3는 온디바이스 에지 배포부터 대규모 합성 데이터 생성 인프라까지 커버하기 위해 Nano와 Super 두 가지 기본 컴퓨팅 스케일로 제공됩니다.
기술 규격 및 활용 파라미터 Cosmos 3 Nano Cosmos 3 Super
총 파라미터 수 (Total Parameters) 16B (160억 개) 64B (640억 개)
AR 추론 타워 (AR Reasoner Tower) 8B (80억 개) 32B (320억 개)
디퓨전 생성 타워 (Diffusion Generator Tower) 8B (80억 개) 32B (320억 개)
목적 및 연산 효율성 평가 온프레미스 제어기, 초저지연 에지 추론, 자원 제약적 엣지 서버 환경 최적화 최고 수준의 물리 법칙 준수, 대규모 합성 데이터 생성 파이프라인 및 고정밀 시뮬레이터
허깅페이스(Hugging Face) 공개 5대 모델 변종(Variants)
NVIDIA는 오픈 생태계 기여를 위해 허깅페이스를 통해 Cosmos 3의 5가지 핵심 변종 파형을 공식 배포했습니다:
1. Cosmos 3 Nano (16B): 빠른 응답 속도와 저전력 추론이 필요한 체화 시스템을 위한 경량화 이중 타워 모델.
2. Cosmos 3 Super (64B): 극도로 높은 물리적 정확도와 복잡한 환경 추론을 보장하는 대규모 기본 모델.
3. Text-to-Image Agentic Super: 도시 인프라 및 스마트 팩토리의 이상 징후, 표면 결함(Defect) 이미지를 에이전트 기반으로 정밀 생성하는 특화 모델.
4. Image-to-Video Agentic Super: 단일 프레임 관측값과 조건을 입력받아 시간적 일관성을 지닌 동적 미래 시뮬레이션 비디오를 생성하는 모델.
5. Nano-Policy-Droid: Droid 데이터셋을 기반으로 사후 학습(Post-training)되어 로봇 조작(Manipulation) 제어 명령을 직접 출력하는 샘플 정책(Policy) 모델.
이와 같은 아키텍처의 우수성은 단순 정적 시각 정보 분석을 넘어, 시스템이 물리적 행동 제어 신호(Action)를 직접 인지하고 출력하는 다중 모달리티 확장의 기반이 됩니다.
3. 액션(Action)의 1등 시민화와 세계 액션 모델(World Action Model) 구현
Cosmos 3의 핵심 아키텍처 혁신은 **'액션(Action)'을 보조적 후처리 파라미터가 아닌 모델 내부의 1등 시민(First-class citizen)**으로 모달리티 수준에서 통합했다는 점입니다. 기존 비디오 생성 모델은 연속된 픽셀 변환만을 학습하지만, Cosmos 3는 입력과 출력 공간 양쪽에서 텍스트, 이미지, 비디오, 오디오와 함께 액션 텐서를 동시 처리함으로써 폐루프(Closed-loop) 제어를 완벽히 지원하는 **세계 액션 모델(World Action Model, NVIDIA OmniDreams의 핵심 중추)**을 실현합니다.
3대 액션 작동 모드 평가
Cosmos 3는 로보틱스 및 자율주행 파이프라인의 핵심 니즈에 따라 세 가지 독자적인 신경망 작동 모드를 지원합니다:
[1. 순방향 역학 (Forward Dynamics)]
관측 프레임 (Frame_t) + 연속 액션 입력 (Action_t:t+k) ───► 미래 비디오 시뮬레이션 생성 (Frame_t+k)
[2. 역방향 역학 (Inverse Dynamics)]
실세계/시뮬레이션 입력 비디오 (Video Stream) ───► 행동 제어 신호 역추출 (Action Annotations)
[3. 정책 플래너 (Policy Mode)]
현재 관측 프레임 (Frame_t) + 과제 지시문 (Task Prompt) ───► 미래 실행 액션 청크 예측 (Action_t:t+k)
1. 순방향 역학 (Forward Dynamics - 신경망 시뮬레이터):
* 메커니즘: 초기 관측 프레임과 제어기로부터 전달받은 연속 액션 입력값을 유기적으로 결합하여, 해당 행동이 실행되었을 때 실제 물리계에서 펼쳐질 미래 비디오 시뮬레이션을 생성합니다.
* 시스템적 의의: 제어 정책을 실물 디바이스에 적용하기 전, 가상 공간에서 행동의 결과를 사전 시뮬레이션하는 비전 기반 신경망 시뮬레이터 역할을 수행합니다.
2. 역방향 역학 (Inverse Dynamics - 신경망 기반 역역학 주석 엔진):
* 메커니즘: 라벨링되지 않은 방대한 양의 입력 비디오 영상 시퀀스로부터 내부 주체(로봇 관절, 자율주행 차량)가 취한 물리적 행동 제어 신호를 역으로 정밀 추출(Auto-annotation)합니다.
* 시스템적 의의: 인터넷 스케일 및 관측 비디오 데이터셋으로부터 정밀 제어 데이터를 자동 라벨링하는 고성능 자동 주석 엔진 역할을 담당합니다.
3. 정책 (Policy - 엔드투엔드 액션 정책 플래너):
* 메커니즘: 현재 시각 관측 프레임과 자연어 과제 지시문(Task Description)을 수신하여, 에이전트가 즉시 실행해야 할 미래 액션 시퀀스를 직접 출력합니다.
* 시스템적 의의: 로봇 조작(Manipulation) 및 주행 제어를 위한 엔드투엔드 신경망 플래너로 작동합니다.
액션 청킹(Action Chunking), 시간 축 틱(Ticks) 및 잠재 공간 분석
Cosmos 3 내부에서 액션은 단일 프레임 신호가 아닌 4,096차원의 공유 잠재 액션 토큰(Shared Latent Action Token) 형태로 관리됩니다.
* 시간 축 틱(Ticks) 및 액션 청킹(Action Chunking): 액션 예측은 단일 타임스텝 제어에 국한되지 않고, 미래 궤적 전체를 포괄하는 시간 축 틱(Ticks) 기반의 액션 청크(Action Chunk) 단위로 실행됩니다. 하나의 틱은 모델이 미래 행동을 정밀히 추론하는 단위 시간이며, 액션 청킹 메커니즘을 통해 제어의 시간적 지평(Action Horizon)을 획기적으로 확장하여 단기 진동 현상을 방지하고 안정적인 연속 제어를 보장합니다.
* 도메인 인지 선형 프로젝션(Domain-aware Linear Projection): 4,096차원의 잠재 액션 토큰은 추론 단계에서 도메인 ID에 따라 선형 프로젝션 레이어를 거쳐, 20개 이상의 로봇 매니퓰레이터, 자율주행 차량, 무인 항공기 등 이종의 체화 형태(Embodiments)에 맞춘 고유 텐서 구조로 변환됩니다.
* 말단 장치(End-effector) 궤적 및 관절각(Joint Angle) 텐서 변환: 프로젝션 텐서는 로봇 말단 장치(End-effector)의 3D 공간 위치·속도 벡터 표현뿐만 아니라, 로봇 다축 관절각(Joint Rotations) 텐서 변환 형태를 모두 지원합니다.
* 6차원 회전 벡터(6D Rotations)의 수학적 연속성: 3D 회전 표현 시 오일러 각(Euler Angles)이나 쿼터니언(Quaternions)이 갖는 위상적 불연속성(Discontinuity)과 짐벌락(Gimbal Lock) 문제를 해결하기 위해 6차원 회전 벡터 표기법을 채택했습니다. 이를 통해 신경망 학습 시 경사도(Gradient)의 파열 없이 매끄럽고 연속적인 물리적 궤적 생성을 보장합니다.
이러한 액션 통합 아키텍처의 유효성은 객관적인 글로벌 벤치마크 성과를 통해 명확히 검증되었습니다.
4. 벤치마크 성과 검증 및 정량적 평가
Cosmos 3는 세계 기반 모델 및 물리 AI 영역의 정량적 평가에서 11개 이상의 주요 벤치마크 우승 및 9개 글로벌 리더보드 1위를 석권하며 압도적인 성능 우위를 입증했습니다.
[ Cosmos 3 정량적 검증 성과 ]
┌─────────────────────────────────────────────────────────┐
│ • 11개 이상 글로벌 벤치마크 우승 │
│ • 9개 주요 리더보드 Top 1 석권 │
└────────────────────────────┬────────────────────────────┘
│
┌────────────────────────────┴────────────────────────────┐
│ [시각 추론 & VLM] │
│ • VantageBench: 고정 카메라 영상 이해 최고 오픈 모델 달성 │
│ │
│ [세계 시뮬레이션 & 비디오 생성] │
│ • 물리 법칙 준수율 및 시공간 연속성 벤치마크 1위 │
│ │
│ [로보틱스 & 액션 제어] │
│ • RoboLab 및 LureLab / Droid 리더보드 최고 성능 기록 │
└─────────────────────────────────────────────────────────┘
분야별 성과 분석 및 고정 카메라 특화 'VantageBench'
* VLM 시각적 이해 영역 (VantageBench 최고 오픈 모델): 고정 설치 카메라(Fixed-camera Footage) 영상 분석 및 모니터링 능력에 특화된 비디오 이해 벤치마크인 **'VantageBench'**에서 Cosmos 3는 기존 프론티어 오픈 모델들을 완전히 능가하며 최고의 오픈 모델(Top Open Model) 자리에 올랐습니다. 이는 스마트 시티 카메라, 창고 고정 모니터링 센서, 산업 현장 안전 감시 모듈에서 뛰어난 객체 추적, 공간 인지, 상황 추론 역량을 발휘함을 증명합니다.
* 세계 시뮬레이션 생성 영역: 텍스트 및 이미지 기반 비디오 생성 시 시간적 일관성(Temporal Consistency), 조명 변화 준수, 물리학적 상호작용 평가 항목 전반에서 최고 점수를 획득했습니다.
* 로봇 제어 및 액션 영역: 최신 로봇 제어 평가 벤치마크인 RoboLab 및 LureLab / Droid 리더보드에서 기존 정책 모델 대비 압도적인 성공률을 기록하며 최첨단 로봇 정책 생성을 위한 강력한 기반 모델임을 입증했습니다.
물리적 일관성 및 환각(Hallucination) 제어 평가
기존의 단독 디퓨전 비디오 생성 모델은 비디오 생성 과정에서 물체가 소멸하거나, 충돌 후 궤적이 비물리적으로 일그러지는 환각 현상이 고질적으로 발생했습니다. 반면, Cosmos 3의 MoT 구조는 AR 타워가 물리 법칙과 원인-결과 관계를 사전에 인과적으로 추론하고, 이를 공유 어텐션을 통해 디퓨전 타워의 디노이징 단계로 직접 투입합니다. 그 결과, 생성된 시뮬레이션 내 장애물의 지속성(Obstacle Persistence) 및 시공간 일관성이 비약적으로 향상되었으며 물리적 환각을 통제하는 데 성공했습니다.
이러한 정량적 성능 우수성을 실무 엔지니어링에 즉시 적용할 수 있도록 지원하는 소프트웨어 생태계 구축이 이어서 요구됩니다.
5. 엔드투엔드 개발 플랫폼 생태계: Framework, Curator, Evaluator
NVIDIA Cosmos 3는 단순히 가중치만을 공개하는 것에 그치지 않고, 데이터 정제부터 모델 사후 학습, 정밀 평가 및 필터링에 이르는 전 과정을 지원하는 모듈식 개발 플랫폼으로 구성되어 있습니다.
플랫폼 구성 요소별 세부 역량 분석
1. Cosmos Framework:
* 역할: 추론(Inference) 및 사후 학습(Post-training)을 구동하는 오픈소스 분산 학습·추론 환경입니다.
* 핵심 기능: 비전 SFT(Supervised Fine-Tuning: T2V, I2V, V2V 지원), 대화형 조력자 톤으로 응답을 정렬하는 추론기 정렬(Reasoner Alignment), Droid 기반 로봇 조작 제어 정책 학습(Action Policy Training) 스크립트를 제공합니다.
* 프롬프트 업샘플러(Prompt Upsampler): 개발자가 입력한 1~2줄의 단순 텍스트 지시어를 디퓨전 생성에 최적화된 고해상도 물리·시각 프롬프트로 자동 확장·보정하는 Prompt Upsampler 파이프라인을 내장하고 있습니다.
2. Cosmos Curator:
* 역할: GPU 가속 기반의 대규모 비디오 데이터 정제 및 자동 라벨링 파이프라인입니다.
* 핵심 기능: 대용량 수집 비디오의 GPU 디코딩, 장면 분할, 품질 필터링을 수행하며, 최첨단 VLM을 결합하여 고밀도 캡션(Dense Captioning) 및 행동 주석을 자동 생성합니다. 기존 수개월이 소요되던 데이터 커레이션 기간을 단 며칠 수준으로 단축시킵니다.
3. Cosmos Evaluator:
* 역할: 합성 생성된 비디오 및 제어 데이터의 품질과 물리적 타당성을 검증하는 정밀 필터링 시스템입니다.
* 핵심 기능:
* 환각 검사기(Hallucination Checker): 생성 영상 내 비물리적 찌그러짐 및 시각 오류 검출.
* 장애물 지속성 검사기(Obstacle Checker): 프레임 전환 간 객체, 사람, 구조물의 소멸 여부 및 시공간 유지성 검증.
* VLM 상태 검사기(VLM Checker): 조명, 날씨, 도로 조건 등이 프롬프트 사양에 부합하는지 평가.
[ raw 미정제 비디오 데이터 ]
│
▼
┌───────────────────────┐
│ Cosmos Curator │ ──► GPU 가속 정제 & VLM 기반 자동 주석 생성
└───────────┬───────────┘
▼
┌───────────────────────┐
│ Cosmos Framework │ ──► 추론/사후 학습 (SFT/Policy) & Prompt Upsampler
└───────────┬───────────┘
▼
┌───────────────────────┐
│ Cosmos Evaluator │ ──► 환각 / 객체 지속성 / VLM 환경 상태 검증
└───────────┬───────────┘
▼
[ 검증된 고품질 물리 AI 모델 및 데이터셋 ]
시스템 배포 아키텍처: 물리 AI의 '3대 컴퓨터 문제 (Three-Computer Problem)'
물리 AI 시스템의 학습 및 배포 과정은 단일 컴퓨팅 노드로 완결되지 않으며, 아키텍트 시각에서 다음의 3대 컴퓨터 문제(Three-Computer Problem) 인프라 토폴로지로 분생 결합됩니다:
┌─────────────────────────────────────────────────────────────────────────┐
│ 물리 AI의 3대 컴퓨터 토폴로지 │
├─────────────────────────────────────────────────────────────────────────┤
│ 1. 학습/사후 학습 컴퓨터 (Training Compute): │
│ - 대규모 NVIDIA H100 / B200 클러스터 │
│ - Cosmos 3 대형 모델 분산 학습, SFT 및 Reasoner Alignment 수행 │
│ │
│ 2. 시뮬레이션 컴퓨터 (Simulation Compute): │
│ - NVIDIA Omniverse / Isaac Sim / Isaac Lab 기반 │
│ - 물리 법칙 준수 가상 환경 구축, 대규모 합성 데이터 및 폐루프 정책 검증 │
│ │
│ 3. 에지 추론 컴퓨터 (Edge Inference Compute): │
│ - NVIDIA Jetson Orin / DGX Spark (차세대 에지 컴퓨팅) │
│ - 실물 로봇 및 자율주행 차량 탑재, 온보드 초저지연 실시간 액션 제어 추론 │
└─────────────────────────────────────────────────────────────────────────┘
Open MDW 1.1 라이선스 및 실제 산업군 채택 사례 (Adopters)
Cosmos 3 플랫폼 전체는 Open MDW 1.1 (Model Developer License) 아래 전면 공개되었습니다. 개발자는 모델 가중치뿐만 아니라 수 테라바이트(TB) 규모의 데이터셋(디지털 휴먼, 물리 상호작용, 창고 작업, 자율주행 데이터)과 사후 학습 스크립트에 자유롭게 접근하고 커스텀 도메인으로 파인튜닝할 수 있습니다.
이러한 개방성은 실제 산업 현장의 혁신 사례로 입증되고 있습니다:
* 마일스톤 (Milestone): 세계적인 비디오 관리 시스템(VMS) 기업으로, 자사의 글로벌 솔루션인 XProtect에 Cosmos 3를 미세조정 적용하여 영상 기반 상황 인지 및 실시간 보안 리포팅 기능을 고도화했습니다.
* 레비타스 (Levitas): 자율 로봇 기반 인프라 점검 기업으로, 전력망 및 전주(Electric Pole)의 기울기(Tilt) 및 손상을 로봇이 촬영한 영상으로 인지하고 판단하는 지능형 검사·리포트 시스템 구축에 Cosmos 3를 채택했습니다.
6. 결론: 물리 AI 구현을 위한 Cosmos 3의 전략적 시사점
NVIDIA Cosmos 3 심층 기술 역량 분석을 종합하면, Cosmos 3는 단순한 비디오 생성기나 비전 언어 모델의 한계를 넘어 실제 물리 환경을 인지, 추론, 생성, 제어하는 차세대 물리 AI의 핵심 기술적 기반을 제시하고 있습니다.
핵심 기술 경쟁력 총괄 요약
* MoT 아키텍처의 혁신성: 오토레그레시브(AR) 트랜스포머의 인과적 추론 및 계획 능력과 디퓨전 트랜스포머의 물리 일관적 고품질 생성 역량을 공유 어텐션으로 이중 결합하여 물리적 환각을 통제했습니다.
* 액션(Action)의 기본 모달리티 통합: 4,096차원 잠재 액션 토큰, 시간 축 틱(Ticks) 기반 액션 청킹, 6D 회전 벡터 투영을 통해 다양한 체화 환경(Embodiments)에 즉시 적용 가능한 세계 액션 모델(World Action Model)을 구축했습니다.
* 3대 컴퓨터 인프라 및 전주기 오픈 생태계: Curator, Framework, Evaluator 도구 모음과 Open MDW 1.1 라이선스를 결합하여, H100 학습-Omniverse 시뮬레이션-Jetson 에지 배포로 이어지는 '3대 컴퓨터 문제' 구조를 완벽하게 지원합니다.
물리 AI 연구진 및 엔지니어를 위한 전략적 실행 가이드라인
물리 AI 및 자율 시스템 개발을 주도하는 연구진과 AI 시스템 아키텍트는 Cosmos 3 플랫폼을 활용하여 다음 3단계 실행 가이드라인을 추진해야 합니다:
1. 에지 케이스 관측 및 합성 데이터 생성 구축: 실세계 수집이 불가능한 위험 및 희귀 시나리오를 Cosmos 3의 순방향 역학(Forward Dynamics) 모드로 합성 생성하고, Cosmos Evaluator의 3중 검사기(Hallucination, Obstacle, VLM Checker)를 통해 정제된 학습 데이터 세트를 확보하십시오.
2. 도메인 특화 사후 학습(Post-training) 가속: Cosmos Framework에서 제공하는 Vision SFT 및 Droid 데이터셋 기반 정책 학습 스크립트를 활용하여, 자체 보유한 로봇 형태(Embodiment)나 산업 특화 비전 AI 에이전트에 맞춰 가중치를 정밀 미세조정(Fine-tuning)하십시오.
3. Omniverse 기반 폐루프(Closed-loop) 제어 검증: Cosmos 3를 신경망 시뮬레이터 및 엔드투엔드 정책 플래너로 활용하여, 실물 에지 디바이스(Jetson/DGX Spark) 배포 전 가상 환경에서 물리적으로 안전하고 검증된 에이전트를 개발·검증하십시오.
NVIDIA Cosmos 3 기반 물리 AI 및 자율 로보틱스 시스템 통합 청사진
1. 엔터프라이즈 물리 AI 개발을 위한 전략적 패러다임 전환
글로벌 도입 맥락 및 전략적 중요성
물리 세계와 직접 상호작용하는 자율 로봇, 자율주행차(AV), 도심 항공 모빌리티(UAM) 및 지능형 산업 자동화 시스템 등 물리 AI(Physical AI) 개발 현장은 극심한 '데이터 희소성(Data Scarcity)'이라는 구조적 난제에 직면해 있습니다. 현실 환경에서의 물리 데이터 수집은 천문학적인 비용과 물리적 위험을 수반하며, 수동 텔레오퍼레이션(Teleoperation)이나 단순 현장 녹화 방식만으로는 무한하고 예측 불가능한 실제 환경의 예외 상황(Edge Cases)을 충분히 수집하는 것이 불가능합니다.
이러한 한계를 극복하기 위해 엔터프라이즈 물리 AI 개발의 핵심 패러다임은 **"연산이 곧 데이터다(Compute is Data)"**라는 전략적 방향으로 전환되고 있습니다. 즉, 고성능 컴퓨팅 자원을 투입하여 물리 법칙을 준수하는 정밀한 미래 상태 및 관측 데이터를 능동적으로 창출하는 것입니다. 기존의 파편화된 비전-언어 모델(VLM), 비디오 생성기, 로봇 제어 정책(Policy) 모델을 개별적으로 구축하고 검증하던 방식은 막대한 시스템 통합 비용과 데이터 불일치를 초래합니다.
단일 오므니모델(Omnimodal) 월드 파운드이션 플랫폼인 NVIDIA Cosmos 3는 단순한 모델 가중치에 그치지 않고, 디지털 휴먼, 물리적 상호작용, 임보디드 창고 물류, 자율주행 드라이빙 데이터 등을 아우르는 Multi-TB 규모의 오픈 물리 AI 데이터셋과 사전 학습 가중치, 그리고 파인튜닝 파이프라인을 일체형으로 제공합니다. 이를 통해 엔터프라이즈는 파편화된 파이프라인을 단일 오므니모델 기반으로 통합함으로써 개발 리소스를 비약적으로 절감하고, Sim-to-Real 갭을 최소화하는 물리적 타당성을 확보할 수 있습니다.
[ 기존 파편화 파이프라인 (Fragmented Pipeline) ]
[ 별도 VLM (지각) ] + [ 비디오 생성기 (시뮬레이션) ] + [ 개별 정책 모델 (제어) ]
│
▼ (높은 통합 복잡성 및 데이터 표류 발생)
--------------------------------------------------------------------------------
[ Cosmos 3 단일 오므니모델 플랫폼 (Unified Platform) ]
dynamic MoT (AR 추론 타워 + Diffusion 생성 타워) ──> 물리 법칙 기반 지각·계획·생성 일재화
혼합 트랜스포머(Mixture of Transformers, MoT) 아키텍처 분석
Cosmos 3는 물리 세계의 복잡한 역학 구조와 물리 법칙을 정밀하게 학습하기 위해 혼합 트랜스포머(Mixture of Transformers, MoT) 아키텍처를 도입했습니다. MoT 구조는 지각과 추론을 담당하는 타워와 정밀한 시각 생성을 담당하는 타워를 유기적으로 결합합니다.
* Auto-regressive (AR) 추론 타워 (Reasoning Tower): 텍스트, 이미지, 비디오, 오디오, 액션 토큰 등 다중 모달리티 입력을 수용하여 상황을 공간적·시간적으로 해석하고, 인과적 계획(Causal Planning)을 수립합니다.
* Diffusion 생성 타워 (Generative Tower): AR 타워의 추론 및 상태 예측에 기반하여 정밀한 물리 법칙이 적용된 고해상도 미래 관측 비디오 및 프레임을 생성합니다.
* 공유 주의 메커니즘 (Shared Attention Layer)을 통한 직접 제어: 두 타워 사이에는 공유 주의 레이어가 유기적으로 배치되어 있습니다. AR 타워가 파악한 시각적 지각(Perception)과 물리적 상식 논리가 Shared Attention Layer를 통해 Diffusion 타워의 프레임 렌더링 과정을 **직접 제어(Direct Control)**합니다. 이를 통해 기존 생성 모델에서 빈번하게 발생하는 시각적 환각(Hallucination) 및 물리적 오류를 원천 차단하고, 실제 물리 법칙에 상응하는 미래 상태 영상을 생성해냅니다.
플랫폼 비교 평가
비교 항목 파이프라인 혁신점
모델 파편화 해소 [기존] VLM, 비디오 생성기, 로봇 제어 정책을 개별 구축하여 연동 지연 및 데이터 형식 불일치 발생<br>[Cosmos 3] 단일 오므니모델(Omnimodal) 파이프라인으로 일재화하여 유지보수 복잡성 및 엔지니어링 오버헤드 완벽 제거
물리 법칙 기반 생성 [기존] 단순 픽셀 패턴 학습 기반 비디오 생성으로 시각적 환각 및 물리 법칙 위반(물체 관통, 중력 무시 등) 다발<br>[Cosmos 3] AR 타워의 물리적 추론 결과가 Shared Attention Layer를 통해 Diffusion 타워를 직접 제어함으로써 물리적 타당성 보장
오므니모달 입출력 지원 [기존] 단일 모달리티(텍스트-to-비디오 등) 중심 입출력 구조로 임보디드 시스템 적용 한계<br>[Cosmos 3] 텍스트, 이미지, 비디오, 오디오, 액션(Action)을 동시 입력받아 비디오, 오디오, 틱(Tick) 단위 제어 액션을 복합 생성
데이터 수집 한계 극복 [기존] 수동 텔레오퍼레이션 및 현장 녹화에 의존하여 희귀 예외 상황(Edge Cases) 수집 불가<br>[Cosmos 3] Multi-TB 오픈 데이터셋과 고성능 Compute를 활용해 무한한 물리 정밀 합성 데이터 및 시뮬레이션 환경 구축
라이선스 및 커스텀 자율성 [기존] 블랙박스 API 형태의 폐쇄형 모델로 도메인 특화 미세조정 및 온프레미스 배포 불가능<br>[Cosmos 3] Open MDW 1.1 라이선스를 통해 가중치, 학습 코드, 데이터셋, Post-Training 스크립트를 완전 개방하여 기업의 독자적 미세조정 보장
이와 같은 통합 오므니모델 구조 위에서 Cosmos 3가 달성한 가장 근본적인 아키텍처적 도약은 로보틱스 제어의 핵심인 '액션(Action)'을 다루는 방식의 변화에서 시작됩니다.
2. 차세대 자율 시스템의 의사결정 구조 혁신: '액션(Action)'의 1급 시민화
전략적 중요성 분석
기존의 로보틱스 및 자율 시스템 아키텍처에서 액션(Action)은 시각 모델 학습 이후 별도로 매핑되는 사후 출력값에 불과했습니다. 그러나 Cosmos 3에서는 액션이 픽셀, 언어, 오디오와 동일한 위상을 갖는 **'1급 시민(First-class Citizen)'**으로 모델 내부 아키텍처에 내재화되었습니다. 모델의 초기 사전 학습(Pre-training) 단계부터 제어 명령을 토큰 형태로 수용하고 처리함으로써, Cosmos 3는 환경의 시각적 상태 변화와 에이전트의 제어 명령 간의 직접적인 상호작용 및 물리적 인과관계를 학습합니다.
3가지 핵심 제어 모드(Control Modes)의 입출력 명세 및 역할
Cosmos 3는 다양한 로보틱스 및 자율주행 워크플로우에 대응하기 위해 3가지 제어 모드를 정밀한 입출력 규격으로 제공합니다.
1. 전방 역학 (Forward Dynamics - 신경망 시뮬레이터 / Neuro-simulator):
* 입출력 규격: [초기 관측 프레임 + 액션 토큰 시퀀스] \rightarrow [미래 관측 비디오 생성]
* 역할 및 가치: 특정한 제어 명령(액션)을 실행했을 때 물리 환경이 어떻게 변화할지 미래 영상으로 미리 예측 및 렌더링하는 신경망 시뮬레이터 역할을 수행합니다.
2. 역역학 (Inverse Dynamics - 신경망 어노테이터 / Neuro-annotator):
* 입출력 규격: [녹화된 관측 비디오 시퀀스] \rightarrow [액션 주석 및 토큰 추출]
* 역할 및 가치: 라벨이 지정되지 않은 대규모 관측 비디오 시퀀스로부터 영상 속 움직임을 유도한 제어 액션 값을 역으로 추론 및 주석화(Annotation)하는 신경망 어노테이터로 기능합니다.
3. 정책 (Policy - 신경망 플래너 / Neuro-planner):
* 입출력 규격: [현재 관측 프레임 + 작업 지시(Task Description)] \rightarrow [차세대 액션 예측]
* 역할 및 가치: 현재의 시각적 상태 및 작업 지시문에 기반하여 에이전트가 즉시 수행해야 할 최적의 액션 궤적을 예측하는 폐루프(Closed-loop) 제어용 신경망 플래너로 작동합니다.
[ Control Modes Data Flow ]
• Forward Dynamics : [ Frame(s) + Action Tokens ] ──> [ Future Video Generation ] (Neuro-simulator)
• Inverse Dynamics : [ Recorded Video Sequence ] ──> [ Action Tokens Extraction ] (Neuro-annotator)
• Policy : [ Current Frame + Task Desc ] ──> [ Next Action Prediction ] (Neuro-planner)
액션 토크나이징 및 도메인 투영 메커니즘 해부
서로 다른 기하학적 형태와 자유도를 갖는 다양한 로봇(매니퓰레이터, 휴머노이드, 자율주행차 등)에 대응하기 위해 Cosmos 3는 정밀한 액션 토크나이징 기하학 구조를 구현했습니다.
[ 공유 잠재 액션 토큰 (Shared Latent Action Token: ~4,096차원 연속적 실수 공간) ]
│
▼ (도메인 인지 선형 투영: Domain ID 매핑)
┌───────────────────────────────────┼───────────────────────────────────┐
│ │ │
▼ ▼ ▼
[ 매니퓰레이터 도메인 ] [ 자율주행차(AV) 도메인 ] [ 사용자 정의 로봇 도메인 ]
(6D 연속 회전 & 틱 청크) (3D 공간 궤적 & 속도) (20+ 기증 도메인 텐서)
* 공유 잠재 액션 토큰 (Shared Latent Action Token): 모델 내부 은닉 상태(Hidden Latent State) 내에서 약 4,096차원의 연속적 실수(Real Numbers) 공간으로 구성된 공통 액션 벡터를 유지합니다.
* 도메인 인지 선형 투영 (Domain-Aware Linear Projection): 특정 도메인 식별자(Domain ID)를 지정하면, ~4,096차원의 공유 잠재 토큰이 해당 임보디먼트(Embodiment)의 자유도 및 기하학 구조에 맞춘 타깃 텐서 형태(Tensor Shape)로 즉시 선형 투영됩니다. Cosmos 3는 기본적으로 **20개 이상의 도메인 사양(20+ Domains)**을 기증 및 표준 지원합니다.
* 6차원 회전(6D Rotations) 표현: 기존 3차원 오일러 각(Euler Angles)이나 쿼터니언(Quaternion) 방식이 지닌 불연속성(Discontinuity) 및 짐벌락 문제를 극복하기 위해, SO(3) 연속 회전 표현인 6차원 회전 표현 방식을 채택했습니다. 이는 신경망 학습 시 연속적인 벡터(Continuous Vector) 연산 효율을 극대화하여 제어 안정성을 제고합니다.
* 시간 축 액션 청킹 (Action Chunking / Ticks): 단순 단일 시점 출력을 넘어, 미래의 일련의 액션 시퀀스를 틱(Tick) 단위의 청크(Chunk) 형태로 묶어 추론함으로써 제어의 고주파 진동을 방지하고 매끄러운 물리적 구동을 보장합니다.
이러한 액션 기하학 연산 체계가 실제 엔터프라이즈 개발 워크플로우에 적용되기 위해서는 이를 뒷받침하는 3대 리포지토리 생태계와의 유기적 결합이 필수적입니다.
3. 3대 핵심 리포지토리 기반의 유기적 엔드투엔드 파이프라인 설계
통합 파이프라인 개요
엔터프라이즈 환경에서 Cosmos 플랫폼을 운용하기 위해서는 데이터 전처리부터 모델 사후 학습(Post-Training), 추론, 그리고 합성 데이터의 물리 검증까지 단일화된 파이프라인이 구축되어야 합니다. NVIDIA는 이를 위해 Curator, Framework, Evaluator의 3대 핵심 리포지토리를 제공합니다.
┌────────────────────────┐
│ Cosmos Curator │ ──> 대규모 비디오 GPU 가속 전처리 & VLM 자동 캡셔닝
└───────────┬────────────┘
│ (고품질 학습 데이터)
▼
┌────────────────────────┐
│ Cosmos Framework │ ──> 단일 추론 스크립트 실행 & Prompt Upsampler & Post-Training
└───────────┬────────────┘
│ (합성 비디오 & 제어 출력)
▼
┌────────────────────────┐
│ Cosmos Evaluator │ ──> 4대 전문 검증기 기반 물리 타당성 평가 & 데이터 표류 방지
└───────────┬────────────┘
│
└─────── (Closed-loop 환류: 검증된 고품질 데이터 재입력) ───────┘
3.1 데이터 가공 및 고품질화: Cosmos Curator
대규모 물리 AI 데이터셋 구축의 최대 병목은 관측 비디오 데이터의 디코딩, 정화 및 주석 작업입니다. Cosmos Curator는 완전한 GPU 가속 파이프라인을 제공합니다.
* GPU 가속 병렬 전처리: 비디오 디코딩, 프레임 스플리팅, 무의미한 프레임 제거 및 정화 작업을 GPU 상에서 병렬 처리하여, 수개월 이상 소요되던 데이터 큐레이션 기간을 단 수일 단위로 단축합니다.
* VLM 기반 자동 캡셔닝: 최신 비전-언어 모델을 탑재하여 비디오 프레임에 대한 정밀한 덴스 캡셔닝(Dense Captioning)을 자동화함으로써 사후 학습에 필요한 고품질 텍스트-비디오 페어 데이터셋을 신속히 정립합니다.
3.2 추론 및 사후 학습(Post-Training) 실행 Engine: Cosmos Framework
Cosmos Framework는 통합 추론 실행 및 특정 도메인 맞춤형 미세조정(Fine-Tuning)을 담당하는 실행 엔진입니다.
* 단일 추론 스크립트 및 통합 설정: 파편화된 코드 실행 없이 단일 추론 스크립트를 호출하고, inputs/omni/ 디렉터리 내의 표준 JSON 설정 파일(예: T2V, T2I, Action Forward Dynamics 등)을 연동하여 멀티모달 추론 체계를 즉시 구동합니다.
* Prompt Upsampler 메커니즘: 사용자가 입력한 구두점 위주의 짧은 단문 프롬프트를 내장된 Prompt Upsampler가 조명, 재질, 물리적 환경 설정 등이 정밀하게 묘사된 세부 프롬프트로 자동 확장하여 생성 영상의 시각적·물리적 품질을 극대화합니다.
* 체계적인 사후 학습(Post-Training) 워크플로우:
* Vision SFT: 특정 도메인의 비디오 생성 품질 향상 및 특정 물리 환경 생성을 위한 감독 미세조정.
* Reasoner Alignment SFT: AR 추론 타워가 지능형 대화형 에이전트 스타일로 자연스럽고 정형화된 응답을 출력하도록 조정.
* Policy SFT: 공공 로봇 조작 데이터셋인 Droid 데이터셋 등을 활용하여 특정 매니퓰레이터의 액션 제어 정책을 파인튜닝 지원.
3.3 합성 데이터 품질 보증 및 데이터 표류(Drift) 방지: Cosmos Evaluator
생성된 비디오 및 시뮬레이션 데이터가 물리 법칙을 위배할 경우 Sim-to-Real 이식 시 심각한 데이터 표류(Data Drift)가 발생합니다. Cosmos Evaluator는 4대 전문 검증기를 통해 불량 합성 데이터를 자동으로 필터링합니다.
1. Hallucination Checker: 프레임 간 시각적 일관성이 깨지거나 깜빡임, 객체의 왜곡 등 신경망 환각이 발생하는 프레임을 자동 감지 및 제거.
2. Obstacle Checker: 영상 내 객체 및 장애물의 지속성(Persistence)과 시간에 따른 공간적 변형 및 궤적의 정확성을 검증.
3. VLM Checker: 입력된 프롬프트의 조명, 날씨, 환경 조건 지시문이 생성된 영상의 정황과 일치하는지 타당성 평가.
4. 물리적 일관성/타당성 통합 평가 스위트 (Physical Consistency Suite): 중력, 충돌, 운동량 보존 등 기본 물리 법칙의 위배 여부를 종합 평가하여 고품질 합성 데이터만 선별.
3.4 닫힌 루프(Closed-Loop) 파이프라인 흐름도
1. 데이터 수집 및 고품질 전처리 단계 (Cosmos Curator)
* 대용량 비정형 관측 비디오의 GPU 가속 디코딩 및 프레임 스플리팅
* SOTA VLM 기반 덴스 캡셔닝 및 자동 속성 주석화
1. 모델 학습, Prompt 확장 및 추론 실행 단계 (Cosmos Framework)
* Prompt Upsampler를 통한 프롬프트 자동 고도화 및 단일 추론 스크립트 실행 (inputs/omni/ 표준 JSON 연동)
* 목적별 Post-Training 적용: Vision SFT / Reasoner Alignment SFT / Droid 데이터셋 기반 Policy SFT
1. 합성 데이터 품질 검증 및 필터링 단계 (Cosmos Evaluator)
* 4대 전문 검증기 실행 (Hallucination, Obstacle, VLM Checker, Physical Consistency Suite)
* 비물리적 시뮬레이션 데이터 자동 필터링 및 데이터 표류 완화
1. 닫힌 루프 환류 및 지속적 재학습 (Closed-Loop Feedback)
* 검증을 통과한 고품질 데이터만 수집하여 사전 학습/파인튜닝 파이프라인으로 재입력(Feedback)함으로써 모델 성능 지속 고도화
이러한 통합 파이프라인 중 무거운 Diffusion 생성 타워를 제외하고 추론 타워만을 독립적으로 분리하여 시각 AI 에이전트에 적용하는 패턴은 엔터프라이즈 엣지 환경에서 탁월한 효율성을 제공합니다.
4. Cosmos 3 추론 타워(AR Reasoner)의 독립적 활용 및 엔터프라이즈 AI 에이전트 확장
독립적 추론 모드의 전략적 가치
Diffusion 생성 타워 없이 Cosmos 3의 **AR 추론 타워(Auto-regressive Reasoner)**만을 독립적인 시각-언어 모델(VLM)로 구동하는 패턴은 매우 뛰어난 연산 효율성을 제공합니다. 무거운 비디오 생성 과정을 생략함으로써, 고정형 카메라 피드 분석, 현장 상황 진단, 실시간 경보 발생 및 로봇의 고차원 다단계 계획(Planning) 수립을 서브세컨드(Sub-second) 초저지연 속도로 수행할 수 있으며, 엣지(Edge) 수집 장비에 연산 부담 없이 즉각 배포가 가능합니다.
[ 엔터프라이즈 AI 에이전트 독립 추론 아키텍처 ]
[ 현장 CCTV / 센서 피드 ] ──> [ AR Reasoner 독립 타워 (VLM) ] ──> 서브세컨드 초저지연 판단
│
├──> [ 지능형 실시간 경보 / 보고서 발송 ]
└──> [ 로봇 현장 다단계 작업 계획 (Planning) ]
성능 벤치마크 및 지각 능력 평가
Cosmos 3 AR 추론 타워는 고정 카메라(Fixed Camera) 영상 해석 능력을 측정하는 대표적 벤치마크인 VantageBench에서 오픈 모델 중 최고 성능(Top Open Model)을 기록했습니다.
* 정밀 시각 지각: 스마트 시티, 스마트 팩토리, 물류 창고 등 고정 카메라 영상 피드로부터 물체 인지, 비정상 동작 감지, 공간적 위치 관계를 정밀 추론.
* 서브세컨드 반응성: 시각 AI 에이전트가 현장 상황을 파악하고 즉각적인 제어 신호나 경보를 출력하는 데 필요한 서브세컨드 단위의 초저지연 성능 보장.
산업별 실증 적용 사례 분석
* Milestone Systems (지능형 영상 관리 소프트웨어):
* 적용 방식: 자사의 세계적 영상 관리 소프트웨어(VMS)인 XProtect에 Cosmos 3 AR 추론 타워를 독자적인 영상 수집 데이터로 파인튜닝하여 통합.
* 실증 효과: 고정 카메라 피드에 대한 고차원 시각 추론을 적용하여 복잡한 구역 내 이상 상황 감지, 안전 수칙 위반 판별 및 자연어 기반 지능형 비디오 검색 기능 고도화 달성.
* Levitas (전력 인프라 자율 진단 로봇 및 드론):
* 적용 방식: 자율 이동 로봇 및 드론에 Cosmos 3 추론 타워를 탑재하여 송전망 및 전력 인프라 상태 분석 자동화 구현.
* 실증 효과: 사전 물리 지식을 바탕으로 현장에서 영상 피드를 수집하며 "전신주나 송전탑이 기울어져 있는가?", **"전선에 가해진 장력이 이상한가?"**와 같은 복합적인 물리적 변형 및 위험 상황을 직접 추론하고, 실시간 보고서 및 경보를 즉각 생성.
핵심 적용 패턴 정리
1. 고정형 서베일런스 영상의 초저지연 이상 감지 및 경보: 산업 현장 CCTV 피드에서 구조물 변형, 비정상 동작, 안전 규정 위반을 서브세컨드 단위로 정밀 판별.
2. 사전 물리 지식 기반 로봇 고차원 작업 계획(Planning): 복잡하고 모호한(Ambiguous) 상위 작업 지시를 수신했을 때, 내재된 물리 상식을 바탕으로 다단계 하위 제어 명령으로 분할 추론.
3. 대규모 비정형 비디오 데이터 자동 정화 및 주석화: 대용량 비디오 수집 시 고급 비전 지각 능력을 활용하여 덴스 캡셔닝 및 메타데이터 주석 작업을 자동화.
이제 실제 시스템 구축을 위한 배포 아키텍처 및 3-Computer 패러다임 기반 사양 선택 가이드라인을 제시합니다.
5. 물리 AI 통합 파이프라인 구축, 배포 및 사양 선택 가이드라인
실제 배포를 위한 아키텍처 가이드: '3-Computer Architecture'
엔터프라이즈 환경에 Cosmos 3 플랫폼을 안정적으로 배포하고 Sim-to-Real 갭을 최소화하기 위해, NVIDIA가 제시하는 3-Computer Architecture 배포 패러다임을 도입합니다.
┌───────────────────────────────────────────────────────────────────────────────┐
│ 3-Computer Architecture Paradigm │
├───────────────────┬───────────────────────────┬───────────────────────────────┤
│ Computer 1 (Cloud)│ Computer 2 (Simulation) │ Computer 3 (Edge / On-Device) │
├───────────────────┼───────────────────────────┼───────────────────────────────┤
│ • H100 GPU 클러스터│ • NVIDIA Isaac Sim │ • DGX Spark / 로봇 온보드 │
│ • Brev 클라우드 │ • Isaac Lab / Omniverse │ • 서브세컨드 실시간 추론 │
│ • 대규모 사전학습 │ • 합성 데이터 생성 및 │ • 온디바이스 closed-loop │
│ 및 Post-Training│ Evaluator 검증 │ 제어 및 액션 실행 │
└───────────────────┴───────────────────────────┴───────────────────────────────┘
1. Computer 1 (Cloud / Data Center): H100 GPU 클러스터 및 Brev 클라우드 인프라를 활용하여 대규모 데이터 처리, 사전 학습 및 도메인 특화 Post-Training(Vision/Policy SFT)을 수행.
2. Computer 2 (Simulation): NVIDIA Isaac Sim 및 Isaac Lab 기반 Omniverse 환경에서 물리 시뮬레이션을 구동하고, 합성 데이터 생성 및 Cosmos Evaluator 검증 수행.
3. Computer 3 (Edge / On-device): DGX Spark 또는 실물 로봇 온보드 컴퓨터에 최적화된 모델을 배포하여 현장 센서 데이터 수집 및 서브세컨드 실시간 추론/제어 구동.
모델 바리언트 라인업 및 컴퓨팅 자원 규격화
Hugging Face를 통해 공식 공개된 다양한 Cosmos 3 모델 바리언트 라인업을 목적에 맞게 선택합니다.
* 모델 바리언트 라인업:
* Cosmos 3 Nano (16B): 8B AR Reasoner + 8B Diffusion Generator. 온디바이스 엣지 배포 및 빠른 응답 속도가 중요한 제어 파이프라인에 최적화.
* Cosmos 3 Super (64B): 32B AR Reasoner + 32B Diffusion Generator. 고정밀 물리 시뮬레이션, 복잡한 비전 추론 및 클라우드 데이터 생성에 최적화.
* Text-to-Image Agentic Super: 결함 검출 및 고해상도 환경 이미지 생성을 위한 텍스트-to-이미지 특화 바리언트.
* Image-to-Video Agentic: 초기 관측 프레임 조건부 비디오 생성 특화 바리언트.
* Nano Policy Droid: Droid 로봇 조작 데이터셋으로 사전 파인튜닝된 로봇 매니퓰레이션 정책 샘플 바리언트.
* 컴퓨팅 자원 및 라이선스 규격:
* 학습 자원: NVIDIA H100 GPU 기반 분산 학습 환경(Brev Launchables 연동 지원).
* 오픈 라이선스: Open MDW 1.1 라이선스가 적용되어 가중치, 학습 코드, 데이터셋을 상용 제품 개발 및 다운스트림 도메인 미세조정에 제한 없이 자유롭게 활용 가능.
단계별 로드맵 (Implementation Roadmap)
1. 1단계: Curator 기반 데이터 가공 및 수집 (Data Preparation)
* 기존 현장 비디오 피드를 수집하고 Cosmos Curator를 배포하여 GPU 가속 디코딩, 스플리팅, VLM 덴스 오토 캡셔닝을 수행함으로써 고품질 학습 데이터셋 구축.
2. 2단계: 3-Computer 인프라 할당 및 베이스 모델 선정 (Compute Provisioning)
* H100 컴퓨팅 자원을 프로비저닝하고 요구 사양(엣지 반응속도 중심 vs 고정밀 시뮬레이션 중심)에 맞춰 Hugging Face에서 Cosmos 3 Nano, Super 또는 Agentic 바리언트 선택.
3. 3단계: Framework 기반 도메인 맞춤 사후 학습 및 Prompt Upsampler 연동 (Post-Training)
* Cosmos Framework 가이드를 따라 Prompt Upsampler를 설정하고, Droid 데이터셋 또는 자체 로봇 궤적 데이터를 활용해 Vision SFT, Reasoner Alignment SFT, Policy SFT 실행.
4. 4단계: Evaluator 검증 및 Isaac 생태계 연동 배포 (Closed-loop Deployment)
* Cosmos Evaluator 4대 검증기로 합성 데이터를 정화하고, NVIDIA Isaac Sim, Isaac Lab, 원격 조종 데이터 수집을 위한 Isaac Teleop, 그리고 실체 로봇 배포 연동을 위한 ROS/Cross 생태계에 최종 통합하여 닫힌 루프(Closed-loop) 실시간 제어 배포 완성.
종합 요약
NVIDIA Cosmos 3 플랫폼은 물리 AI 개발의 최대 병목인 데이터 희소성 문제를 "연산 기반의 데이터 생성 및 시뮬레이션(Compute is Data)" 패러다임으로 전환하는 기술적 이정표입니다. 혼합 트랜스포머(MoT) 아키텍처와 1급 시민으로 내재화된 액션(Action) 기하학 연산, 그리고 Curator, Framework, Evaluator로 연결되는 3대 리포지토리 생태계 및 3-Computer Architecture는 엔터프라이즈 물리 AI 및 자율 로보틱스 시스템 개발에 뛰어난 정밀도, 안전성, 그리고 사업적 민첩성을 제공할 것입니다.