SUNGSOO'S AI BLOGAGI RESEARCH UPDATE · 2026.09.25
RECURSIVE IMPROVEMENT / ASYNCHRONOUS PREDICTION / PHYSICAL SCIENCE

연구하는 방법을 고치고,
변하는 세계에 맞춰 행동하다

Self-Improving Research Agents and Multi-Timescale Physical World Models

AIDE²는 연구 에이전트의 하네스를 개선하고, InternW0는 긴 예측과 빠른 물리적 수정을 연결한다. 두 연구가 자율과학실에 던지는 질문은 무엇인가.

CONTENT UPDATE & PUBLICATION DATE · 2026-09-25

디지털 자기개선과 다중 시간척도 물리적 실행의 접점AIDE²는 연구 하네스 수정과 평가를 반복한다. InternW0는 느린 예측과 빠른 관측 기반 행동 수정을 결합한다. 두 구조의 통합은 아직 연구 제안이다.AIDE² · 연구 과정 개선InternW0 · 예측과 실행하네스 수정 → 후보 평가채택된 코드에서 다시 시작느린 루프 · 장기 예측 / K·V빠른 루프 · 관측 → 행동 수정Ignition은 별도 평가 · 미입증힘 · 접촉 · 최신 관측 피드백Self-Improving Autonomous Physical Scientist결합은 향후 연구 가설 · 통합 실증 결과가 아님
첨부의 두 연구를 연결한 개념도 · 점선 연결은 검증이 필요한 연구 제안이다.
EDITORIAL ABSTRACT

핵심은 자기 코드의 수정 여부만이 아니다. 개선이 새로운 연구 과제로 전이되는지, 예측이 실제 행동의 시간 제약 안에서 유효한지가 중요하다. 성능 향상과 자기개선의 가속, 작업 진행과 전체 실험 성공을 구분해 읽는다.

원자료 AGI-Trends-0925.md의 연구 설명·수치·수식·비교 관점·한계와 향후 연구축을 모두 반영했다. 게시일은 내용 업데이트 날짜를 따른다.

전체 목차
  1. 자기개선과 물리적 실행의 접점
  2. AIDE²: 연구하는 방법을 개선하다
  3. InternW0: 느리게 예측하고 빠르게 수정하다
  4. 자기개선하는 물리적 과학자를 향하여
PART 01 / AGI RESEARCH UPDATE

자기개선과 물리적 실행의 접점

2026년 9월 25일 첨부 업데이트는 추적 대상으로 선정한 연구 가운데, AGI 연구방향을 바꿀 가능성이 충분히 큰 2건만 추가한다. 가장 중요한 변화는 Recursive Self-Improvement가 “자기 코드를 고치는 데 성공했다” 수준에서 벗어나, 여러 세대의 수정이 실제 AI R&D 능력으로 전이되는지를 검증하기 시작했다는 점이다. Physical AGI 쪽에서는 world model이 영상 예측기가 아니라 느린 미래예측과 빠른 물리제어를 다른 시간척도에서 결합하는 실시간 실행계층으로 구체화되고 있다.

PART 02 / AGI RESEARCH UPDATE

AIDE²: 연구하는 방법을 개선하다

발표일: 2026년 9월 22일 영역: Recursive Self-Improvement · Autonomous AI R&D · Long-Horizon Agents · Memory

Weco AI의 AIDE²는 현재까지 나온 RSI 연구 가운데 특히 주목할 가치가 있다. 시스템은 AI 연구 agent의 자기 자신의 harness 코드를 최적화 대상으로 삼는다. 내부 agent가 ML·알고리즘·코드 최적화 문제를 풀고, 외부 agent가 그 내부 agent의 search policy, context management, memory, verification 코드를 다시 수정한다. 중요한 것은 한 번 개선된 코드가 다음 반복에서 다시 수정되는 대상이 된다는 점이다. 즉 단순한 prompt optimization이 아니라 실제로

\[ A_0 \rightarrow A_1 \rightarrow A_2 \rightarrow \cdots \]

형태의 재귀적 수정계열을 구성한다. 후보 agent는 자신에게 보이지 않는 private held-out evaluation으로 선별된다. 근거 1

8일간의 단일 자율 실행에서 AIDE²는 7개의 연속적으로 채택된 개선을 발견했다. 개선내용에는 새로운 탐색정책, stalled branch를 다루는 방식, 장기 context를 압축·관리하는 memory mechanism 등이 포함됐다. 더 중요한 결과는 이러한 개선이 selection에 사용하지 않은 4개의 held-out benchmark로 전이됐다는 점이다. 여기에는 ML engineering, heuristic algorithm engineering뿐 아니라 selection domain 밖의 physics-based weather forecasting도 포함되며, 가장 강한 self-evolved agent는 2년간 사람이 직접 개선한 production research agent와 동등하거나 더 높은 결과를 냈다. 근거 1

또한 별도의 held-out task family에서 reward hacking 비율이 55%에서 32%로 감소했다. 이 특성은 외부 loop가 명시적으로 최적화한 목적이 아니었다. 논문은 이를 self-improvement가 단순 benchmark overfitting만 일으킨 것은 아니라는 보조 증거로 제시한다. 근거 1

기존 연구 대비 차이는 분명하다. 최근 보고한 RSIAgent나 RRSI 계열은 memory·harness·regularization을 개선하는 데 초점이 있었다면, AIDE²는 다음 질문을 직접 실험한다.

\[ \boxed{ \text{“개선된 연구 agent가 실제로 더 나은 연구 agent를 만들어내는가?”} } \]

따라서 평가단위가

\[ \text{Agent performance} \]

에서

\[ \boxed{ \text{Agent's ability to improve future agents} } \]

로 한 단계 올라간다.

다만 이것을 intelligence explosion의 증거로 해석해서는 안 된다. 저자들 자신도 현재 결과를 RSI 단계 중 Level 1(net positive)로 분류한다. 개선된 inner agent가 더 강한 outer-loop improver가 되는 이른바 “ignition”은 입증되지 않았다. 또한 8일짜리 주 실험은 단일 run이며 첨부의 9월 25일 점검 범위에서는 독립 재현이 확인되지 않았다. 근거 1

그럼에도 연구적 의미는 크다. 앞으로 RSI의 핵심 질문은 단순히

\[ \Delta\text{Capability}>0 \]

가 아니라,

\[ \boxed{ \begin{aligned} &\text{multi-generation improvement}\\ +&\text{held-out transfer}\\ +&\text{fixed-budget efficiency}\\ +&\text{anti-reward-hacking}\\ +&\text{improver-of-improver capability} \end{aligned}} \]

를 동시에 측정하는 방향으로 이동할 가능성이 높다. 첨부는 특히 Autonomous AI Scientist와 RSI가 사실상 같은 연구문제로 수렴하기 시작했다고 해석한다. 이는 연구 효율 개선이라는 접점에 관한 전망이며 두 분야 전체가 동일하다는 실증 결과는 아니다.

arXiv — Recursive self-improvement of AI research agents Weco AI — AIDE² technical overview

재귀적 수정과 ignition의 구분

주 실행은 개선된 inner agent를 다음 수정 대상으로 사용한다. 개선된 agent를 outer-loop 개선자로 승격해 더 강한 자기개선이 일어나는지는 별도의 ignition test가 묻는다. 따라서 하네스 개선의 전이와 개선 능력 자체의 가속을 구분해야 한다. reward hacking 감소도 평가한 과제군의 관측 결과이며 전반적인 안전성 보장은 아니다.

PART 03 / AGI RESEARCH UPDATE

InternW0: 느리게 예측하고 빠르게 수정하다

발표일: 2026년 9월 23일 영역: World Models · Multimodal/Embodied Intelligence · Physical AGI · Autonomous Laboratory

InternW0는 Shanghai AI Laboratory가 제안한 physical world model로, 최근의 world-model 연구에서 중요한 병목인 “미래를 잘 예측하지만 실제 로봇 제어에는 너무 느리다”는 문제를 직접 겨냥한다. 하나의 거대한 모델이 매 action마다 미래영상 전체를 다시 생성하는 대신, 고용량 Video-DiT는 느린 시간척도에서 장기 predictive context를 만들고, 경량 Action-DiT는 훨씬 빠른 시간척도에서 최신 관찰을 반영해 행동을 갱신한다. 이전 예측에서 생성된 K/V 정보를 새 관찰에 맞춰 routing하여 재사용하는 구조이다. 근거 3

즉 world model을

\[ \text{Observation} \rightarrow \text{Future Video} \]

로 사용하는 것이 아니라,

\[ \boxed{ \begin{aligned} \text{Slow loop}:&\quad \text{World Prediction}\\ \text{Fast loop}:&\quad \text{Observation} \rightarrow \text{Action Correction} \end{aligned}} \]

으로 분리한다.

이 구조 덕분에 논문이 보고한 critical-path action latency는 60.73 ms, 최대 model-side policy update rate는 16.47 Hz로, 비교한 Fast-WAM보다 약 3.13배 빠른 업데이트율을 보였다. 근거 3

더 주목할 부분은 평가가 일반적인 pick-and-place에만 머물지 않았다는 점이다. 약 7,200시간의 robot·egocentric data로 학습했고, 실제 로봇에서 15단계 metal-organic framework(MOF) 실험 workflow와 5단계 quantitative pipetting을 평가했다. MOF 작업의 progress rate는 InternW0가 68.4%, \(\pi_{0.5}\)가 50.2%, Fast-WAM이 10.7%였고, quantitative pipetting에서는 각각 65.3%, 46.7%, 18.7%였다. 근거 3

특히 pipetting에서는 시각정보뿐 아니라 force/tactile signal을 post-training에 포함해 tip attachment, aspiration, dispensing, tip ejection처럼 접촉 상태가 중요한 작업을 다룬다. LIBERO에서는 평균 98.6%를 기록했으며, 논문이 비교한 LingBot-VA와 Fast-WAM보다 각각 0.1%p와 1.0%p 높았다. 다만 LIBERO 자체의 차이는 작기 때문에, 이 논문의 핵심 가치는 그 수치보다 실시간 비동기 world-model 제어와 실제 laboratory manipulation을 같은 구조에서 결합했다는 점에 있다. 근거 3

기존 연구 대비 차이는 최근의 XPACE류와 비교하면 더 명확하다. 기존의 발전이

\[ \text{World Model} \rightarrow \text{Policy Training} \]

이었다면 InternW0는 이를 실제 실행 시점까지 가져와

\[ \boxed{ \text{Persistent Prediction} \leftrightarrow \text{High-Frequency Physical Feedback} \leftrightarrow \text{Action} } \]

으로 만든다.

연구적 의미는 Physical AGI의 world model이 앞으로 하나의 단일 inference rate로 동작하지 않을 가능성이 높다는 것이다. 사람도 느린 계획·예측과 빠른 반사·수정을 서로 다른 시간척도에서 수행한다. InternW0는 이와 유사하게

\[ \boxed{ \text{Multi-timescale World Model} = \text{slow imagination} + \text{fast correction} } \]

이라는 구조를 실험적으로 구체화한다.

또한 MOF synthesis와 pipetting 결과는 Autonomous AI Scientist 연구와 embodied intelligence 사이의 경계를 좁힌다. 앞으로 자율과학실에서 필요한 것은 단순 VLA가 아니라 실험 단계의 진행상태를 기억하고, 미래 결과를 예측하며, 힘·접촉·오차를 실시간으로 반영하는 “science-native physical world model”일 가능성이 높다.

arXiv — InternW0 InternW0 공식 프로젝트

실험실 작업 진행률 비교 · 논문 Tables 6–7
작업InternW0π₀.₅Fast-WAM
MOF · 15단계68.4%50.2%10.7%
정량 피펫팅 · 5단계65.3%46.7%18.7%
측정 단위의 경계

68.4%와 65.3%는 작업의 progress rate이다. 전체 실험을 처음부터 끝까지 완료한 비율이나 과학적 발견 성공률로 해석해서는 안 된다. 16.47 Hz는 모델 측 최대 policy update rate이며, 센서·통신·구동기를 포함한 전체 로봇 시스템의 보장 제어 주파수가 아니다. 비교 결과는 논문이 사용한 하드웨어와 평가 설정에 한정한다.

PART 04 / AGI RESEARCH UPDATE

자기개선하는 물리적 과학자를 향하여

이번 두 연구를 같이 보면 현재 AGI 연구에서 중요한 결합이 나타난다.

\[ \boxed{ \begin{aligned} \text{Digital AGI}:& \quad \text{Agent} \rightarrow \text{Improve its own research process}\\[1mm] \text{Physical AGI}:& \quad \text{World model} \rightarrow \text{Predict} \rightarrow \text{Act} \rightarrow \text{Correct in real time} \end{aligned}} \]

따라서 현재 우선적으로 추적할 연구축은 Generalizing Recursive Self-Improvement, Improver-of-Improver / RSI Ignition Tests, Multi-Timescale Actionable World Models, 그리고 이 둘이 결합되는 Self-Improving Autonomous Physical Scientist이다. 특히 앞으로 AIDE²류의 연구 agent가 InternW0류의 laboratory world model과 결합해 자신의 실험계획뿐 아니라 실험수행 정책까지 반복적으로 개선하는 구조가 등장한다면, 그것은 현재의 Autonomous AI Scientist에서 한 단계 더 큰 연구 전환점이 될 가능성이 있다.

결합은 앞으로 검증할 연구 가설이다

AIDE²와 InternW0를 연결한 Self-Improving Autonomous Physical Scientist는 첨부가 제안한 향후 연구방향이다. 두 시스템을 실제로 통합해 실험계획과 수행 정책을 함께 개선했다는 결과는 이 글의 두 연구가 입증하지 않았다.

SOURCES & EVIDENCE

참고자료

  1. Recursive self-improvement of AI research agents
  2. AIDE² — Technical Overview
  3. InternW0: A Foundational Physical World Model for Efficient Real-World Interactions
  4. InternW0 — Official Project

수치와 방법의 확인에 AIDE² v1 원문 및 InternW0 v1 원문을 사용했다. 수식은 첨부가 제시한 개념적 연구 흐름이며 AGI의 충분조건을 정의하지 않는다.