SUNGSOO'S AI BLOGEINSTEIN TEST WATCH · 2026.09.24
EXPERIMENT / CAUSAL CRITICISM / META-IMPROVEMENT

실험하고, 가설을 고치고,
발견하는 방법을 개선하다

The Einstein Test: Experimental Autonomy, Causal Revision, and Discovery Self-Improvement

FermiLink는 실험 장비를 운용하고, xWhyL은 설명과 증거의 충돌을 다루며, AIDE²는 연구 하네스를 수정한다. 서로 다른 세 진전이 과학지능 평가에 요구하는 조건을 살핀다.

과학적 발견 평가의 세 가지 구성요소인과 설명과 가설 수정, 실제 실험과 관측, 발견 과정의 자기개선을 세 축으로 배치한다. 독립 검증과 시간적 격리는 세 축 전체를 평가하는 조건이다.인과적 비판물리적 실험방법의 개선xWhyL · 설명과 관측의 충돌잘못된 가설을 기각하는가?FermiLink · 계획과 장비 운용실제 세계에 개입하는가?AIDE² · 연구 하네스 수정발견 과정을 개선하는가?Operational Einstein Test시간적 격리 · 반증 · 독립 검증 · 인간 개입 기록세 구성요소의 진전 ≠ Einstein-level AGI의 입증
첨부 연구동향을 통합한 평가 개념도 · 세 연구가 하나의 시스템으로 결합됐다는 의미가 아니다.
EDITORIAL ABSTRACT · THREE RESEARCH SIGNALS

한 번의 과학적 성공을 넘어, 실제 세계에서 관측하고 잘못된 가설을 수정하며 연구 절차 자체를 개선할 수 있는지가 새로운 평가축으로 부상한다. 각 능력의 진전과 Einstein-level AGI의 입증은 구분해야 한다.

첨부의 모든 연구 항목과 수치, 저자·기관, 비교 관점, 평가 흐름과 출처를 반영했다. 원문의 긴 비교표는 요약표와 연구별 상세 절로 재구성했다. SCILAWS-BENCH·TruthInsightBench의 변경 부재는 첨부의 점검 범위에 한정한다.

전체 목차
  1. 세 연구가 확장하는 과학지능 평가
  2. FermiLink: 실험실에서 행동하는 AI
  3. xWhyL: 설명을 학습하고 틀리면 기각하다
  4. AIDE²: 발견하는 방법을 개선하다
  5. Operational Einstein Test의 확장 구조
PART 01 / SCIENTIFIC INTELLIGENCE

세 연구가 확장하는 과학지능 평가

첨부 브리핑은 이전 점검 이후 새로 공개된 자료 가운데 3건을 의미 있는 업데이트로 선정했다. 특히 이번에는 ① 실제 물리 실험을 며칠 동안 수행하는 AI agent, ② abductive explanation을 causal discovery의 학습신호로 정식화한 연구, ③ 연구 agent가 자신의 연구 harness를 반복적으로 개선하는 recursive self-improvement가 각각 중요한 신호이다. 반면 Singularity Gate, SCILAWS-BENCH, TruthInsightBench 자체에는 새로 보고할 중대한 공식 버전 변경이 첨부의 점검 범위에서 확인되지 않았다. 이번에 열람한 Singularity Gate 공식 이력에서 가장 최근에 표시된 버전은 2026년 7월 15일의 v1.1이다. (Singularity Gate [1])

연구새로운 평가축해석의 경계
FermiLink실제 장비를 이용한 실험 자율성새 물리법칙의 독립 창안은 평가하지 않음
xWhyL설명과 관측의 충돌, 인과 가설의 기각가정 아래의 이론·방법론 기여
AIDE²발견 과정의 하네스 개선재귀적 가속은 미입증
PART 02 / SCIENTIFIC INTELLIGENCE

FermiLink: 실험실에서 행동하는 AI

FIRST RELEASE · 2026-09-22

Autonomous Quantum Transport Measurements of 2D Semiconductors by an AI Agent — Brandon Bauer, Matthew Whalen, Kenji Watanabe, Takashi Taniguchi, John Q. Xiao, Tao E. Li, Wenjin Zhao. 주요 연구진은 University of Delaware와 NIMS 계열이다. Wenjin Zhao는 University of Delaware Physics & Astronomy 교수이고, Watanabe/Taniguchi는 NIMS 연구진으로 확인된다. (arXiv [2])

연구가 보고한 기여

FermiLink라는 agent harness를 이용해 사람이 간략한 지시만 주면 AI가 실험계획 수립 → 극저온 장비 조작 → 데이터 분석 → 최종 보고까지 수행한다. 단·이중층 MoS₂에서 최대 6일 동안 자율 측정 campaign을 수행했고, 단층 MoS₂의 conduction-band spin-orbit coupling energy를 결정하고 이중층 MoS₂의 layer/valley-resolved phase diagram을 작성했다. 장비 안전성과 measurement/analysis reliability도 harness의 핵심 설계요소다. (arXiv [2])

Einstein Test에서 읽어야 할 의미

이번 실행에서 autonomous scientific discovery 측면에서 가장 중요한 신규 사례다. 기존 AI Scientist 연구 상당수가 코드·문헌·simulation 안에서 끝났다면, 이 연구는 Plan → Physical Action → Observation → Analysis를 실제 실험실에서 장기간 폐루프로 수행한다. 향후 Einstein Test에는 Embodied Experimental Autonomy를 별도 평가축으로 둘 근거가 강해진다. 다만 연구문제와 실험계는 인간이 제공했고 temporal isolation이나 새로운 물리법칙의 독립적 창안은 평가하지 않았으므로, Einstein-level conceptual discovery의 증거라기보다 self-driving laboratory 역량의 진전으로 보는 것이 정확하다.

확인 범위 · arXiv 초록에서 저자, 2026년 9월 22일 공개, 최대 6일의 캠페인, 단·이중층 MoS₂ 결과와 FermiLink의 안전·신뢰성 설계 방향을 확인했다. 세부 소속 설명은 첨부 브리핑을 따른다. 최대 6일은 보고된 캠페인 길이이며, 모든 환경에서 무개입 운용을 보장하는 수치가 아니다.

PART 03 / SCIENTIFIC INTELLIGENCE

xWhyL: 설명을 학습하고 틀리면 기각하다

FIRST RELEASE · 2026-09-22

xWhyL: Causal Interactive Learning — Nicholas Tagliapietra, Florian Peter Busch, Moritz Willig, Matej Zečević, Lavdim Halilaj, Juergen Luettin, Kristian Kersting; Bosch Center for Artificial Intelligence · TU Darmstadt · hessian.AI 연구진

연구가 보고한 기여

사람의 설명(explanation)을 단순 사후 해석이 아니라 causal discovery를 위한 학습신호로 사용한다. 설명이 허용하는 causal model 집합을 Explanatory Equivalence Class(EEC)로 정의하고, observational data가 만드는 Markov Equivalence Class와 결합해 causal ambiguity를 줄인다. 특히 설명 자체가 틀릴 수 있음을 전제로, 데이터와 설명이 충돌하는 Causal Tug-of-War를 분석하고 잘못된 설명을 흡수하지 않고 기각할 조건을 제시한다. (arXiv [3])

Einstein Test에서 읽어야 할 의미

abductive reasoning을 Einstein Test에 넣는 방법을 이론적으로 구체화하는 데 중요하다. AI가 “그럴듯한 설명”을 생성하는 것만으로는 충분하지 않고, 그 설명을 causal hypothesis로 변환한 뒤 관측증거와 충돌할 때 버릴 수 있는가가 평가되어야 한다. 즉 Abductive Explanation → Candidate Causal Model → Evidence Conflict → Hypothesis Rejection/Revision이라는 평가 구조를 정당화한다. 다만 자체적으로 AGI나 temporal-isolation benchmark를 제시하는 연구는 아니므로 평가 원리 측면의 기여로 보는 것이 적절하다.

이론적 보장의 범위

원문은 비순환 인과그래프, 인과적 충분성, Markov 조건과 충실성 등의 가정을 사용한다. 잘못된 설명을 기각하는 보장은 관측 목표와 양립하지 않는 피드백, 정규화·분리 조건, 전역 최적해 및 점근적 설정에 의존한다. 임의의 자연어 설명을 유한한 데이터만으로 항상 판별한다는 결과가 아니다. xWhyL v1 원문

PART 04 / SCIENTIFIC INTELLIGENCE

AIDE²: 발견하는 방법을 개선하다

FIRST RELEASE · 2026-09-22

Recursive self-improvement of AI research agents — Dhruv Srikanth, Bingchen Zhao, Dixing Xu, Yuxiang Wu, Zhengyao Jiang · Weco AI

연구가 보고한 기여

AIDE²가 자신의 research-agent code/harness 자체를 수정하고 hidden evaluation으로 개선안을 선별한 뒤, 채택된 agent가 다음 단계의 수정 대상이 되는 폐루프를 구현했다. 8일간의 자율 실행에서 7개의 연속적 개선을 발견했으며, 개선된 agent는 ML engineering·heuristic algorithm engineering·physics-based weather forecasting을 포함한 4개 held-out benchmark에서도 human-engineered production agent와 동급 이상을 기록했다. 별도 held-out task에서는 reward hacking 비율이 55%→32%로 감소했다. (arXiv [4])

Einstein Test에서 읽어야 할 의미

AGI 평가에서 중요한 신규 신호다. 특히 평가대상이 고정된 foundation model 하나만이 아니라 Model + Harness + Memory + Search Policy + Evaluator 전체 시스템임을 다시 보여준다. 그러나 이를 곧바로 “recursive intelligence explosion”이나 AGI 증거로 해석하는 것은 과도하다. 개선대상과 hidden benchmark가 명시되어 있고, 개선은 주로 연구 효율·search/memory architecture에서 발생했다. Einstein Test에서는 따라서 한 번의 과학적 성공과 별도로 동일 시스템이 실패 경험을 바탕으로 자신의 discovery process 자체를 지속적으로 개선하는가를 meta-level 평가축으로 둘 가치가 있다.

하네스 개선과 개선자의 개선은 다르다

주 실행에서는 채택된 inner-loop 하네스를 다음 수정의 출발점으로 사용한다. 이를 outer-loop 개선자로 승격하는 효과는 별도의 ignition test에서 조사했다. 각 arm의 3개 seed·50-step 실험에서 평균 최종 grade는 0.780과 0.782였으며, 저자들은 개선된 AIDE₄₇이 더 뛰어난 자기개선자라는 결론을 내리지 않았다. 기반 모델의 가중치나 평가 목표 자체의 자율 개선을 입증한 결과도 아니다. AIDE² v1 원문

PART 05 / SCIENTIFIC INTELLIGENCE

Operational Einstein Test의 확장 구조

출처: Autonomous Quantum Transport — arXiv · xWhyL — arXiv · AIDE² Recursive Self-Improvement — arXiv

이번 세 연구를 함께 보면 Operational Einstein Test의 평가 범위를 한 단계 확장할 필요성이 더 분명해진다. 지금까지 주된 구조가

\[\text{Temporal Isolation} \rightarrow \text{Abductive Hypothesis} \rightarrow \text{Falsification} \rightarrow \text{Revision} \rightarrow \text{Future Validation}\]

이었다면, 새 결과들을 반영하면 다음처럼 보는 것이 더 적절하다.

\[\boxed{ \begin{aligned} &\text{Temporal Isolation}\\ &\rightarrow \text{Problem / Weak-Signal Discovery}\\ &\rightarrow \text{Abductive Explanation}\\ &\rightarrow \text{Causal Hypothesis}\\ &\rightarrow \text{Physical Experiment Planning}\\ &\rightarrow \text{Autonomous Instrument Action}\\ &\rightarrow \text{Counter-Evidence}\\ &\rightarrow \text{Belief Revision}\\ &\rightarrow \text{Independent Validation}\\ &\rightarrow \mathbf{Self\!-\!Improvement\ of\ the\ Discovery\ Process} \end{aligned}}\]

특히 xWhyL은 “설명이 틀렸을 때 버릴 수 있는가”, FermiLink 연구는 “실제 세계에 개입하고 관측할 수 있는가”, AIDE²는 “발견을 수행하는 방법 자체를 개선할 수 있는가”를 각각 추가한다. 현재로서는 세 연구 모두 단독으로 Einstein-level AGI를 입증하지 않지만, abduction → causal criticism → embodied experimentation → meta-improvement라는 보다 강한 AGI 과학평가 구조가 실제 구현 가능한 구성요소들로 채워지고 있다는 점이 이번 실행의 가장 중요한 변화이다.

통합 제안의 지위

이 평가 흐름은 첨부 브리핑이 세 연구를 연결해 도출한 설계 제안이다. 이미 구현·검증된 단일 시스템, 공식 Einstein Test 개정안 또는 AGI의 충분조건을 뜻하지 않는다. 실제 평가는 각 단계의 성공 기준, 시간적 정보 격리, 인간 개입 범위와 독립 검증 절차를 별도로 정해야 한다.

SOURCES & EVIDENCE

참고자료

  1. Version History | The Singularity Gate공식 버전 이력 · 표시된 최신 항목 v1.1 / 2026-07-15
  2. Autonomous Quantum Transport Measurements of 2D Semiconductors by an AI AgentarXiv v1 · 2026-09-22 · 연구 결과와 AGI 판정은 구분
  3. xWhyL: Causal Interactive LearningarXiv v1 · 2026-09-22 · 연구 결과와 AGI 판정은 구분
  4. Recursive self-improvement of AI research agentsarXiv v1 · 2026-09-22 · 연구 결과와 AGI 판정은 구분
  5. xWhyL v1 · 이론과 가정EEC, 관측 증거와의 충돌 및 기각 조건 확인
  6. AIDE² v1 · 방법과 ignition testinner/outer loop 구분과 자기개선자의 성능 비교 확인

원자료: Einstein Test-Trends-0924.md. AIDE²의 수정 대상과 수정 주체를 구분하고, xWhyL의 기각 보장에 필요한 가정을 보완했다. 두 수식은 첨부가 제안한 평가 절차를 표현한 개념식이다.