AI Research Blog·Operational Einstein Test · ScientistTwo2026 · 09 · 19
Artificial General Intelligence·AI for Science·Operational Einstein Test

연구주기를 자율화하는 것과
새 과학원리를 발명하는 것은 다르다

ScientistTwo and the Operational Einstein Test: Autonomous SOTA Improvement, Counter-Evidence Revision, and the Discovery Gap

LIMITATIONRIVAL IDEASEXPERIMENTREVISIONABLATIONREVIEW한계 추출복수 아이디어실행 가능한 실험실패 기반 수정원인 분리비판·반박THE MISSING EINSTEIN-TEST BOUNDARYtemporal isolation · unpublished problem · sealed prediction · independent validation
Central Update

이번 점검에서 이전 보고와 중복되지 않으면서 Operational Einstein Test의 설계를 실제로 바꿀 만한 신규 연구는 ScientistTwo 한 건이다. Einstein Test 자체, SCILAWS-BENCH, TruthInsightBench, ASI-Bench, Singularity Gate에서는 공식적인 중대 버전 변경이 새로 확인되지 않았다.

ScientistTwo가 중요한 이유는 단순히 높은 benchmark 점수 때문이 아니다. 아이디어 생성 → 실제 실행 → 실패·성공 trace → 가설 수정 → ablation → adversarial review → 추가 판별실험이 하나의 폐루프로 이어진다는 점이다. 그러나 이 성취는 곧바로 Einstein-level discovery를 뜻하지 않는다.

\[\boxed{\text{Autonomous SOTA Improvement}\neq\text{Einstein-level Scientific Discovery}}\]
Part I · Status

새 benchmark보다 하나의 경계 사례가 중요했다

이번 업데이트의 핵심은 benchmark version change가 아니라 autonomous research cycle이 어디까지 성숙했는지를 보여주는 새로운 사례다.

Source factScientistTwo는 Jaehyun Nam, Jinsung Yoon, Yanzhou Pan, Yubo Wang, Rui Meng, Parthasarathy Ranganathan, Tomas Pfister가 참여한 Google Cloud AI Research·University of Waterloo 연구다. arXiv v1은 2026년 9월 17일 UTC에 공개됐고 9월 18일 신규 목록에 본격 노출됐다.

이번 점검에서는 단순 leaderboard 변동과 주변 agent-engineering 연구를 제외했다. 따라서 “새 점수”보다 Einstein Test가 실제로 평가해야 할 중간 능력이 얼마나 구체화됐는가에 초점을 맞춘다.

Part II · ScientistTwo

idea → code → score를 넘어 연구 전체를 폐루프로 만든다

사람이 연구문제를 제공하면 multi-agent system이 limitation extraction, idea generation, experiment, failure-based revision, ablation, review와 rebuttal experiment를 순차 수행한다.

§1 · Research Cycle

실패가 다음 가설을 바꾸는 구조

Human-given Problem → Limitation Discovery → Rival Ideas → Executable Experiments → Failure-based Revision → Ablation → Adversarial Review → New Experiments

Operational Einstein Test 관점에서 특히 중요한 것은 abductive hypothesis refinement와 counter-evidence-driven revision이다. 첫 아이디어가 틀리면 실패 trace를 근거로 가설을 바꾸고, ablation으로 개선 원인을 분리하며, simulated peer review의 비판을 받은 뒤 새로운 판별실험을 수행한다.

즉 연구의 핵심 단위가 단발적인 답변이나 코드 생성이 아니라 가설을 만들고, 실행하고, 틀렸음을 확인하고, 다시 수정하는 epistemic loop에 가까워졌다.

§2 · Frontier Expansion

자신이 만든 방법을 다음 cycle의 baseline으로 다시 쓴다

동일 문제에서 자신이 새로 발견한 방법을 다음 cycle의 baseline으로 사용한 사례에서는 10.9% → 추가 9.6% → 추가 8.2%의 순차적 frontier expansion이 보고됐다. 이 패턴은 단발성 optimization보다 iterative scientific improvement에 더 가깝다.

다만 이 수치를 일반적인 self-improvement scaling law로 해석할 근거는 없다. 특정 문제와 평가구조 안에서 반복 개선이 가능했다는 사례로 읽는 것이 맞다.

Part III · Evidence

높은 SOTA 개선율과 인간 평가를 함께 읽어야 한다

자동 평가에서는 강한 성과를 보였지만, 인간 전문가 비교에서는 과학적 성숙도가 인간 논문과 사실상 동률이었다.

107
Research Problems
ICLR·ICML·NeurIPS 기반
86 / 80.4%
Improved Human SOTA
기존 human SOTA 개선 문제 수
25.2%
Avg Relative Gain
보고된 평균 상대 개선율
$3,800
Approx. Cost / Task
평균 실행시간 2–3일

Source fact107개의 연구문제 중 86개에서 기존 human SOTA를 개선했고 평균 상대 개선율 25.2%를 보고했다.

그러나 자동 reviewer에서 인간 논문보다 높은 점수를 얻는 경우가 있었던 것과 달리, 9명의 인간 전문가가 NeurIPS 기반 33편을 비교했을 때 overall scientific maturity는 인간 논문과 사실상 동률인 3.0/5.0이었다. method soundness와 algorithmic rigor에서는 인간이 소폭 우위였고 ScientistTwo는 2.9 수준으로 3.0보다 낮았다.

연구진도 ScientistTwo가 아직 spotlight/oral 수준의 paradigm-shifting conceptual breakthrough를 일관되게 만들지는 못한다고 명시한다.

Part IV · Boundary

왜 아직 Einstein Test 통과 증거가 아닌가

강한 자율 연구성과와 역사적으로 알려지지 않은 과학원리의 독립 발명 사이에는 temporal isolation과 contamination control이라는 큰 간극이 남아 있다.

Human-Given Problem

출발 연구문제와 human SOTA가 사람이 제공된다. 문제발견 자체는 평가하지 않는다.

No Temporal Isolation

novelty 검사에서 Google Search로 reference paper를 검색한다. post-cutoff knowledge를 차단하지 않는다.

Contamination Risk

2025–2026년 출판 AI 논문·benchmark 중심이므로 weight-level contamination과 historical leakage를 배제하지 못한다.

Caution따라서 높은 SOTA 개선률을 “알려지지 않은 과학법칙을 독립적으로 발견했다”는 증거로 바꾸어 읽으면 안 된다. 현재의 가장 정확한 해석은 연구주기 자동화와 counter-evidence revision의 성숙도를 보여주는 사례라는 것이다.

ScientistTwo는 연구주기를 자율화하는 기술이 상당히 성숙했음을 보여주지만, 역사적으로 알려지지 않은 문제에서 새로운 과학원리를 독립적으로 발명하는 능력은 별도의 검증이 필요하다.Epistemic boundary
Part V · Operational Einstein Test 2.0

ScientistTwo의 연구루프를 더 엄격한 시간격리 시험으로 옮긴다

앞단의 문제와 지식을 밀봉하고, 뒷단의 예측과 검증을 독립시키면 autonomous research cycle을 Einstein-level discovery 평가로 확장할 수 있다.

§3 · Stronger Test Design

앞단과 뒷단을 바꾸는 것이 핵심이다

\[\text{Temporally Isolated / Unpublished Problem}\rightarrow\text{Autonomous Research Cycle}\rightarrow\text{Sealed Prediction}\rightarrow\text{Independent Future Validation}\]

중앙의 autonomous research cycle은 ScientistTwo가 이미 상당 부분 구현했다. 바뀌어야 하는 것은 양 끝이다. 앞단에서는 post-cutoff knowledge와 published benchmark를 차단하고, 뒷단에서는 모델이 예측을 고정한 뒤 독립 실험·향후 데이터·외부 연구팀이 검증해야 한다.

이때 평가대상은 최종 점수 하나가 아니라 문제정식화, 경쟁가설의 다양성, 반증실험의 판별력, 실패 후 belief revision, ablation의 원인분리, sealed prediction의 신선도, 독립 검증 통과 여부로 확장된다.

§4 · Evaluation Matrix

Autonomous SOTA Improvement와 Einstein-level Discovery를 분리하는 기준

평가축ScientistTwo가 보여준 것강한 Einstein Test에서 추가할 것
Problem Source사람이 연구문제와 human SOTA 제공unpublished / temporally isolated problem
Hypothesis Search복수 아이디어 생성·선별rival hypotheses의 명시적 유지와 독립 novelty audit
Experimentsubset→full benchmark 실행hidden environment 또는 sealed experimental condition
Revision실패 trace 기반 hypothesis evolutioncounter-evidence에 따른 belief-state change 기록
Causal Attribution자동 ablationpre-registered discriminating test와 mechanism falsification
Reviewsimulated peer review→rebuttal experiment→meta-review독립 외부 reviewer와 adversarial replication
Novel Prediction기존 benchmark 중심sealed prediction before future evidence exists
Validation자동·인간 평가independent future validation by external evidence
§5 · Final Interpretation

이번 업데이트의 가장 중요한 경계

AnalysisScientistTwo는 Operational Einstein Test에 필요한 중앙 엔진—가설 생성, 실행, 실패 기반 수정, 원인분리, 비판 대응—을 상당히 구체화한다. 그러나 진짜 Einstein Test는 그 엔진이 이미 알려진 지식공간과 benchmark를 넘어서는지를 검증해야 한다.

강한 Einstein Test의 질문은 “AI가 human SOTA를 넘었는가?”가 아니라 “AI가 사후적으로 숨겨진 정답을 복원한 것이 아니라, 미래에 독립적으로 확인될 새 설명과 예측을 실제로 만들었는가?”이다.
References

이번 업데이트의 직접 근거

본문은 첨부 연구동향 문서가 정리한 ScientistTwo의 실험결과, 인간평가, 제한, Operational Einstein Test 함의를 기준으로 재구성했다. 외부 사실을 추가해 빈칸을 채우지 않았다.

[01]
ScientistTwo: Pioneering the Human Knowledge Frontier with Autonomous AI
arXiv:2609.19644 · 2026-09-17 · Google Cloud AI Research / University of Waterloo
107개 연구문제, autonomous research cycle, failure-based hypothesis evolution, ablation, simulated peer review, human-expert comparison. arXiv · Project