AI Research Blog·Operational Einstein Test2026 · 09 · 17
Artificial General Intelligence·AI for Science·Einstein Test

과거 지식을 읽게 하는 것에서
과거의 과학도구만 실행하게 하는 것으로

Operational Einstein Test 2026: Executable Scientific Knowledge, Temporal Isolation, and Counter-Evidence-Driven Revision

PRE-CUTOFF PAPERSVERIFIED PAPER AGENTSISOLATED TOOL UNIVERSECANDIDATE SCIENTISTcutoff 이전 문헌코드·데이터·workflow허용된 지식만 실행가설·검증·수정EVALUATE THE DISCOVERY PROCESS, NOT ONLY THE FINAL ANSWER가설 → 반증실험 → 반대증거 → 믿음수정 → 숨은예측 → 독립검증
Central Update

이번 점검에서는 Einstein Test 자체, SCILAWS-BENCH, TruthInsightBench, Singularity Gate, ARC-AGI 계열에 새로 보고할 정도의 공식 중대 변경은 확인되지 않았다. 대신 Operational Einstein Test를 실제로 더 엄격하게 구현할 수 있는 두 개의 주변 기술 신호가 중요해졌다.

첫째, Paper2Agent의 Nature 정식 게재는 과학논문을 읽을 수 있는 텍스트가 아니라 검증 가능한 실행도구로 변환하는 방향을 보여준다. 둘째, GPT-6 Astra 기반 2D-CFET 사례는 초기 가설이 계산증거에 의해 반박될 때 설계 방향을 바꾸고, 독립 재현과 실패 구현까지 보존하는 counter-evidence-driven revision의 작은 실증사례를 제공한다.

차세대 Einstein Test는 “정답을 아는가?”보다 허용된 과거지식만으로 경쟁가설을 만들고, 반대증거 때문에 믿음을 수정하며, 숨은 예측을 독립적으로 검증할 수 있는가를 물어야 한다.Source-grounded synthesis
Part I · §1-§2

직접적인 Einstein Test 업데이트는 없었다

중복 leaderboard 변동이나 경미한 버전수정은 제외하고, 연구방향을 바꿀 수 있는 변화만 남겼다.

§1 · Status Check

벤치마크 본체보다 평가환경을 만드는 기반기술이 움직였다

Source fact이전 실행 이후 신규 공개분과 공식 benchmark·journal update를 다시 확인했지만, Einstein Test 자체, SCILAWS-BENCH, TruthInsightBench, Singularity Gate, ARC-AGI 계열에는 공식적으로 중대한 변경이 확인되지 않았다.

이번 주기의 의미는 새로운 “Einstein Test 점수”가 아니라 temporal isolation과 scientific revision을 구현할 기술적 구성요소가 구체화됐다는 것에 있다.

§2 · Two Signals

실행 가능한 과거지식과 반대증거 기반 믿음수정

Paper2Agent

논문·코드·데이터·workflow를 provenance-preserving executable agent로 바꿔 tool-level temporal isolation을 설계할 가능성을 연다.

2D-CFET with GPT-6 Astra

초기 직관을 computational evidence가 반박하면 설계를 수정하고, cross-agent reproduction과 failure case를 함께 남긴다.

Part II · §3-§5

Paper2Agent: 논문을 “읽는 자료”에서 “실행 가능한 과학자산”으로 바꾼다

2025년 preprint로 알려졌던 Paper2Agent가 2026년 9월 16일 Nature의 peer-reviewed version of record로 정식 출판되면서 평가 규모도 크게 확장됐다.

§3 · Executable Paper Agent

논문 하나를 virtual corresponding author로 변환한다

Source factPaper2Agent는 Jiacheng Miao, Joe R. Davis, Yaohui Zhang, Jonathan K. Pritchard, James Zou의 Stanford University 연구다. 논문·코드·데이터·workflow를 MCP 서버로 변환해 각 논문을 실행 가능한 “virtual corresponding author”로 만든다. 생성된 도구는 원 코드의 결과·그림과 대조하여 자동 검증한 뒤 고정한다.

핵심은 scientific knowledge를 prose가 아니라 provenance가 남는 executable tool로 변환한다는 데 있다.

§4 · Expanded Evaluation

136편 end-to-end 처리와 300개 실행형 benchmark question

136
Total Papers
100 computational biology + 26 data/discovery + 10 non-biology computational papers
74
Agentified Papers
successfully agentified computational-biology papers used for benchmark
300
Executable Questions
benchmark questions built from those agents
rs1626703
ADHD Candidate
with MPHOSPH9 splicing/expression mechanism hypothesis

여러 paper-agent를 결합해 psoriasis 관련 causal gene을 우선순위화했고, ADHD GWAS 사례에서는 209개 후보 중 rs1626703을 causal candidate로 도출하고 MPHOSPH9 splicing/expression 변화라는 검증 가능한 메커니즘 가설을 생성했다.

Limitation저자들은 open-ended hypothesis generation과 mechanistic interpretation은 여전히 human-in-the-loop라고 명시한다. 또한 단일 reference answer와의 일치는 과학적 타당성 그 자체보다 faithful execution을 측정한다.

§5 · Einstein Test Relevance

문헌 수준의 cutoff를 도구 수준의 cutoff로 강화한다

Analysistemporally isolated Einstein Test의 오래된 난점은 과거지식을 text corpus로만 제공하면 provenance·실행가능성·재현성의 경계를 엄격히 통제하기 어렵다는 점이다.

\[\text{Pre-cutoff Papers}\rightarrow\text{Verified Paper Agents}\rightarrow\text{Isolated Scientific Tool Universe}\rightarrow\text{Candidate Scientist}\]

Paper2Agent식 구조라면 historical paper 각각을 paper → executable agent → provenance-preserving scientific tool로 바꾸고, 시험 시점 이전의 paper agent만 연결한 뒤 post-cutoff agent를 물리적으로 차단할 수 있다. 이는 단순 RAG보다 강한 tool-level temporal isolation을 설계할 수 있다는 뜻이다.

Boundary그러나 이것은 Einstein-level discovery의 증거가 아니라 차세대 평가 인프라의 후보이다. knowledge reuse와 genuine discovery는 분리해 평가해야 한다.

Part III · §6-§8

2D-CFET 사례: 처음 맞히는 능력보다 틀린 가설을 버리는 능력

GPT-6 Astra 기반 AI-scientist workflow는 주어진 electrothermal model 안에서 설계를 탐색했고, 초기 직관이 계산증거와 충돌하자 설계 방향을 수정했다.

§6 · Hypothesis Reversal

“상부 interconnect를 넓히면 냉각이 좋아질 것”이라는 직관이 반박됐다

Source factMin-Hui Kim(UNIST), Khushi Sharma(NUS), Sarah Zhang(Cornell), Ye Wang(Eindhoven University of Technology)의 연구는 2026년 9월 15일 arXiv v1으로 공개됐다. Astra가 2D-CFET source-interconnect geometry를 탐색했고 coordinating agent가 substrate-directed heat-removal path를 추가 제안했다.

초기의 “상부 interconnect를 넓히면 냉각이 좋아질 것”이라는 가설은 계산에서 지지되지 않았다. workflow는 그 결과를 받아들여 더 좁고 재배치된 구조로 이동했다. 중요한 것은 첫 직관의 정확도가 아니라 evidence가 설계 방향을 바꾸게 했다는 점이다.

§7 · Reported Results

냉각 이득과 전기적 trade-off를 함께 기록한다

1.67 K
Peak ΔT Reduction
same metal volume · 20 μW
≈0.6 K
Inverter Cooling
self-consistent evaluation with metal resistance
2.2%
nFET On-Current
reported decrease in the trade-off evaluation
104.95 K
Preserved Failure
large-error implementation retained rather than deleted

여러 모델이 동일 코드를 독립 재구현해 거의 동일한 결과를 냈지만 한 모델은 104.95 K의 큰 오류를 냈다. 저자들은 이 실패를 삭제하지 않고 failure case로 보존했다.

Limitation실험적 device validation은 아직 수행되지 않았다. 연구문제·모델·search domain도 인간이 주었고 temporal isolation이 없었다. 따라서 autonomous problem discovery나 Einstein-level conceptual revolution을 입증한 사례는 아니다.

§8 · Evaluation Meaning

Hypothesis → Counter-evidence → Revision → Reproduction

\[\text{Hypothesis}\rightarrow\text{Counter-evidence}\rightarrow\text{Revision}\rightarrow\text{Reproduction}\]

Analysis기존 AI-for-science 데모가 후보 생성과 최적화에 초점을 맞추는 경우가 많았다면, 이 사례는 computational evidence가 초기 가설을 무너뜨린 뒤 설계가 바뀐다는 점에서 belief revision을 직접 평가할 수 있는 작은 단위를 제공한다.

cross-agent reproduction과 실패 구현의 보존은 최종 성공물만 점수화하지 말고 오류율, 수정경로, 재현가능성을 함께 봐야 한다는 평가원칙을 강화한다.

Part IV · §9-§10

Operational Einstein Test 2.0: 시간격리를 “실행 가능한 지식우주”로 구현한다

pre-cutoff text만 보여주는 것보다, 그 시대에 실제로 허용됐을 계산·데이터·workflow만 실행 가능한 environment를 만드는 쪽이 더 엄격한 시험이 된다.

§9 · Stronger Temporal Isolation

무엇을 알고 있는지뿐 아니라 무엇을 실행할 수 있는지를 제한한다

기존 temporal isolation은 보통 문헌 cutoff와 데이터 cutoff에 초점을 둔다. Paper2Agent가 제공하는 아이디어는 이를 한 단계 강화한다. cutoff 이전 paper를 검증된 executable agent로 변환하고, 그 agent만 호출 가능한 scientific tool universe를 구성하는 방식이다.

이 구조에서는 candidate scientist가 어떤 historical knowledge와 code path를 실제로 호출했는지 provenance로 추적할 수 있다. post-cutoff knowledge를 단지 prompt로 금지하는 대신 tool graph 자체에서 제거할 수 있다는 점이 중요하다.

§10 · Discovery vs Reuse

과거 도구를 잘 조합하는 것과 새로운 개념을 발견하는 것은 다르다

AnalysisPaper2Agent가 강한 tool-level isolation을 가능하게 해도, 그것만으로 genuine discovery가 성립하지는 않는다. historical tool의 조합으로 답을 복원하는 능력과 새 problem formulation, rival hypothesis, discriminating experiment, hidden prediction을 생성하는 능력은 분리해야 한다.

Operational Einstein Test의 목표는 “과거 논문을 더 잘 검색하는 AI”를 찾는 것이 아니다. 과거의 도구세계 안에서 반증 가능한 새로운 설명을 만들고, 틀렸을 때 수정할 수 있는 AI를 시험하는 데 있다.Interpretive boundary
Part V · §11-§13

차세대 평가축은 “정답”보다 발견과 수정의 과정으로 수렴한다

현재 추적을 종합하면 Einstein Test의 핵심은 temporal isolation에서 시작해 독립 verification으로 끝나는 일련의 scientific epistemic loop에 가깝다.

§11 · Evaluation Spine

Counter-evidence-driven Revision이 가운데 놓인다

\[\text{Temporal Isolation}\rightarrow\text{Problem Formulation}\rightarrow\text{Rival Hypotheses}\rightarrow\text{Discriminating Test}\rightarrow\boxed{\text{Counter-evidence-driven Revision}}\rightarrow\text{Hidden Prediction}\rightarrow\text{Independent Verification}\]

이 순서에서 중요한 것은 실패가 감점요소로만 취급되지 않는다는 점이다. 잘못된 가설을 얼마나 빨리, 어떤 증거 때문에, 어떤 대안으로 교체했는지가 오히려 과학적 지능의 핵심 신호가 될 수 있다.

§12 · Suggested Scoring Dimensions

결과와 과정, provenance를 함께 점수화한다

평가축핵심 질문이번 업데이트가 주는 근거
Temporal Isolationpost-cutoff knowledge와 tool이 실제로 차단됐는가?Paper2Agent를 통한 verified pre-cutoff tool universe 구성이 가능해질 수 있다.
Problem Formulation주어진 문제를 그대로 푸는 것을 넘어 새로운 질문을 정식화하는가?Paper2Agent는 open-ended reasoning이 아직 human-in-the-loop임을 명시한다.
Rival Hypotheses서로 경쟁하는 설명을 명시적으로 유지하는가?단일 정답 일치보다 discovery process 평가가 필요하다는 점과 연결된다.
Discriminating Test가설을 구분할 실험·계산을 스스로 설계하는가?2D-CFET는 computational evidence가 설계 가설을 걸러내는 사례를 제공한다.
Belief Revision반대증거 때문에 기존 가설을 실제로 버리는가?초기 wider-interconnect 직관이 반박된 뒤 설계가 수정됐다.
Hidden Prediction학습에 노출되지 않은 새로운 예측을 생성하는가?이번 신규 사례만으로 강하게 입증되지는 않았다.
Independent Verification다른 agent·코드·실험이 결론을 재현하는가?cross-agent reproduction과 failure-case preservation이 평가기준을 강화한다.
§13 · Final Update

새 benchmark는 없지만 평가환경의 설계 언어가 선명해졌다

Status이번 실행에서 직접적인 신규 Einstein Test 또는 temporal-isolation benchmark 출시는 확인되지 않았다.

Inference그러나 Paper2Agent의 Nature 정식 게재는 향후 Operational Einstein Test를 구현하는 provenance-preserving, executable historical knowledge environment의 현실적인 구성요소가 될 수 있다. 2D-CFET 사례는 그 환경 안에서 평가해야 할 행동—반대증거에 의한 수정과 재현—을 더 구체적으로 보여준다.

References

이번 업데이트의 직접 근거

본문은 첨부 연구동향 문서가 제시한 신규 변화 두 건과 상태점검을 기준으로 재구성했다. 외부 사실을 추가로 보강하지 않았다.

[01]
Reimagining research papers as interactive and reliable AI agents
Nature · 2026-09-16 · Stanford University
Paper2Agent의 peer-reviewed version of record. 논문·코드·데이터·workflow를 verified executable paper agent로 변환한다. Nature · Research Briefing
[02]
AI for Science with GPT-6 Astra: Thermal Design and Electrothermal Analysis of 2D CFET
arXiv:2609.17123 · 2026-09-15
반대 계산증거에 따른 설계수정, cross-agent reproduction, failure preservation을 포함하는 AI-for-science 사례. arXiv · HTML