AI Research Blog/Operational Einstein TestScientific Discovery · Contamination Audit · 2026-09-09
Einstein Test Research WatchBlind DiscoveryWeight-Level ContaminationPrivate Tasks

아인슈타인의 답을 기억하는 AI와, 아인슈타인처럼 발견하는 AI를 어떻게 구별할 것인가

Contamination-Resistant Operational Einstein Tests: From Target Recovery to Evidence-Grounded Scientific Discovery

Editorial Abstract

이번 업데이트의 핵심은 새로운 Einstein Test 버전이 아니다. 더 중요한 변화는 “발견을 평가하는 법”과 “기억을 발견으로 오인하지 않는 법”이 동시에 구체화되기 시작했다는 점이다.

TruthInsightBench는 과학 agent가 숨겨진 원 논문의 정답을 얼마나 잘 복원하는지보다 스스로 만든 claim이 evidence, control, robustness, generalization, novelty, falsifiability를 얼마나 견디는지를 평가한다. Molecular Déjà Vu는 그보다 한 단계 더 불편한 사실을 드러낸다. 웹과 RAG를 과거 시점으로 제한해도 model weights에 미래의 published value가 들어 있으면 historical isolation은 무너질 수 있으며, reasoning effort를 높이는 것이 오히려 memorized retrieval을 강화할 수도 있다. Artificial Analysis Intelligence Index v4.3은 공개·포화 benchmark에서 private held-out agentic workflow와 더 어려운 execution task로 이동하는 평가 생태계의 변화를 보여준다.

Source Boundary

첨부 자료는 이번 확인에서 Einstein Test 자체의 신규 버전이나 Singularity Gate의 중대한 변경을 확인하지 못했다고 명시한다. 아래 글은 그 자료가 선별한 세 변화만을 바탕으로 Operational Einstein Test의 설계 함의를 재구성하며, source에 없는 실험 결과나 기관 소속은 추가하지 않는다.

TruthInsightBench
40

40편의 peer-reviewed 연구·10개 과학 분야에서 만든 blind discovery task 수.

Evaluation Rubric
6 / 29

6개 평가 차원과 29개 세부 항목.

Molecular Déjà Vu
22 × 12

22개 frontier model과 12개 molecular-property regression benchmark.

Reasoning Sensitivity
+89%

동일 molecule·prompt에서 reasoning effort 증가 시 retrieval detection 증가.

Part I · Discovery Is Not Target Recovery

과거의 정답을 다시 찾는 것과 새로운 과학을 만드는 것은 다르다

Operational Einstein Test가 어려운 이유는 정답 여부보다 발견 과정의 정당성을 판별해야 하기 때문이다.

§1 · The Old Failure Mode

“원 논문 결과를 재현했는가?”가 발견의 대리변수가 되어 왔다

과학 agent benchmark는 종종 이미 존재하는 연구를 숨기고, agent가 그 결과를 다시 도출하는지 측정한다. 이런 형식은 재현성이나 분석 능력을 보기에는 유용하지만, transformative discovery를 측정하기에는 구조적인 문제가 있다. 정답을 알고 있는 평가자가 reference finding과의 일치를 점수화하면, null result·counterexample·scope boundary 같은 과학적으로 중요한 산출물이 오답 처리될 수 있기 때문이다.

이번 업데이트는 이 문제를 target recovery와 scientific discovery의 차이로 다시 정리한다. 과학은 과거의 답을 복원하는 활동만이 아니다. 기존 이론이 특정 조건에서 틀렸음을 보이는 일, 효과가 없다는 null result를 확인하는 일, 적용 범위를 좁히는 일도 모두 지식의 전진일 수 있다.

Einstein Test가 평가해야 할 것은 “아인슈타인의 결론을 맞혔는가”가 아니라, 정답을 모르는 상태에서 어떤 claim을 만들고 그것을 얼마나 엄격하게 시험했는가이다.
§2 · Two Simultaneous Problems

발견 평가와 contamination 통제가 동시에 필요하다

이번 자료가 중요한 이유는 두 문제가 같은 시점에 선명해졌기 때문이다. 첫째, discovery benchmark가 reference-answer similarity에서 evidentiary maturity로 이동한다. 둘째, foundation model의 내부 기억이 과거 재발견 시험을 오염할 수 있음이 숫자로 드러난다.

Problem A · Evaluation

좋은 scientific claim은 reference answer와 얼마나 비슷한가가 아니라 evidence, controls, robustness, novelty, falsifiability를 얼마나 견디는가로 평가해야 한다.

Problem B · Isolation

RAG와 web만 cutoff 이전으로 제한해도 model weights 안의 미래 지식을 제거하지 못하면 rediscovery와 recall을 구별할 수 없다.

Part II · TruthInsightBench

정답을 숨기고, claim의 evidentiary maturity를 평가한다

이번 업데이트에서 Operational Einstein Test와 가장 직접적으로 연결되는 신규 benchmark이다.

§3 · Blind Discovery Task

원 논문·기대값·분석경로·reference finding을 숨긴다

TruthInsightBench: An Evidence-Grounded Benchmark for Automated Evaluation of Open-Ended Scientific Discovery Agents는 40편의 peer-reviewed 연구와 10개 과학 분야를 바탕으로 40개의 blind discovery task를 만든다. Agent에게는 중립적 연구목표, frozen data, metadata, literature cutoff \(T_0\)만 제공하고 source paper, expected value, analysis path, reference finding은 숨긴다.

\[\tau=(g,D,M,T_0\mid p^*,F^*,A^*)\]

첨부 자료는 이 형식을 temporal-isolation protocol의 실질적 형식화에 가까운 구조로 해석한다. 핵심은 “정답을 얼마나 잘 따라갔는가”보다 agent가 제한된 역사적 정보와 데이터만으로 어떤 연구질문·분석·claim을 구성하는지를 보는 데 있다.

§4 · Six Dimensions, Twenty-Nine Items

평가축이 answer similarity에서 evidence quality로 이동한다

DimensionWhy it matters for an Einstein Test
Evidence auditabilityclaim이 어떤 데이터·분석·artifact에서 나왔는지 추적할 수 있어야 한다.
Robustness분석 선택이나 작은 조건 변화에 결론이 쉽게 무너지지 않는지 본다.
Controls경쟁 설명과 confounder를 배제하기 위한 대조·검증이 있는지 본다.
Cross-dataset generalization한 데이터셋의 우연한 패턴을 발견으로 오인하지 않는지 본다.
Novelty주어진 정보에서 단순 요약이 아니라 새 claim을 구성했는지 본다.
Falsifiability무엇이 틀리면 claim을 버릴 것인지 명시할 수 있는지 본다.

전체 평가는 6개 차원·29개 항목으로 구성된다. 네 coding agent를 동일한 frozen base model로 통제했을 때 총점은 58.4–60.3점의 좁은 구간에 머물렀고, 특히 control testing, robustness, falsifiability, cross-dataset generalization이 약했다.

Source Fact

첨부 자료가 보고하는 58.4–60.3점은 같은 frozen base model을 사용한 네 coding agent 비교의 결과이다. 다른 foundation model 간 순위로 해석하면 안 된다.

§5 · Why Null Results Matter

정답과 다르더라도 좋은 과학일 수 있다

TruthInsightBench의 중요한 철학은 null result, counterexample, scope boundary도 올바른 scientific output으로 인정하는 데 있다. 이는 “reference answer와 일치해야만 성공”이라는 benchmark 관성을 끊는다. Operational Einstein Test에서 discovery quality는 target recovery가 아니라 evidence가 허용하는 최선의 결론을 만드는 능력이어야 한다.

Part III · Molecular Déjà Vu

웹을 과거로 돌려도 모델의 기억은 과거로 돌아가지 않는다

temporal isolation의 가장 약한 고리가 retrieval system이 아니라 model weights일 수 있음을 보여준다.

§6 · Prediction or Retrieval?

숫자를 맞힌 것이 예측인지 기억인지 분리한다

Molecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models는 22개 frontier model을 12개 molecular-property regression benchmark에서 검사해 실제 prediction과 이미 학습한 published numerical value의 retrieval을 구별한다. 5개 benchmark에서는 절반이 넘는 모델에서 verbatim retrieval signal이 나타났다.

더 중요한 결과는 동일한 molecule과 동일한 prompt에서도 reasoning effort를 높였을 때 retrieval detection이 89% 증가했다는 점이다. transformed SMILES와 원래 label을 조합한 blinding을 사용해도 강한 모델에서는 기억된 값의 흔적이 남았다.

§7 · Historical RAG Isolation Is Not Enough

검색 격리와 지식 격리는 같은 것이 아니다

\[\text{Historical RAG isolation}\not\Rightarrow\text{Historical knowledge isolation}\]

Einstein Test에서 흔히 생각할 수 있는 안전장치는 “cutoff 이후 문헌과 web access를 금지한다”는 방식이다. Molecular Déjà Vu가 제기하는 문제는 그보다 깊다. 모델의 pretraining weights에 이미 이후 published value가 들어 있다면, 외부 검색을 막아도 미래 지식은 내부에서 다시 호출될 수 있다.

Critical Risk

더 많은 test-time reasoning이 더 많은 genuine reasoning을 보장하지 않는다. 특정 조건에서는 더 큰 reasoning budget이 latent memorization을 끌어내는 통로가 될 수 있다.

§8 · Four New Audit Layers

강한 temporal isolation은 model 내부까지 검사해야 한다

첨부 자료는 이 결과를 Operational Einstein Test의 직접적인 설계 요구로 연결한다.

  • Weight-level contamination audit — 평가 대상 사건 이후 지식이 model weights에 들어 있는지 검사한다.
  • Digit/formula-level retrieval probe — 과거에 공개된 수치·식의 verbatim retrieval 흔적을 찾는다.
  • Representation transformation test — 입력 표현을 변형해도 기억된 값이 복원되는지 본다.
  • Reasoning-level sensitivity analysis — reasoning effort 변화가 genuine inference와 memorized retrieval에 어떤 영향을 주는지 분리한다.
Analysis

이 네 층은 “검색기록을 감사한다”는 수준을 넘어 model을 하나의 잠재적 정보채널로 취급한다는 점에서 의미가 있다. Operational Einstein Test는 데이터셋 오염뿐 아니라 model-state contamination까지 threat model에 넣어야 한다.

Part IV · Private, Dynamic, Execution-Grounded Evaluation

공개 QA benchmark의 수명은 짧아지고 있다

Artificial Analysis Intelligence Index v4.3은 직접적인 scientific discovery benchmark는 아니지만 AGI 평가 생태계가 어디로 이동하는지 보여준다.

§9 · Intelligence Index v4.3

private held-out agentic workflow와 harder execution task의 비중이 커진다

2026년 9월 7일 공개된 Artificial Analysis Intelligence Index v4.3은 Terminal-Bench를 v4.0으로 강화하고 private held-out set을 사용하는 AutomationBench-AA를 새로 추가했다. v4.3은 AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0, SciCode, HLE, GDP.pdf 등을 포함한 10개 평가로 구성된다.

첨부 자료가 인용한 당시 지표에서는 Claude Fable 5.1과 GPT-6 Astra가 모두 종합 53점으로 선두이며, Terminal-Bench v4는 software뿐 아니라 ML, science, operations, security, hardware를 포괄하는 복합 terminal 작업을 평가한다. 66개 task를 3회 반복한다.

§10 · Benchmark Half-Life

포화된 공개 문제보다 비공개·동적 작업으로 이동한다

첨부 자료는 9월 4일 v4.2에서 saturated GPQA Diamond가 제거되고 private held-out 비중이 확대된 뒤, 불과 사흘 후 v4.3에서 다시 private agentic workflow와 harder execution task가 강화된 점을 강조한다. 이는 고정 공개 benchmark가 frontier model을 장기간 구별하기 어렵다는 평가 현실을 반영한다.

Analysis

Einstein Test 역시 유명한 historical discovery problem을 공개 목록으로 고정하면 결국 training data, benchmark tuning, memorization의 영향을 받는다. 따라서 평가문제 자체가 private, dynamic, agentic, execution-grounded해야 한다는 압력이 커진다.

§11 · Important Boundary

Artificial Analysis Index는 scientific discovery benchmark가 아니다

v4.3의 53점이나 Terminal-Bench 결과를 Einstein Test 성능으로 읽으면 안 된다. 이번 업데이트에서 이 자료의 의미는 과학발견 능력의 직접 증거가 아니라, 공개 정적 QA에서 private execution benchmark로 이동하는 평가 방법론의 방향성에 있다.

Part V · A Strong Operational Einstein Test

발견 과정 전체를 하나의 falsifiable trajectory로 본다

이번 추적 결과를 반영하면 historical cutoff 하나가 아니라 isolation, formulation, hypothesis, falsification, prediction, generalization, revision이 이어지는 구조가 필요하다.

§12 · The Core Pipeline

Weight-Level Temporal Isolation에서 Belief Revision까지

1 · IsolateWeight-Level Temporal Isolation
2 · FormulateProblem Formulation
3 · ReframeRepresentation Shift
4 · HypothesizeAbductive Hypothesis
5 · ChallengeControls / Rival Explanations
6 · FalsifyAdversarial Falsification
7 · PredictHidden Prediction
8 · GeneralizeCross-Dataset Generalization
9 · ReviseBelief Revision

이 pipeline의 목적은 특정 과거 논문의 결론을 복원하는 것이 아니다. claim이 어떻게 만들어졌고, 어떤 반대 설명을 견뎠으며, 숨겨진 예측과 새로운 데이터에서 살아남았고, 실패했을 때 belief를 실제로 수정했는지를 평가하는 데 있다.

§13 · Why “Truly Cutoff-Trained” Matters

TruthInsightBench 방식만으로는 weight contamination을 제거하지 못한다

TruthInsightBench는 source study 이전에 literature cutoff를 두지만, 첨부 자료가 지적하듯 modern model의 pretraining weights에 source paper가 이미 포함되어 있을 가능성까지 제거하지는 못한다. 따라서 더 강한 Operational Einstein Test에서는 blind discovery protocol과 truly cutoff-trained model을 결합하는 접근이 필요하다.

Inference

이 요구는 구현 비용이 매우 높을 수 있다. 그러나 목표가 historical rediscovery가 아니라 genuinely isolated scientific discovery라면, 모델 자체의 학습시점과 evaluation event의 시간관계를 평가설계의 일부로 취급해야 한다.

Part VI · Cross-Cutting Verification

세 개의 횡단 계층이 전체 pipeline을 감싼다

Contamination Audit, Private/Dynamic Tasks, Artifact-Grounded Verification은 특정 단계의 기능이 아니라 전체 발견 trajectory에 적용되는 검증 규칙이다.

§14 · Three Cross-Cutting Layers

발견을 주장하기 전에 출처·과제·artifact를 독립적으로 확인한다

\[\text{Contamination Audit}+\text{Private/Dynamic Tasks}+\text{Artifact-Grounded Verification}\]
Contamination Audit

retrieval log만이 아니라 weights, memorized digits/formulas, transformed representation, reasoning sensitivity까지 검사한다.

Private / Dynamic Tasks

공개 historical question set이 학습·튜닝의 대상이 되지 않도록 비공개 또는 동적으로 생성되는 discovery task를 사용한다.

Artifact-Grounded Verification

논리적으로 그럴듯한 prose가 아니라 코드, 분석결과, control, prediction, dataset transfer 같은 실행 artifact를 근거로 판정한다.

§15 · Failure Taxonomy

Operational Einstein Test가 구별해야 할 다섯 종류의 가짜 성공

False success modeWhat it looks likeCountermeasure
Target recovery숨겨진 원 논문의 답을 복원했지만 새로운 claim 형성은 약함blind open-ended claim + evidentiary maturity
Weight memorizationcutoff 이후 published value를 model weights에서 검색weight contamination / digit-level probes
Benchmark overfitting공개 문제 형식에 특화된 전략으로 높은 점수를 획득private / dynamic task generation
Evidence-light eloquence그럴듯한 설명은 있으나 controls·artifact·generalization이 부족artifact-grounded verification
Unrevised failure반증이 나와도 원래 hypothesis를 유지하거나 표현만 수정explicit belief revision scoring
§16 · What Becomes the Score?

정답 일치가 아니라 discovery trajectory의 성숙도가 평가대상이 된다

이번 자료의 세 흐름을 결합하면 Einstein Test의 점수는 단일 accuracy보다 다차원적인 것이 자연스럽다. 예를 들어 evidence auditability, controls, falsifiability, hidden prediction, cross-dataset generalization, belief revision 같은 항목을 묶고 contamination confidence를 별도 조건으로 두는 방식이다.

Inference

이것은 첨부 자료의 직접 benchmark formula가 아니라 설계적 종합이다. 핵심은 높은 discovery score가 오염 통과 실패를 상쇄할 수 없도록 contamination audit을 별도의 gate로 두는 것이 더 안전하다는 점이다.

Part VII · What This Changes

이제 역사적 cutoff만으로는 “발견”을 증명할 수 없다

강한 Einstein Test의 질문은 답을 아는가가 아니라 기억을 배제한 상태에서 evidence와 반증을 이용해 지식을 실제로 갱신할 수 있는가이다.

§17 · The Central Thesis

“아인슈타인의 답”과 “아인슈타인의 종류의 발견”을 분리한다

아인슈타인의 답을 다시 말하는 AI와 아인슈타인이 했던 종류의 발견을 하는 AI를 구별하려면, historical cutoff만으로는 부족하다. 모델 내부 기억을 감사하고, reference answer를 숨기며, agent가 선택한 claim이 control·반증·일반화·수정을 견디는지 확인해야 한다.

Synthesis of the attached Einstein Test research update
§18 · Open Problems

이번 업데이트가 남긴 네 개의 연구문제

1 · Weight-level temporal isolation

대규모 frontier model에서 특정 historical event 이후 지식의 부재를 얼마나 강하게 증명할 수 있는가.

2 · Discovery without reference answers

reference finding과의 유사성을 사용하지 않고 open-ended discovery quality를 얼마나 신뢰성 있게 평가할 수 있는가.

3 · Dynamic task generation

비공개이면서도 difficulty, domain coverage, reproducibility를 유지하는 discovery task를 어떻게 지속 생성할 것인가.

4 · Artifact-level falsification

prose judge가 아니라 code, data, controls, predictions, replication artifact를 이용해 claim을 자동 검증하는 방법을 어떻게 설계할 것인가.

§19 · Key Takeaways

이번 업데이트를 일곱 문장으로 압축하면

01 · No new Einstein Test version

이번 확인에서 Einstein Test 자체의 신규 버전이나 Singularity Gate의 중대한 변경은 확인되지 않았다.

02 · TruthInsightBench

40개 blind discovery task를 reference-answer similarity가 아니라 evidence maturity로 평가한다.

03 · Weak dimensions

동일 frozen base model 조건에서 네 coding agent는 58.4–60.3점에 머물렀고 controls, robustness, falsifiability, cross-dataset generalization이 약했다.

04 · Molecular Déjà Vu

22개 model·12개 benchmark 분석은 published numerical value의 기억이 prediction처럼 보일 수 있음을 보여준다.

05 · Reasoning can retrieve memory

reasoning effort 증가가 genuine reasoning뿐 아니라 memorized retrieval을 강화할 수 있다.

06 · Benchmark ecology shifts

Artificial Analysis v4.3은 private held-out agentic workflow와 harder execution task의 비중을 높였다.

07 · Strong Einstein Test

weight-level isolation + blind discovery + adversarial falsification + hidden prediction + generalization + revision이 하나의 trajectory로 평가되어야 한다.

Cross-Cutting Rule

Contamination Audit, Private/Dynamic Tasks, Artifact-Grounded Verification은 전체 과정에 별도 gate로 적용되어야 한다.

Source Reference Map

References

첨부 연구동향 문서가 직접 제시한 출처를 그대로 유지한다.

01
TruthInsightBench: An Evidence-Grounded Benchmark for Automated Evaluation of Open-Ended Scientific Discovery Agents
Yang · Zhang · Zhang · Wang · arXiv:2609.05079 · 4 Sep 2026

40개의 blind discovery task와 evidence auditability, robustness, controls, cross-dataset generalization, novelty, falsifiability 기반 평가의 핵심 출처. 첨부 자료는 공개 arXiv metadata에서 기관 소속을 추정하지 않는다.

02
Molecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models
Busch et al. · arXiv:2609.05381 · 4 Sep 2026

22개 frontier model·12개 molecular-property regression benchmark에서 numerical-value retrieval과 reasoning sensitivity를 분석한 출처.

03
ORCID record cited by the source document
Author affiliation reference

첨부 자료가 Molecular Déjà Vu 연구진 중 Hamburg University of Technology 소속 연구자가 포함됨을 확인할 때 사용한 출처.

04
Announcing the Artificial Analysis Intelligence Index v4.3
Artificial Analysis · 7 Sep 2026

AutomationBench-AA, Terminal-Bench v4.0, 10개 평가 구성과 private agentic workflow 중심의 평가 개편을 설명한 출처.