AI Research Blog / Einstein Test2026-09-12
Contamination-resistant Scientific AGI Evaluation

과거의 아인슈타인을 재현시키는 시험에서,
아직 공개되지 않은 현상을 예측하는 시험으로

Prospective Einstein Tests: Unpublished Discovery, Evidence Graphs, and Executable Scientific Verification

SEALED PHENOMENON미공개 현상ABDUCTION + ACTION가설과 판별실험EVIDENCE GRAPH증거와 수정LATER UNBLINDING독립 사후대조COUNTER-EVIDENCE → REVISION BEFORE UNBLINDING

이번 업데이트의 핵심은 공식 Einstein Test 새 버전이 아니라, 미공개 문제를 이용한 prospective discovery + evidence graph + executable action trace라는 세 요소가 한 평가구조로 수렴하기 시작했다는 점이다.

첨부자료는 Einstein Test 자체와 Singularity Gate·SCILAWS-BENCH·TruthInsightBench의 중대한 신규 변경은 확인하지 못했다고 정리한다. 대신 ARCHE, Sci-MMR, AgentActionBench 세 연구를 차세대 Operational Einstein Test에 직접 반영할 가치가 큰 신호로 선별한다.

Evidence Boundary

ARCHE는 contamination-resistant discovery에 더 가까운 초기 사례이지만 문제와 실험 맥락은 인간이 제공했다. 따라서 Problem Discovery까지 달성했다고 해석하지 않는다.

Part I · Evaluation Shift

정답 재현은 발견과 다르다

이미 출판된 유명 발견을 재현시키는 시험은 memorization을 genuine discovery로 오인할 위험이 있다.

ResearchCore contributionEinstein Test implication
ARCHEagentic mechanistic discovery + unpublished reactionprospective contamination resistance
Sci-MMR235 multi-hop tasks + Argument Graphfinal answer와 evidence completeness 분리
AgentActionBench150-paper reproduction + machine-readable action trace실행 여부를 독립 감사

모델이 이미 알고 있는 답을 발견 경로처럼 다시 말하는 것을 막으려면 문제 자체의 시간적·정보적 격리와 process audit가 함께 필요하다.

Part II · ARCHE

미공개 반응 메커니즘을 blind 상태에서 판별한다

Autonomous Chemical Mechanistic Discovery

ARCHE는 범용 reasoning model, 계산화학 특화 모델, tool registry를 결합해 과학 질문 해석 → 메커니즘 가설 생성·우선순위화 → 계산 workflow 실행 → 계산증거 검증 → 가설 수정을 폐루프로 수행한다.

SCIENTIFIC QUESTION → HYPOTHESES → COMPUTATION → EVIDENCE → REVISION

세 사례 중 특히 중요한 것은 recently discovered but unpublished α-iodoboronate C–I cleavage reaction이다. ARCHE는 radical pathway를 제안하고 반복 검증했다.

공개문헌에 정답 메커니즘이 없는 상태에서 hypothesis → computation → evidence → revision을 수행했다는 점이 기존 historical Einstein Test와 질적으로 다르다.

Caution

문제 자체와 실험 맥락은 인간이 제공했다. Mechanism/Hypothesis Discovery의 증거에 가깝고 Problem Discovery의 증거는 아니다.

arXiv · ARCHE · Public code

Part III · Sci-MMR

정답이 맞아도 증거사슬이 비어 있으면 강한 pass가 아니다

Sci-MMR는 4개 과학 분야·35개 도메인에 걸친 235개 multi-hop scientific reasoning task를 구축하고 claim, citation knowledge, figure/table region, evidence를 Argument Graph로 연결한다.

Tasks235

multi-hop reasoning

Domains4 / 35

4개 분야 · 35개 도메인

Models8

frontier multimodal models

final answer accuracy는 complete-evidence recovery보다 일관되게 20%p 이상 높았다. 실패의 57.2%는 evidence acquisition, 31.8%는 evidence integration에서 발생했다.

Final Theory Score와 Evidence Coverage·Claim Coverage·Evidence→Claim dependency consistency를 분리해야 하는 이유이다.

\[\text{Scientific Pass} \neq \text{Final Answer Accuracy Alone}\]

arXiv · Sci-MMR

Part IV · AgentActionBench

말한 실험이 아니라 실제 실행한 실험을 평가한다

AgentActionBench / NLPCC 2026 Shared Task 11은 120개 ML 논문과 30개 AI4Science 논문, 총 150편을 대상으로 paper observation, planning, code implementation, command execution, result matching 전 과정을 평가한다.

MCP 기반 Action Recorder는 모든 Read/Write/Execute를 기록하고 10,000개 이상의 paper-specific rubric으로 trace를 검사한다. 최고 참가 시스템도 전체 약 49.64%였으며 command execution과 result matching이 주요 병목이었다.

실행되지 않은 실험이나 fabricated artifact를 자연어 보고서만으로 성공처럼 보이게 만들 위험 때문에 강한 Einstein Test에는 machine-readable action trace가 필요하다.

READ → PLAN → WRITE → EXECUTE → CAPTURE OUTPUT → MATCH RESULT → AUDIT

arXiv · AgentActionBench overview

Part V · Prospective Einstein Test

가장 강한 시험은 정답이 공개되기 전에 시작한다

\[\boxed{\text{Unpublished/Sequestered Phenomenon}\rightarrow\text{Abductive Hypotheses}\rightarrow\text{Discriminating Computation/Experiment}\rightarrow\text{Evidence}\rightarrow\text{Revision}\rightarrow\text{Later Unblinding}}\]

SCILAWS-PARALLEL은 인공 parallel world로 memorization을 막고 Historical Backtesting은 미래 문헌을 정답으로 사용한다. ARCHE의 unpublished-reaction 사례는 실제 과학영역에서 정답 문헌이 없는 시점의 blind scientific reasoning을 보여주는 초기 사례로 읽을 수 있다.

더 강한 설계는 미공개 현상·sequestered data를 제공하고 AI의 가설·예측을 timestamped seal로 고정한 뒤 실제 인간·실험 결과가 공개되는 시점에 독립 대조하는 것이다.

Analysis

이 방식은 contamination의 핵심 대안설명인 “정답 문헌 암기”를 크게 줄일 수 있다. 다만 인간이 선정한 문제의 편향, tool leakage, 제공 context, experimenter degrees of freedom은 별도 통제가 필요하다.

Part VI · Strong-pass Rubric

최종 이론보다 Discovery Process 전체를 채점한다

LayerQuestionStrong pass
Isolation정답이 공개문헌·학습데이터에서 격리됐는가?unpublished/sequestered + timestamp
Hypotheses경쟁가설과 판별 예측을 만들었는가?abductive alternatives + discrimination
Evidence필요한 증거를 빠짐없이 연결했는가?coverage + dependency consistency
Execution계산·실험을 실제 실행했는가?machine-readable Read/Write/Execute trace
Revision반증 뒤 가설이 실제로 바뀌었는가?pre/post claim-state transition
Unblinding봉인된 예측이 현실과 맞았는가?independent human/experimental comparison

강한 Einstein Test의 pass는 “맞는 이론을 말했다”보다 “미공개 문제에서 증거를 모으고, 판별 실험을 실행하고, 반증에 따라 수정한 뒤, 나중에 현실과 맞았다”에 가까워져야 한다.

이번 확인에서는 직접적인 temporally isolated Einstein Test의 새 공식 benchmark는 나오지 않았다. 그러나 prospective discovery + evidence graph + executable action trace가 결합되며 구현형태는 한층 구체화됐다.

Status Note

첨부자료는 Einstein Test 자체, Singularity Gate, SCILAWS-BENCH, TruthInsightBench의 중대한 변경을 확인하지 못했다고 명시한다. 이 글은 그 공백을 다른 정보로 임의 보충하지 않는다.

References · Source Set

이번 업데이트의 3개 신규 연구

01

2026-09-10. unpublished reaction 사례와 agentic mechanistic discovery loop.

02

2026-09-10. Argument Graph와 evidence acquisition/integration 평가.

03

2026-09-10. 150편 실험재현과 machine-readable action trace.