이번 업데이트의 핵심은 공식 Einstein Test 새 버전이 아니라, 미공개 문제를 이용한 prospective discovery + evidence graph + executable action trace라는 세 요소가 한 평가구조로 수렴하기 시작했다는 점이다.
첨부자료는 Einstein Test 자체와 Singularity Gate·SCILAWS-BENCH·TruthInsightBench의 중대한 신규 변경은 확인하지 못했다고 정리한다. 대신 ARCHE, Sci-MMR, AgentActionBench 세 연구를 차세대 Operational Einstein Test에 직접 반영할 가치가 큰 신호로 선별한다.
ARCHE는 contamination-resistant discovery에 더 가까운 초기 사례이지만 문제와 실험 맥락은 인간이 제공했다. 따라서 Problem Discovery까지 달성했다고 해석하지 않는다.
정답 재현은 발견과 다르다
이미 출판된 유명 발견을 재현시키는 시험은 memorization을 genuine discovery로 오인할 위험이 있다.
| Research | Core contribution | Einstein Test implication |
|---|---|---|
| ARCHE | agentic mechanistic discovery + unpublished reaction | prospective contamination resistance |
| Sci-MMR | 235 multi-hop tasks + Argument Graph | final answer와 evidence completeness 분리 |
| AgentActionBench | 150-paper reproduction + machine-readable action trace | 실행 여부를 독립 감사 |
모델이 이미 알고 있는 답을 발견 경로처럼 다시 말하는 것을 막으려면 문제 자체의 시간적·정보적 격리와 process audit가 함께 필요하다.
미공개 반응 메커니즘을 blind 상태에서 판별한다
Autonomous Chemical Mechanistic Discovery
ARCHE는 범용 reasoning model, 계산화학 특화 모델, tool registry를 결합해 과학 질문 해석 → 메커니즘 가설 생성·우선순위화 → 계산 workflow 실행 → 계산증거 검증 → 가설 수정을 폐루프로 수행한다.
세 사례 중 특히 중요한 것은 recently discovered but unpublished α-iodoboronate C–I cleavage reaction이다. ARCHE는 radical pathway를 제안하고 반복 검증했다.
공개문헌에 정답 메커니즘이 없는 상태에서 hypothesis → computation → evidence → revision을 수행했다는 점이 기존 historical Einstein Test와 질적으로 다르다.
문제 자체와 실험 맥락은 인간이 제공했다. Mechanism/Hypothesis Discovery의 증거에 가깝고 Problem Discovery의 증거는 아니다.
정답이 맞아도 증거사슬이 비어 있으면 강한 pass가 아니다
Sci-MMR는 4개 과학 분야·35개 도메인에 걸친 235개 multi-hop scientific reasoning task를 구축하고 claim, citation knowledge, figure/table region, evidence를 Argument Graph로 연결한다.
multi-hop reasoning
4개 분야 · 35개 도메인
frontier multimodal models
final answer accuracy는 complete-evidence recovery보다 일관되게 20%p 이상 높았다. 실패의 57.2%는 evidence acquisition, 31.8%는 evidence integration에서 발생했다.
Final Theory Score와 Evidence Coverage·Claim Coverage·Evidence→Claim dependency consistency를 분리해야 하는 이유이다.
말한 실험이 아니라 실제 실행한 실험을 평가한다
AgentActionBench / NLPCC 2026 Shared Task 11은 120개 ML 논문과 30개 AI4Science 논문, 총 150편을 대상으로 paper observation, planning, code implementation, command execution, result matching 전 과정을 평가한다.
MCP 기반 Action Recorder는 모든 Read/Write/Execute를 기록하고 10,000개 이상의 paper-specific rubric으로 trace를 검사한다. 최고 참가 시스템도 전체 약 49.64%였으며 command execution과 result matching이 주요 병목이었다.
실행되지 않은 실험이나 fabricated artifact를 자연어 보고서만으로 성공처럼 보이게 만들 위험 때문에 강한 Einstein Test에는 machine-readable action trace가 필요하다.
가장 강한 시험은 정답이 공개되기 전에 시작한다
SCILAWS-PARALLEL은 인공 parallel world로 memorization을 막고 Historical Backtesting은 미래 문헌을 정답으로 사용한다. ARCHE의 unpublished-reaction 사례는 실제 과학영역에서 정답 문헌이 없는 시점의 blind scientific reasoning을 보여주는 초기 사례로 읽을 수 있다.
더 강한 설계는 미공개 현상·sequestered data를 제공하고 AI의 가설·예측을 timestamped seal로 고정한 뒤 실제 인간·실험 결과가 공개되는 시점에 독립 대조하는 것이다.
이 방식은 contamination의 핵심 대안설명인 “정답 문헌 암기”를 크게 줄일 수 있다. 다만 인간이 선정한 문제의 편향, tool leakage, 제공 context, experimenter degrees of freedom은 별도 통제가 필요하다.
최종 이론보다 Discovery Process 전체를 채점한다
| Layer | Question | Strong pass |
|---|---|---|
| Isolation | 정답이 공개문헌·학습데이터에서 격리됐는가? | unpublished/sequestered + timestamp |
| Hypotheses | 경쟁가설과 판별 예측을 만들었는가? | abductive alternatives + discrimination |
| Evidence | 필요한 증거를 빠짐없이 연결했는가? | coverage + dependency consistency |
| Execution | 계산·실험을 실제 실행했는가? | machine-readable Read/Write/Execute trace |
| Revision | 반증 뒤 가설이 실제로 바뀌었는가? | pre/post claim-state transition |
| Unblinding | 봉인된 예측이 현실과 맞았는가? | independent human/experimental comparison |
강한 Einstein Test의 pass는 “맞는 이론을 말했다”보다 “미공개 문제에서 증거를 모으고, 판별 실험을 실행하고, 반증에 따라 수정한 뒤, 나중에 현실과 맞았다”에 가까워져야 한다.
이번 확인에서는 직접적인 temporally isolated Einstein Test의 새 공식 benchmark는 나오지 않았다. 그러나 prospective discovery + evidence graph + executable action trace가 결합되며 구현형태는 한층 구체화됐다.
첨부자료는 Einstein Test 자체, Singularity Gate, SCILAWS-BENCH, TruthInsightBench의 중대한 변경을 확인하지 못했다고 명시한다. 이 글은 그 공백을 다른 정보로 임의 보충하지 않는다.
이번 업데이트의 3개 신규 연구
2026-09-10. unpublished reaction 사례와 agentic mechanistic discovery loop.
2026-09-10. Argument Graph와 evidence acquisition/integration 평가.
2026-09-10. 150편 실험재현과 machine-readable action trace.