이번 점검에서는 Einstein Test 자체, SCILAWS-BENCH, TruthInsightBench, Singularity Gate, ARC-AGI 계열에 새로 보고할 정도의 공식 중대 변경은 확인되지 않았다. 대신 Operational Einstein Test를 실제로 더 엄격하게 구현할 수 있는 두 개의 주변 기술 신호가 중요해졌다.
첫째, Paper2Agent의 Nature 정식 게재는 과학논문을 읽을 수 있는 텍스트가 아니라 검증 가능한 실행도구로 변환하는 방향을 보여준다. 둘째, GPT-6 Astra 기반 2D-CFET 사례는 초기 가설이 계산증거에 의해 반박될 때 설계 방향을 바꾸고, 독립 재현과 실패 구현까지 보존하는 counter-evidence-driven revision의 작은 실증사례를 제공한다.
직접적인 Einstein Test 업데이트는 없었다
중복 leaderboard 변동이나 경미한 버전수정은 제외하고, 연구방향을 바꿀 수 있는 변화만 남겼다.
벤치마크 본체보다 평가환경을 만드는 기반기술이 움직였다
Source fact이전 실행 이후 신규 공개분과 공식 benchmark·journal update를 다시 확인했지만, Einstein Test 자체, SCILAWS-BENCH, TruthInsightBench, Singularity Gate, ARC-AGI 계열에는 공식적으로 중대한 변경이 확인되지 않았다.
이번 주기의 의미는 새로운 “Einstein Test 점수”가 아니라 temporal isolation과 scientific revision을 구현할 기술적 구성요소가 구체화됐다는 것에 있다.
실행 가능한 과거지식과 반대증거 기반 믿음수정
Paper2Agent
논문·코드·데이터·workflow를 provenance-preserving executable agent로 바꿔 tool-level temporal isolation을 설계할 가능성을 연다.
2D-CFET with GPT-6 Astra
초기 직관을 computational evidence가 반박하면 설계를 수정하고, cross-agent reproduction과 failure case를 함께 남긴다.
Paper2Agent: 논문을 “읽는 자료”에서 “실행 가능한 과학자산”으로 바꾼다
2025년 preprint로 알려졌던 Paper2Agent가 2026년 9월 16일 Nature의 peer-reviewed version of record로 정식 출판되면서 평가 규모도 크게 확장됐다.
논문 하나를 virtual corresponding author로 변환한다
Source factPaper2Agent는 Jiacheng Miao, Joe R. Davis, Yaohui Zhang, Jonathan K. Pritchard, James Zou의 Stanford University 연구다. 논문·코드·데이터·workflow를 MCP 서버로 변환해 각 논문을 실행 가능한 “virtual corresponding author”로 만든다. 생성된 도구는 원 코드의 결과·그림과 대조하여 자동 검증한 뒤 고정한다.
핵심은 scientific knowledge를 prose가 아니라 provenance가 남는 executable tool로 변환한다는 데 있다.
136편 end-to-end 처리와 300개 실행형 benchmark question
여러 paper-agent를 결합해 psoriasis 관련 causal gene을 우선순위화했고, ADHD GWAS 사례에서는 209개 후보 중 rs1626703을 causal candidate로 도출하고 MPHOSPH9 splicing/expression 변화라는 검증 가능한 메커니즘 가설을 생성했다.
Limitation저자들은 open-ended hypothesis generation과 mechanistic interpretation은 여전히 human-in-the-loop라고 명시한다. 또한 단일 reference answer와의 일치는 과학적 타당성 그 자체보다 faithful execution을 측정한다.
문헌 수준의 cutoff를 도구 수준의 cutoff로 강화한다
Analysistemporally isolated Einstein Test의 오래된 난점은 과거지식을 text corpus로만 제공하면 provenance·실행가능성·재현성의 경계를 엄격히 통제하기 어렵다는 점이다.
Paper2Agent식 구조라면 historical paper 각각을 paper → executable agent → provenance-preserving scientific tool로 바꾸고, 시험 시점 이전의 paper agent만 연결한 뒤 post-cutoff agent를 물리적으로 차단할 수 있다. 이는 단순 RAG보다 강한 tool-level temporal isolation을 설계할 수 있다는 뜻이다.
Boundary그러나 이것은 Einstein-level discovery의 증거가 아니라 차세대 평가 인프라의 후보이다. knowledge reuse와 genuine discovery는 분리해 평가해야 한다.
2D-CFET 사례: 처음 맞히는 능력보다 틀린 가설을 버리는 능력
GPT-6 Astra 기반 AI-scientist workflow는 주어진 electrothermal model 안에서 설계를 탐색했고, 초기 직관이 계산증거와 충돌하자 설계 방향을 수정했다.
“상부 interconnect를 넓히면 냉각이 좋아질 것”이라는 직관이 반박됐다
Source factMin-Hui Kim(UNIST), Khushi Sharma(NUS), Sarah Zhang(Cornell), Ye Wang(Eindhoven University of Technology)의 연구는 2026년 9월 15일 arXiv v1으로 공개됐다. Astra가 2D-CFET source-interconnect geometry를 탐색했고 coordinating agent가 substrate-directed heat-removal path를 추가 제안했다.
초기의 “상부 interconnect를 넓히면 냉각이 좋아질 것”이라는 가설은 계산에서 지지되지 않았다. workflow는 그 결과를 받아들여 더 좁고 재배치된 구조로 이동했다. 중요한 것은 첫 직관의 정확도가 아니라 evidence가 설계 방향을 바꾸게 했다는 점이다.
냉각 이득과 전기적 trade-off를 함께 기록한다
여러 모델이 동일 코드를 독립 재구현해 거의 동일한 결과를 냈지만 한 모델은 104.95 K의 큰 오류를 냈다. 저자들은 이 실패를 삭제하지 않고 failure case로 보존했다.
Limitation실험적 device validation은 아직 수행되지 않았다. 연구문제·모델·search domain도 인간이 주었고 temporal isolation이 없었다. 따라서 autonomous problem discovery나 Einstein-level conceptual revolution을 입증한 사례는 아니다.
Hypothesis → Counter-evidence → Revision → Reproduction
Analysis기존 AI-for-science 데모가 후보 생성과 최적화에 초점을 맞추는 경우가 많았다면, 이 사례는 computational evidence가 초기 가설을 무너뜨린 뒤 설계가 바뀐다는 점에서 belief revision을 직접 평가할 수 있는 작은 단위를 제공한다.
cross-agent reproduction과 실패 구현의 보존은 최종 성공물만 점수화하지 말고 오류율, 수정경로, 재현가능성을 함께 봐야 한다는 평가원칙을 강화한다.
Operational Einstein Test 2.0: 시간격리를 “실행 가능한 지식우주”로 구현한다
pre-cutoff text만 보여주는 것보다, 그 시대에 실제로 허용됐을 계산·데이터·workflow만 실행 가능한 environment를 만드는 쪽이 더 엄격한 시험이 된다.
무엇을 알고 있는지뿐 아니라 무엇을 실행할 수 있는지를 제한한다
기존 temporal isolation은 보통 문헌 cutoff와 데이터 cutoff에 초점을 둔다. Paper2Agent가 제공하는 아이디어는 이를 한 단계 강화한다. cutoff 이전 paper를 검증된 executable agent로 변환하고, 그 agent만 호출 가능한 scientific tool universe를 구성하는 방식이다.
이 구조에서는 candidate scientist가 어떤 historical knowledge와 code path를 실제로 호출했는지 provenance로 추적할 수 있다. post-cutoff knowledge를 단지 prompt로 금지하는 대신 tool graph 자체에서 제거할 수 있다는 점이 중요하다.
과거 도구를 잘 조합하는 것과 새로운 개념을 발견하는 것은 다르다
AnalysisPaper2Agent가 강한 tool-level isolation을 가능하게 해도, 그것만으로 genuine discovery가 성립하지는 않는다. historical tool의 조합으로 답을 복원하는 능력과 새 problem formulation, rival hypothesis, discriminating experiment, hidden prediction을 생성하는 능력은 분리해야 한다.
차세대 평가축은 “정답”보다 발견과 수정의 과정으로 수렴한다
현재 추적을 종합하면 Einstein Test의 핵심은 temporal isolation에서 시작해 독립 verification으로 끝나는 일련의 scientific epistemic loop에 가깝다.
Counter-evidence-driven Revision이 가운데 놓인다
이 순서에서 중요한 것은 실패가 감점요소로만 취급되지 않는다는 점이다. 잘못된 가설을 얼마나 빨리, 어떤 증거 때문에, 어떤 대안으로 교체했는지가 오히려 과학적 지능의 핵심 신호가 될 수 있다.
결과와 과정, provenance를 함께 점수화한다
| 평가축 | 핵심 질문 | 이번 업데이트가 주는 근거 |
|---|---|---|
| Temporal Isolation | post-cutoff knowledge와 tool이 실제로 차단됐는가? | Paper2Agent를 통한 verified pre-cutoff tool universe 구성이 가능해질 수 있다. |
| Problem Formulation | 주어진 문제를 그대로 푸는 것을 넘어 새로운 질문을 정식화하는가? | Paper2Agent는 open-ended reasoning이 아직 human-in-the-loop임을 명시한다. |
| Rival Hypotheses | 서로 경쟁하는 설명을 명시적으로 유지하는가? | 단일 정답 일치보다 discovery process 평가가 필요하다는 점과 연결된다. |
| Discriminating Test | 가설을 구분할 실험·계산을 스스로 설계하는가? | 2D-CFET는 computational evidence가 설계 가설을 걸러내는 사례를 제공한다. |
| Belief Revision | 반대증거 때문에 기존 가설을 실제로 버리는가? | 초기 wider-interconnect 직관이 반박된 뒤 설계가 수정됐다. |
| Hidden Prediction | 학습에 노출되지 않은 새로운 예측을 생성하는가? | 이번 신규 사례만으로 강하게 입증되지는 않았다. |
| Independent Verification | 다른 agent·코드·실험이 결론을 재현하는가? | cross-agent reproduction과 failure-case preservation이 평가기준을 강화한다. |
새 benchmark는 없지만 평가환경의 설계 언어가 선명해졌다
Status이번 실행에서 직접적인 신규 Einstein Test 또는 temporal-isolation benchmark 출시는 확인되지 않았다.
Inference그러나 Paper2Agent의 Nature 정식 게재는 향후 Operational Einstein Test를 구현하는 provenance-preserving, executable historical knowledge environment의 현실적인 구성요소가 될 수 있다. 2D-CFET 사례는 그 환경 안에서 평가해야 할 행동—반대증거에 의한 수정과 재현—을 더 구체적으로 보여준다.
이번 업데이트의 직접 근거
본문은 첨부 연구동향 문서가 제시한 신규 변화 두 건과 상태점검을 기준으로 재구성했다. 외부 사실을 추가로 보강하지 않았다.