AI Research Watch · Operational Einstein Test05 Sep 2026 · Scientific Discovery Evaluation
Einstein Test Research Watch/AGI Evaluation/AI for Science

모델 점수에서
검증 가능한 과학발견 시스템으로

Operational Einstein Test: From Model Scores to Verifiable Scientific Discovery Systems

Operational Einstein Test conceptual architecture A foundation model branches into standard and provider-native scientist harnesses, then feeds a scientific discovery loop with novelty checking, falsification and executable experiments. FOUNDATION MODEL Msame weights · different harnessSTANDARD HARNESS H₁provider-neutral · 62.7%PROVIDER ADAPTER H₂persistent state · 99.9%E(M,H,K,T)evaluate the cognitive systemDISCOVERY LOOPnovelty · falsification · experiment HARNESS EFFECT→ SCIENCE
Editorial Abstract

이번 업데이트의 가장 중요한 변화는 Einstein Test 자체의 새 버전이 아니다. 더 근본적인 변화는 AGI 평가의 단위를 “모델”에서 “과학적 인지 시스템 전체”로 바꿔야 할 가능성이 커졌다는 점이다.

첨부 Research Watch는 세 가지 신규 신호를 제시한다. 동일한 GPT-6 Astra가 ARC-AGI-3에서 Standard harness에서는 62.7%, Provider Adapter에서는 99.9%를 기록했다. AutoGraphForge는 conjecture 생성 이후 novelty filtering, counterexample search, formalization, independent proof verification까지 연결했다. 또 다른 연구는 실험실을 computable physical world로 표현해 agent가 제안한 workflow의 실행 가능성을 실제 실행 전에 검증하도록 했다.

Source boundary

이 글은 첨부된 2026년 9월 5일 Einstein Test Research Watch의 내용 전체를 웹 에세이 형태로 재구성한 것이다. 원문은 이번 확인에서 Einstein Test를 직접 확장한 신규 논문이나 공식 benchmark 버전 변경은 확인되지 않았다고 명시한다. 아래의 해석은 그 범위 안에서 Operational Einstein Test 설계에 미치는 의미를 정리한 것이다.

\[\boxed{E(M,H,K,T)}\]M: foundation model · H: scientist harness · K: historical knowledge · T: tools / simulator / laboratory interface
Part I · What Changed

Einstein Test를 직접 확장한 논문은 없었다. 그러나 평가 설계는 바뀌고 있다

중요한 변화는 benchmark 이름의 버전업이 아니라 AGI scientific-discovery evaluation의 설계 원리에서 발생했다.

§1 · Three updates

Operational Einstein Test를 바꿀 세 가지 신규 변화

DateWorkCore contributionEinstein Test implication
2026-09-03OpenAI's GPT-6 Astra on ARC-AGI-3
ARC Prize Foundation · Greg Kamradt
동일 GPT-6 Astra를 Standard harness와 Provider Adapter에서 별도 평가. 62.7% 대 99.9%라는 큰 격차.AGI 평가단위를 model-only에서 Model + State + Memory/Compaction + Tool/Harness로 확대할 필요.
2026-09-03AutoGraphForge: Towards Automated Graph Theory Discovery
Ján Pastorek
conjecture → novelty filtering → refutation → formalization → proof의 end-to-end discovery loop.Einstein Test에 Novelty Check, Adversarial Falsification, Independent Verification을 구체적으로 삽입할 참조구조.
2026-09-03A computable representation of the physical laboratory enables verifiable workflows
Xiaobo Li et al.
typed research objects, capability-bound operations, compositional workflow algebra로 실험실을 계산 가능한 세계로 표현.Theory와 Evidence 사이에 Executability Check와 Physical Execution을 연결하는 Experimental Grounding Layer의 기반.

세 연구는 서로 다른 분야를 다루지만 같은 방향을 가리킨다. 과학적 지능은 정답을 말하는 능력만으로 평가할 수 없고, 상태를 유지하고, 새로운 가설을 검증하고, 반례를 찾고, 실행 가능한 실험으로 연결하는 시스템 능력으로 측정해야 한다.

Part II · Harness Effect

62.7%와 99.9% 사이에는 같은 모델이 있었다

ARC-AGI-3 결과는 하네스가 단순한 평가용 포장지가 아니라 관측되는 지능의 일부가 될 수 있음을 보여준다.

§2 · ARC-AGI-3

동일한 GPT-6 Astra, 두 개의 평가 하네스

ARC Prize Foundation은 ARC-AGI-3 Semi-Private에서 동일한 GPT-6 Astra를 두 방식으로 독립 평가했다. 원문에 따르면 provider-neutral Standard harness에서는 62.7%, OpenAI의 연속 reasoning state와 compaction을 유지하는 Provider Adapter에서는 99.9%를 기록했다.

Standard harness
62.7%provider-neutral

모델을 표준화된 평가 인터페이스에서 측정한 결과다.

Provider Adapter
99.9%persistent reasoning state

연속 reasoning state와 compaction을 유지하는 provider-native 조건이다.

Human efficiency
96%of evaluated levels

Provider Adapter 조건에서 median human보다 적은 action으로 해결한 level의 비율이다.

모델은 처음 보는 환경을 자체적인 symbolic world model과 간단한 DSL 형태로 표현하는 행동도 보였다. 그러나 ARC Prize는 ARC-AGI-3가 deterministic·closed-ended 환경이라는 한계를 함께 명시하며, 이 benchmark의 포화가 AGI의 증명은 아니라고 선을 긋는다. 차세대 평가는 open-ended innovation과 recursive self-improvement를 다뤄야 한다는 방향도 제시한다.

§3 · Unit of evaluation

Model-only score와 Scientist-system score를 분리해야 한다

이 결과의 Einstein Test 관점 핵심은 성능 숫자의 크기 자체보다 동일 모델의 점수가 하네스에 따라 크게 달라졌다는 사실이다. 만약 historical corpus를 어떤 memory architecture로 유지하는지, 과학적 상태를 어떻게 압축하는지, 어떤 도구를 언제 호출하는지가 결과를 바꾼다면, “AGI는 foundation model M의 속성”이라는 평가식은 불충분하다.

\[E=E(M,H,K,T)\]
M · Foundation model

기초 모델 자체의 파라미터와 학습된 능력.

H · Scientist harness

persistent state, memory/compaction, orchestration, reasoning protocol.

K · Historical knowledge

허용된 시점까지의 corpus, database, prior theories와 검색 규칙.

T · Tools / laboratory

계산 도구, simulator, formal prover, robotic laboratory와 실행 인터페이스.

Einstein Test에서도 동일 foundation model을 standard scientist harness와 provider-native harness에서 동시에 시험할 필요가 있다. 그래야 model capability와 system capability를 혼동하지 않고 비교할 수 있다.

하네스가 사소한 engineering detail이 아니라 관측되는 intelligence의 일부라면, AGI benchmark는 모델을 시험하는 시험지에서 인지 시스템 전체를 계측하는 실험 장치로 바뀌어야 한다.

Interpretation grounded in the attached research watch
Part III · Discovery Under Refutation

새 가설은 생성되는 순간이 아니라 반례를 통과한 뒤에야 살아남는다

AutoGraphForge는 autonomous discovery를 “아이디어 생성”에서 “신규성 검증과 공격적 반증”의 문제로 옮긴다.

§4 · AutoGraphForge

Conjecture에서 independent proof verification까지

AutoGraphForge: Towards Automated Graph Theory Discovery는 그래프 이론에서 conjecture → novelty filtering → counterexample/refutation → formalization → proof를 하나의 end-to-end discovery loop로 구현한다.

Known relations
559

후보 conjecture의 신규성을 검사하는 데 사용된 기존 관계 수.

Graphs searched
≈348K

후보를 반증하기 위해 탐색한 그래프 규모.

Survivors
6,522

여러 round의 refutation stage를 모두 통과한 conjecture 수.

이후 살아남은 후보는 Lean 4로 formalize된다. DeepSeek-Prover-V2-671B와 OProver-32B를 사용하지만 최종 증명은 독립적인 Lean kernel이 검증한다. 일부 비자명한 새 관계는 인간이 직접 증명했다.

§5 · Why it matters

“아이디어 많이 생성 → 좋은 것 선택”을 넘어선다

기존 autonomous discovery 시스템은 많은 후보를 만들어 ranking하는 방식에 머무르는 경우가 많다. AutoGraphForge의 중요한 차이는 새 가설이 기존 지식에서 이미 유도되는지 먼저 확인하고, 적극적으로 counterexample을 찾은 뒤, 살아남은 가설을 형식화하고 독립 검증한다는 데 있다.

Conjecture후보 관계 생성
Noveltyknown relations 대비 신규성
Refutation348K graphs + active search
FormalizationLean 4 representation
Proofprover + Lean kernel

이는 Einstein Test의 Novel Hypothesis → Adversarial Falsification → Formalization → Independent Verification 부분을 구현하는 좋은 참조구조가 된다.

Epistemic caution

이 연구 자체를 AGI evidence로 보는 것은 과도하다. 원문이 지적하듯 search space가 매우 제한된 수학 영역이고, 일부 흥미로운 conjecture의 최종 증명은 인간이 수행했다.

Part IV · Experimental Grounding

좋은 실험 아이디어와 실행 가능한 실험은 다르다

Computable physical laboratory는 과학적 추론을 문장에서 물리적 실행으로 이어주는 formal interface를 제안한다.

§6 · Computable laboratory

실험실을 tool collection이 아니라 계산 가능한 세계로 표현한다

A computable representation of the physical laboratory enables verifiable workflows는 실험실을 단순한 도구 목록이 아니라 computable physical laboratory로 형식화한다.

Typed research objects

시약, 용기, 샘플, 상태 같은 연구 객체의 타입과 상태를 명시적으로 표현한다.

Capability-bound operations

각 operation이 어떤 장비와 조건에서 가능한지 capability를 경계로 제한한다.

Workflow algebra

operation을 조합하는 compositional algebra로 전체 실험 workflow를 계산 가능한 구조로 만든다.

이 표현은 실제 modular robotic laboratory의 Function Skills와 연결된다. Agent가 만든 workflow는 곧바로 장비에 전달되지 않는다. 먼저 stateful simulation을 통해 object transformation, operation precondition, physical/laboratory constraint를 검사한다.

§7 · Experimental Grounding Layer

Theory에서 Evidence까지 끊어진 고리를 연결한다

Theory설명·모델·가설
Proposed Experiment판별 실험 설계
Executability Checkstateful simulation
Physical Executionrobotic laboratory
Evidence관측 결과

Einstein Test를 실제 science benchmark로 구현하려면 “가설을 문장으로 생성하는 능력”만으로는 부족하다. AI가 제안한 판별실험이 물리적으로 실행 가능한지를 검증하고, 실제 실행 결과를 evidence로 되돌려야 한다.

Scope limitation

이 논문의 중심은 abduction이나 paradigm discovery 자체가 아니라 검증 가능한 experimental workflow representation이다. 따라서 Einstein Test에 필요한 전체 과학발견 능력 중 Experimental Grounding Layer에 특히 직접적인 기여를 한다.

Part V · Revised Operational Loop

Operational Einstein Test의 discovery loop를 한 단계 더 구체화한다

이번 업데이트에서 새롭게 강해진 단계는 Novelty Check, Adversarial Falsification, Executable Experiment다.

§8 · Discovery pipeline

가설 생성보다 중요한 것은 살아남는 과정이다

01 · Temporal Isolation허용된 역사 시점 이후의 지식을 차단한다.
02 · Problem Discovery당대 corpus에서 중요한 미해결 문제를 스스로 식별한다.
03 · Representation Shift기존 표현을 재구성하거나 새로운 개념 틀을 제안한다.
04 · Abductive Hypothesis관측을 설명하는 새로운 후보 이론을 만든다.
05 · Novelty Check기존 지식에서 이미 유도되는 가설인지 독립적으로 검사한다.
06 · Adversarial Falsification반례·실패 사례를 적극적으로 탐색한다.
07 · Formal Theory가설을 계산·검증 가능한 형식으로 명시한다.
08 · Executable Experiment실험의 물리적 실행 가능성을 formal interface로 검증한다.
09 · Hidden Prediction아직 노출되지 않은 결과를 사전 예측한다.
10 · Evidence실험·관측으로 독립적 데이터를 얻는다.
11 · Belief Revision실패와 성공에 따라 이론·신념을 갱신한다.

AutoGraphForge는 Novelty CheckAdversarial Falsification을 구체적인 계산 파이프라인으로 보여준다. Computable laboratory 연구는 Executable Experiment를 실제 물리 세계에 연결한다. 이 세 단계는 Operational Einstein Test를 단순 생성형 benchmark가 아니라 falsifiable scientific-discovery benchmark로 만드는 핵심 보강점이다.

§9 · A stricter test

“pre-1911 corpus → 일반상대성이론 출력”만으로는 부족하다

Einstein Test를 단순 재현 문제로 설계하면 historical pattern matching과 latent memorization을 과학적 발견으로 오인할 위험이 있다. 원문이 제시하는 더 강한 방향은 다음 조건들을 함께 요구한다.

  • 동일 foundation model을 standard scientist harnessprovider-native harness에서 모두 평가한다.
  • 새 가설이 기존 corpus에서 직접 유도되거나 이미 알려진 주장인지 독립적 novelty check를 수행한다.
  • 후보 이론이 살아남기 전에 active counterexample search와 adversarial falsification을 통과시킨다.
  • 가능한 경우 이론을 formal representation으로 옮기고 독립 verifier를 사용한다.
  • 가설을 실제로 판별할 수 있는 실행 가능한 experiment workflow로 변환한다.
  • hidden prediction과 새 evidence를 통해 최종적으로 belief revision이 일어나는지를 평가한다.
강한 Einstein Test는 “아인슈타인의 답을 다시 말할 수 있는가?”가 아니라 “아인슈타인이 갖지 못했던 답을, 당시의 지식만으로, 반증 가능한 이론과 실행 가능한 실험으로 만들어낼 수 있는가?”를 묻는 방향으로 가야 한다.
Part VI · Research Agenda

Einstein Test는 모델 benchmark가 아니라 scientific system benchmark가 되어야 한다

이번 업데이트를 종합하면 가장 강한 연구방향은 인지 하네스, 신규성, 반증, 형식검증, 실험 실행을 하나의 평가 프로토콜로 묶는 것이다.

§10 · Proposed evaluation matrix

모델과 시스템을 분리해 계측한다

Evaluation axisWhat is fixedWhat variesWhat it reveals
Model-onlyH, K, T를 최소 표준 조건으로 고정Mfoundation model 자체의 상대적 능력
Harness sensitivityM, K, THpersistent state, memory, compaction, orchestration이 성능에 미치는 영향
Knowledge disciplineM, H, TKhistorical leakage와 진짜 temporal generalization 구분
Tool groundingM, H, KTformal prover, simulator, laboratory interface가 과학적 검증에 주는 기여
End-to-end Einstein Test명시된 protocolM,H,K,T 전체 시스템문제발견 → 가설 → 반증 → 실험 → evidence → revision의 전체 폐루프 성능
§11 · What this update changes

다음 버전의 Operational Einstein Test에 추가해야 할 세 가지

01 · Dual-harness protocol

동일 모델을 standardized scientist harness와 provider-native harness에서 모두 평가해 harness effect를 독립 변수로 측정한다.

02 · Refutation-first discovery

가설 수나 흥미도보다 novelty filtering, counterexample search, independent verification 통과율을 핵심 지표로 둔다.

03 · Executable experiment gate

언어적으로 그럴듯한 실험 제안이 아니라 typed objects와 physical constraints를 만족하는 workflow만 다음 단계로 통과시킨다.

이 세 요소를 결합하면 Einstein Test는 특정 과학 이론의 재생성 여부를 넘어 새로운 과학 원리를 발견하는 시스템의 epistemic process 자체를 평가할 수 있다.

가장 중요한 변화는 benchmark의 질문이 “정답을 맞혔는가?”에서 “어떤 인지 시스템이, 어떤 지식 제약 아래, 어떤 반증과 실험을 거쳐, 새로운 이론을 살아남게 했는가?”로 이동한다는 점이다.

Final synthesis of the attached update
References

Sources in the Research Watch

아래 서지와 링크는 첨부 파일에 수록된 출처를 바탕으로 정리했다.

01
OpenAI's GPT-6 Astra on ARC-AGI-3
ARC Prize Foundation · Greg Kamradt · 03 Sep 2026

Standard harness와 Provider Adapter의 큰 성능 차이를 통해 evaluation harness가 관측되는 intelligence에 미치는 영향을 보여주는 평가.

02
OpenAI GPT-6 Astra report
OpenAI · referenced by the attached watch

ARC-AGI-3의 provider-native 평가 맥락과 관련해 첨부 파일이 함께 제시한 공식 출처.

03
AutoGraphForge: Towards Automated Graph Theory Discovery
Ján Pastorek · arXiv:2609.03478 · 03 Sep 2026

Novelty filtering, counterexample search, formalization, theorem proving을 연결한 automated graph-theory discovery pipeline.

04
A computable representation of the physical laboratory enables verifiable workflows
Xiaobo Li et al. · arXiv:2609.03621 · 03 Sep 2026

Typed research objects와 capability-bound operations를 이용해 agent-generated laboratory workflow의 실행가능성을 사전 검증하는 형식적 표현.