Standard harness
62.7%provider-neutral모델을 표준화된 평가 인터페이스에서 측정한 결과다.
Operational Einstein Test: From Model Scores to Verifiable Scientific Discovery Systems
이번 업데이트의 가장 중요한 변화는 Einstein Test 자체의 새 버전이 아니다. 더 근본적인 변화는 AGI 평가의 단위를 “모델”에서 “과학적 인지 시스템 전체”로 바꿔야 할 가능성이 커졌다는 점이다.
첨부 Research Watch는 세 가지 신규 신호를 제시한다. 동일한 GPT-6 Astra가 ARC-AGI-3에서 Standard harness에서는 62.7%, Provider Adapter에서는 99.9%를 기록했다. AutoGraphForge는 conjecture 생성 이후 novelty filtering, counterexample search, formalization, independent proof verification까지 연결했다. 또 다른 연구는 실험실을 computable physical world로 표현해 agent가 제안한 workflow의 실행 가능성을 실제 실행 전에 검증하도록 했다.
이 글은 첨부된 2026년 9월 5일 Einstein Test Research Watch의 내용 전체를 웹 에세이 형태로 재구성한 것이다. 원문은 이번 확인에서 Einstein Test를 직접 확장한 신규 논문이나 공식 benchmark 버전 변경은 확인되지 않았다고 명시한다. 아래의 해석은 그 범위 안에서 Operational Einstein Test 설계에 미치는 의미를 정리한 것이다.
중요한 변화는 benchmark 이름의 버전업이 아니라 AGI scientific-discovery evaluation의 설계 원리에서 발생했다.
| Date | Work | Core contribution | Einstein Test implication |
|---|---|---|---|
| 2026-09-03 | OpenAI's GPT-6 Astra on ARC-AGI-3 ARC Prize Foundation · Greg Kamradt | 동일 GPT-6 Astra를 Standard harness와 Provider Adapter에서 별도 평가. 62.7% 대 99.9%라는 큰 격차. | AGI 평가단위를 model-only에서 Model + State + Memory/Compaction + Tool/Harness로 확대할 필요. |
| 2026-09-03 | AutoGraphForge: Towards Automated Graph Theory Discovery Ján Pastorek | conjecture → novelty filtering → refutation → formalization → proof의 end-to-end discovery loop. | Einstein Test에 Novelty Check, Adversarial Falsification, Independent Verification을 구체적으로 삽입할 참조구조. |
| 2026-09-03 | A computable representation of the physical laboratory enables verifiable workflows Xiaobo Li et al. | typed research objects, capability-bound operations, compositional workflow algebra로 실험실을 계산 가능한 세계로 표현. | Theory와 Evidence 사이에 Executability Check와 Physical Execution을 연결하는 Experimental Grounding Layer의 기반. |
세 연구는 서로 다른 분야를 다루지만 같은 방향을 가리킨다. 과학적 지능은 정답을 말하는 능력만으로 평가할 수 없고, 상태를 유지하고, 새로운 가설을 검증하고, 반례를 찾고, 실행 가능한 실험으로 연결하는 시스템 능력으로 측정해야 한다.
ARC-AGI-3 결과는 하네스가 단순한 평가용 포장지가 아니라 관측되는 지능의 일부가 될 수 있음을 보여준다.
ARC Prize Foundation은 ARC-AGI-3 Semi-Private에서 동일한 GPT-6 Astra를 두 방식으로 독립 평가했다. 원문에 따르면 provider-neutral Standard harness에서는 62.7%, OpenAI의 연속 reasoning state와 compaction을 유지하는 Provider Adapter에서는 99.9%를 기록했다.
모델을 표준화된 평가 인터페이스에서 측정한 결과다.
연속 reasoning state와 compaction을 유지하는 provider-native 조건이다.
Provider Adapter 조건에서 median human보다 적은 action으로 해결한 level의 비율이다.
모델은 처음 보는 환경을 자체적인 symbolic world model과 간단한 DSL 형태로 표현하는 행동도 보였다. 그러나 ARC Prize는 ARC-AGI-3가 deterministic·closed-ended 환경이라는 한계를 함께 명시하며, 이 benchmark의 포화가 AGI의 증명은 아니라고 선을 긋는다. 차세대 평가는 open-ended innovation과 recursive self-improvement를 다뤄야 한다는 방향도 제시한다.
이 결과의 Einstein Test 관점 핵심은 성능 숫자의 크기 자체보다 동일 모델의 점수가 하네스에 따라 크게 달라졌다는 사실이다. 만약 historical corpus를 어떤 memory architecture로 유지하는지, 과학적 상태를 어떻게 압축하는지, 어떤 도구를 언제 호출하는지가 결과를 바꾼다면, “AGI는 foundation model M의 속성”이라는 평가식은 불충분하다.
기초 모델 자체의 파라미터와 학습된 능력.
persistent state, memory/compaction, orchestration, reasoning protocol.
허용된 시점까지의 corpus, database, prior theories와 검색 규칙.
계산 도구, simulator, formal prover, robotic laboratory와 실행 인터페이스.
Einstein Test에서도 동일 foundation model을 standard scientist harness와 provider-native harness에서 동시에 시험할 필요가 있다. 그래야 model capability와 system capability를 혼동하지 않고 비교할 수 있다.
하네스가 사소한 engineering detail이 아니라 관측되는 intelligence의 일부라면, AGI benchmark는 모델을 시험하는 시험지에서 인지 시스템 전체를 계측하는 실험 장치로 바뀌어야 한다.
Interpretation grounded in the attached research watchAutoGraphForge는 autonomous discovery를 “아이디어 생성”에서 “신규성 검증과 공격적 반증”의 문제로 옮긴다.
AutoGraphForge: Towards Automated Graph Theory Discovery는 그래프 이론에서 conjecture → novelty filtering → counterexample/refutation → formalization → proof를 하나의 end-to-end discovery loop로 구현한다.
후보 conjecture의 신규성을 검사하는 데 사용된 기존 관계 수.
후보를 반증하기 위해 탐색한 그래프 규모.
여러 round의 refutation stage를 모두 통과한 conjecture 수.
이후 살아남은 후보는 Lean 4로 formalize된다. DeepSeek-Prover-V2-671B와 OProver-32B를 사용하지만 최종 증명은 독립적인 Lean kernel이 검증한다. 일부 비자명한 새 관계는 인간이 직접 증명했다.
기존 autonomous discovery 시스템은 많은 후보를 만들어 ranking하는 방식에 머무르는 경우가 많다. AutoGraphForge의 중요한 차이는 새 가설이 기존 지식에서 이미 유도되는지 먼저 확인하고, 적극적으로 counterexample을 찾은 뒤, 살아남은 가설을 형식화하고 독립 검증한다는 데 있다.
이는 Einstein Test의 Novel Hypothesis → Adversarial Falsification → Formalization → Independent Verification 부분을 구현하는 좋은 참조구조가 된다.
이 연구 자체를 AGI evidence로 보는 것은 과도하다. 원문이 지적하듯 search space가 매우 제한된 수학 영역이고, 일부 흥미로운 conjecture의 최종 증명은 인간이 수행했다.
Computable physical laboratory는 과학적 추론을 문장에서 물리적 실행으로 이어주는 formal interface를 제안한다.
A computable representation of the physical laboratory enables verifiable workflows는 실험실을 단순한 도구 목록이 아니라 computable physical laboratory로 형식화한다.
시약, 용기, 샘플, 상태 같은 연구 객체의 타입과 상태를 명시적으로 표현한다.
각 operation이 어떤 장비와 조건에서 가능한지 capability를 경계로 제한한다.
operation을 조합하는 compositional algebra로 전체 실험 workflow를 계산 가능한 구조로 만든다.
이 표현은 실제 modular robotic laboratory의 Function Skills와 연결된다. Agent가 만든 workflow는 곧바로 장비에 전달되지 않는다. 먼저 stateful simulation을 통해 object transformation, operation precondition, physical/laboratory constraint를 검사한다.
Einstein Test를 실제 science benchmark로 구현하려면 “가설을 문장으로 생성하는 능력”만으로는 부족하다. AI가 제안한 판별실험이 물리적으로 실행 가능한지를 검증하고, 실제 실행 결과를 evidence로 되돌려야 한다.
이 논문의 중심은 abduction이나 paradigm discovery 자체가 아니라 검증 가능한 experimental workflow representation이다. 따라서 Einstein Test에 필요한 전체 과학발견 능력 중 Experimental Grounding Layer에 특히 직접적인 기여를 한다.
이번 업데이트에서 새롭게 강해진 단계는 Novelty Check, Adversarial Falsification, Executable Experiment다.
AutoGraphForge는 Novelty Check와 Adversarial Falsification을 구체적인 계산 파이프라인으로 보여준다. Computable laboratory 연구는 Executable Experiment를 실제 물리 세계에 연결한다. 이 세 단계는 Operational Einstein Test를 단순 생성형 benchmark가 아니라 falsifiable scientific-discovery benchmark로 만드는 핵심 보강점이다.
Einstein Test를 단순 재현 문제로 설계하면 historical pattern matching과 latent memorization을 과학적 발견으로 오인할 위험이 있다. 원문이 제시하는 더 강한 방향은 다음 조건들을 함께 요구한다.
이번 업데이트를 종합하면 가장 강한 연구방향은 인지 하네스, 신규성, 반증, 형식검증, 실험 실행을 하나의 평가 프로토콜로 묶는 것이다.
| Evaluation axis | What is fixed | What varies | What it reveals |
|---|---|---|---|
| Model-only | H, K, T를 최소 표준 조건으로 고정 | M | foundation model 자체의 상대적 능력 |
| Harness sensitivity | M, K, T | H | persistent state, memory, compaction, orchestration이 성능에 미치는 영향 |
| Knowledge discipline | M, H, T | K | historical leakage와 진짜 temporal generalization 구분 |
| Tool grounding | M, H, K | T | formal prover, simulator, laboratory interface가 과학적 검증에 주는 기여 |
| End-to-end Einstein Test | 명시된 protocol | M,H,K,T 전체 시스템 | 문제발견 → 가설 → 반증 → 실험 → evidence → revision의 전체 폐루프 성능 |
동일 모델을 standardized scientist harness와 provider-native harness에서 모두 평가해 harness effect를 독립 변수로 측정한다.
가설 수나 흥미도보다 novelty filtering, counterexample search, independent verification 통과율을 핵심 지표로 둔다.
언어적으로 그럴듯한 실험 제안이 아니라 typed objects와 physical constraints를 만족하는 workflow만 다음 단계로 통과시킨다.
이 세 요소를 결합하면 Einstein Test는 특정 과학 이론의 재생성 여부를 넘어 새로운 과학 원리를 발견하는 시스템의 epistemic process 자체를 평가할 수 있다.
가장 중요한 변화는 benchmark의 질문이 “정답을 맞혔는가?”에서 “어떤 인지 시스템이, 어떤 지식 제약 아래, 어떤 반증과 실험을 거쳐, 새로운 이론을 살아남게 했는가?”로 이동한다는 점이다.
Final synthesis of the attached update아래 서지와 링크는 첨부 파일에 수록된 출처를 바탕으로 정리했다.
Standard harness와 Provider Adapter의 큰 성능 차이를 통해 evaluation harness가 관측되는 intelligence에 미치는 영향을 보여주는 평가.
ARC-AGI-3의 provider-native 평가 맥락과 관련해 첨부 파일이 함께 제시한 공식 출처.
Novelty filtering, counterexample search, formalization, theorem proving을 연결한 automated graph-theory discovery pipeline.
Typed research objects와 capability-bound operations를 이용해 agent-generated laboratory workflow의 실행가능성을 사전 검증하는 형식적 표현.