2026년 9월 16일 업데이트의 핵심은 새로운 벤치마크 점수 하나가 아니다. “기존 연구를 더 잘 완성하는 능력”과 “새로운 연구 아이디어를 발견하는 능력”을 분리해야 한다는 경계가 더 선명해졌다.
Einstein Test 자체, Singularity Gate, SCILAWS-BENCH, TruthInsightBench에는 이번 추적에서 공식적으로 보고할 중대 변경이 없었다. 대신 9월 15일 공개 목록에서 Stellar Colosseum과 AppliedScientist 두 연구가 Operational Einstein Test 설계에 직접적인 단서를 제공한다.
이번 추적에서 공식 중대 변경은 없었다
Einstein Test 자체의 공식 변화보다, 평가철학을 더 정교하게 만드는 주변 연구 두 건이 중요했다.
벤치마크 변화보다 평가 경계의 변화
Source fact신규 arXiv 목록과 주요 benchmark 사이트를 다시 확인한 결과, Einstein Test 자체·Singularity Gate·SCILAWS-BENCH·TruthInsightBench에는 새로 보고할 공식 중대 변경이 없었다.
그러나 2026년 9월 15일 공개 목록에서 선별된 두 연구는 Einstein Test가 앞으로 무엇을 측정해야 하는지를 더 구체적으로 만든다. Stellar Colosseum은 반증과 전략 전환을 연구 절차로 구현하고, AppliedScientist는 실행능력과 아이디어 창출능력 사이의 큰 간극을 수치로 보여준다.
Stellar Colosseum: 장기 연구를 “반증 가능한 계산 절차”로 만든다
단일 proof generation을 넘어서 경쟁전략, readiness gate, 의존성 분해, 병렬 연구, targeted falsification, global verification을 하나의 research harness로 묶는다.
정답 한 번이 아니라 연구과정 전체를 조직한다
Source factStellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science는 Google Research와 Carnegie Mellon University 연구진이 제안한 many-agent research system이다.
중요한 점은 실패한 접근, 반례, 부분 결과를 버리지 않고 공유 연구지식으로 보존한다는 것이다. 이 구조는 단순히 여러 에이전트를 병렬로 띄우는 것보다 더 강하다. 실패를 다음 탐색의 상태로 남기기 때문이다.
TCS-Bench 71.0%, Codeforces 222문제 중 218문제
Source fact원 자료는 Gemini 3.1 Pro 기반 시스템이 FOCS·JMLR 논문에서 제기된 일부 open problem에 새로운 결과를 얻었다고 보고하며, TCS-Bench에서 71.0%, Codeforces 222문제 중 218문제를 해결했다고 정리한다.
Abduction → Rival Hypotheses → Falsification → Revision
Analysis이번 업데이트 중 Einstein Test에 가장 직접적으로 연결되는 이유는 높은 점수 자체가 아니다. 여러 경쟁 가설과 전략을 먼저 만들고, 적극적으로 반증을 시도하며, 실패 이유를 기억하고, 필요하면 연구방향 자체를 바꾸는 능력을 시스템 수준에서 조직했다는 점이다.
Limitation다만 TCS-Bench는 출판 논문에서 가져온 문제를 포함한다. 따라서 모델 weight가 미래 정보를 보지 않았다는 보장이 없으며, weight-level temporal contamination까지 통제한 Einstein Test는 아니다.
AppliedScientist: 실행은 잘 고치지만 아이디어는 거의 못 고친다
30편의 rejected/borderline ICLR 논문을 실제 코드·실험·논문 수준에서 반복 수정한 결과는 autonomous scientist의 현재 병목을 매우 선명하게 보여준다.
Autonomous scientist와 독립 AI reviewer를 폐루프로 연결한다
Source factAppliedScientist: Automated Scientific Revision Through Iterative AI Reviewing은 autonomous scientist와 독립 AI reviewer를 연결해 실제 rejected/borderline ICLR 논문 30편의 코드, 실험, 논문을 반복적으로 수정한다.
reviewer의 검색은 논문 제출일보다 최소 3개월 앞선 문헌으로 제한한다. 이는 미래 연구문헌이 평가에 직접 유입되는 것을 줄이기 위한 submission-date-aware literature cutoff다.
Execution-related 85.3% vs Idea-related 11.1%
Source factexecution-related weakness 150건 중 128건, 즉 85.3%는 해결했지만 idea-related weakness 18건 중 해결된 것은 2건, 즉 11.1%였다.
Analysis이 차이는 현재 AI Scientist가 baseline 강화, 구현 수정, 추가 실험, 문서 개선에는 강할 수 있지만 근본적인 novelty·significance·새로운 아이디어를 만드는 능력은 훨씬 약할 수 있음을 정량적으로 보여주는 negative result다.
문헌 cutoff는 유용하지만 완전한 시간격리는 아니다
submission-date-aware literature cutoff는 평가 시점 이후의 문헌을 검색으로 가져오는 문제를 줄이는 실용적 장치다. 그러나 모델 weights 자체가 미래지식을 이미 내재하고 있을 가능성까지 차단하지는 못한다. 따라서 Operational Einstein Test가 요구하는 완전한 temporal isolation의 일부만 구현한 것으로 보는 편이 정확하다.
평가의 경계를 세 단계로 분해해야 한다
연구를 빨리 수행하는 능력, 기존 연구를 더 좋은 연구로 수정하는 능력, 새로운 발견을 만드는 능력은 서로 다른 평가대상이다.
Execution ≠ Scientific Revision ≠ Novel Discovery
AppliedScientist는 “기존 아이디어를 더 좋은 연구로 만드는 능력”과 “새 아이디어를 발견하는 능력” 사이의 큰 간극을 보여준다. Stellar Colosseum은 후자에 가까워지기 위해 필요한 경쟁 가설, 적극적 반증, 실패 기억, 전략 전환의 계산 구조를 보여준다.
Analysis따라서 Einstein Test의 단일 Research Success 점수는 너무 많은 능력을 한데 섞을 위험이 있다. 연구 생산성의 상승을 AGI-level discovery의 증거로 오인하지 않도록 평가축을 분해해야 한다.
무엇을 각각 따로 측정할 것인가
Execution
주어진 연구목표 아래 코드 작성, 실험 실행, baseline 추가, 문서 개선을 얼마나 잘 수행하는가.
Scientific Revision
기존 연구의 약점을 찾아 설계와 실험을 수정하고, 비판을 반영해 연구를 더 강하게 만드는가.
Novel Discovery
새로운 문제·표현·가설·이론을 만들고, 반증을 견디며 독립적으로 검증되는 새로운 결과에 도달하는가.
Operational Einstein Test는 “성공”보다 “반증과 수정”을 측정해야 한다
강한 시험은 미공개 문제와 경쟁 가설을 요구하고, 가설을 지지하는 증거보다 깨뜨리는 시도를 장려하며, 실패와 전략전환을 연구 상태로 보존해야 한다.
더 강한 Einstein Test를 위한 여섯 조건
- 시간격리된 미공개 문제 — 평가 시점 이후 정보뿐 아니라 weight-level contamination 가능성까지 최소화해야 한다.
- 복수의 경쟁 가설 생성 — 하나의 설명을 곧바로 정답처럼 밀어붙이지 않고 rival hypotheses를 병렬로 유지해야 한다.
- Targeted falsification — 가설을 지지하는 증거 수집보다 가설을 깨뜨릴 수 있는 반례와 실험을 능동적으로 설계해야 한다.
- 실패 원인의 영속적 기록 — 실패한 접근, 반례, 부분 결과를 연구기억으로 보존해 같은 실패의 반복을 막아야 한다.
- Belief/strategy revision — 국소 수정만 반복하지 않고 필요하면 기존 전략을 버리고 새로운 표현과 방향으로 전환해야 한다.
- 새 이론의 독립 검증 — 자기평가가 아니라 별도의 검증 경로로 결과를 확인해야 한다.
Analysis이번 업데이트의 가장 중요한 변화는 이 여섯 조건 중 특히 ③ targeted falsification, ④ persistent failure memory, ⑤ strategy revision이 autonomous-research 시스템 수준에서 구체적 계산 절차로 나타나기 시작했다는 점이다.
Operational Einstein Test가 묻는 질문
이 질문은 단순 benchmark accuracy나 paper-improvement score보다 더 어렵다. 동시에 Einstein-level discovery를 주장하려면 왜 이런 더 강한 기준이 필요한지도 분명하게 만든다.
이번 업데이트의 근거 자료
첨부 연구노트가 직접 사용한 arXiv 신규 목록과 두 핵심 연구의 canonical URL을 정리했다.