AI Research Blog·Einstein Test2026 · 09 · 15
AGI Evaluation·Scientific Discovery·2026-09-15 Update

정답형 과학시험은 포화되고
발견의 문턱은 남는다

Einstein Test 2026: From Saturated Physics Benchmarks to Open-Ended Scientific Discovery

CLOSED-ENDED SCIENCE주어진 문제 · 주어진 정답GRADEAUDITSATURATEEVALUATION SHIFTOPEN-ENDED DISCOVERY문제 발견표현 변경가설 생성판별 실험예측반증 · 수정
Central Update

이번 추적에서는 Einstein Test 자체, Singularity Gate, SCILAWS-BENCH, TruthInsightBench의 공식 중대 업데이트는 확인되지 않았다. 대신 2026년 9월 11일 공개된 두 프리프린트가 AGI의 과학적 발견 능력을 무엇으로 측정해야 하는지에 중요한 압력을 가한다.

첫 연구는 전문가 재채점을 통해 일부 고난도 물리 benchmark가 모델 능력을 실제보다 낮게 평가했을 가능성을 보여준다. 두 번째 연구는 open-ended industrial research에서 AI가 빠른 탐색과 최적화에는 강하지만 새로운 representation, 독립적 research direction, hypothesis class를 발명하는 능력은 여전히 병목임을 보여준다.

두 결과를 함께 읽으면 평가의 초점이 바뀐다. 더 어려운 정답형 문제를 추가하는 것보다, 비공개·시간격리된 현상에서 문제를 스스로 정의하고 새로운 이론을 만들어 반증하는 능력이 Einstein Test에 더 적합해진다.Source-grounded synthesis
Part I · §1

이번 주의 공식 상태

헤드라인은 “새 Einstein Test가 등장했다”가 아니다. 기존 핵심 benchmark의 공식 중대 업데이트는 없었고, 대신 평가철학을 흔드는 외부 증거가 두 건 추가됐다.

§1 · Status

직접 업데이트 없음, 평가 방향에는 의미 있는 변화

Source fact이번 확인에서는 Einstein Test, Singularity Gate, SCILAWS-BENCH, TruthInsightBench 자체의 공식 중대 업데이트가 확인되지 않았다.

다만 9월 14일 arXiv 신규 목록에서 이전 실행 이후 확인할 가치가 큰 두 프리프린트가 발견됐다. 공통 질문은 하나다.

“정답형 과학 benchmark가 실제 AGI·과학발견 능력을 얼마나 제대로 측정하는가?”
Part II · §2-§3

물리 benchmark는 모델보다 grader가 먼저 틀릴 수 있다

전문가가 정답과 문제를 다시 감사하자 frontier model의 점수가 크게 상승했다. 이는 closed-ended science evaluation의 신뢰성 문제를 직접 보여준다.

§2 · Expert Re-Grading

6개 물리 benchmark를 전문가가 다시 감사했다

Source factHow Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks는 Ali Ansari et al.의 2026년 9월 11일 arXiv v1 프리프린트다. 연구진은 Yale University, Jump Trading Group, University of Cambridge, University of Southern California에 소속돼 있으며, HLE-Physics, CMT-Benchmark, CritPt, PHYBench, PRISM-Physics, UGPhysics 등 6개 물리 benchmark를 분야 전문가가 재감사했다.

그 결과 기존에 모델 오류로 처리된 사례 상당수가 잘못된 정답, 모호한 문제, grader 오류였다고 보고한다.

Benchmark / Metric기존수정 후의미
HLE-Physics · GPT-5.6-Sol mean@447.3%78.7%재채점 후 성능 해석이 크게 달라짐
CMT-Benchmark61.0%87.2%평가오류 수정이 모델 성능 추정에 큰 영향
CritPt · pass@494.4%수정된 closed-ended task가 포화에 접근

Source fact저자들은 검증된 closed-ended physics task가 사실상 포화에 접근하고 있다고 결론내린다.

§3 · Einstein-Test Implication

“낮은 물리 QA 점수 = AGI의 과학적 추론 한계”라는 해석은 약해진다

Analysis이 결과가 맞다면 고난도 물리 QA 점수가 낮다는 사실만으로 AGI의 과학적 추론 한계를 판단하기는 더 어려워진다. benchmark 자체가 잘못된 정답이나 모호한 문항을 포함하면 모델 성능과 평가오류가 섞이기 때문이다.

따라서 Einstein Test는 expert-validated + temporally isolated + open-ended discovery evaluation로 이동할 필요가 커진다. 특히 공개 자료 기반 문제는 학습오염 가능성도 고려해야 한다.

Part III · §4-§5

Open-ended research는 아직 다른 종류의 벽을 갖고 있다

속도와 search depth는 크게 향상됐지만, 무엇을 새롭게 표현하고 어떤 방향으로 연구할지 스스로 정하는 능력은 여전히 인간보다 약했다.

§4 · Telecom Research Case Study

10개월짜리 연구를 10주로 줄였지만 인간의 창의적 해법을 넘지는 못했다

Source factAutonomous Research for Open-Ended Problems: A Case Study on Telecom Ticket Retrieval은 Junghyun Min, Huseyin Uzunalioglu, Mohamed Trabelsi의 2026년 9월 11일 arXiv v1 프리프린트다. 연구진은 Georgetown University와 Nokia Bell Labs 소속이다.

기존 autonomous-research 연구가 좁은 search space에 치우쳤다는 문제의식에서 출발해, representation·architecture·training-data generation의 자유도가 큰 실제 산업 ML 문제에서 single/multi-agent 연구 시스템을 시험했다.

Performance

최소한의 인간 감독으로 내부 human SOTA의 약 90% 수준에 도달했다. Recall@1은 AI system 0.34, human SOTA 0.38이었다.

Research Time

연구기간을 약 10개월에서 10주 수준으로 단축했다.

그러나 최고 시스템은 사람이 만든 ensemble, data augmentation, re-ranking 같은 창의적 해법을 넘지 못했다. 저자들은 현 시스템이 깊은 hyperparameter search에는 강하지만 인간 수준의 직관·창의성, 독립적인 연구방향 설정에는 약하고 운영상 인간 개입도 필요하다고 보고한다.

§5 · What This Means

search efficiency와 scientific novelty를 분리해서 측정해야 한다

Analysis결과점수나 연구속도만으로 Einstein-level discovery를 판정하기 어렵다는 negative evidence에 가깝다. 기존 search space 안에서 빠르게 최적화하는 능력과 새로운 representation·research direction·hypothesis class 자체를 발명하는 능력은 서로 다른 평가축이어야 한다.

Scope이 연구는 자연과학 discovery나 temporal isolation을 직접 평가한 것은 아니다. 따라서 Einstein Test의 직접 benchmark라기보다 open-ended autonomous research의 현재 한계를 보여주는 보조 증거로 보는 것이 정확하다.

Part IV · §6

Einstein Test는 무엇을 측정해야 하는가

기존 정답 복원에서 문제발견·표현변경·가설생성·판별실험·예측·반증·수정의 연쇄능력으로 평가대상을 바꿔야 한다.

§6 · Proposed Evaluation Axes

정답형 benchmark 다음에 필요한 여섯 단계

  1. 새로운 문제의 발견 — 주어진 질문에 답하는 데서 끝나지 않고 중요한 미해결 문제를 스스로 포착한다.
  2. 표현 변경 — 기존 feature, variable, ontology로 해결되지 않을 때 새로운 representation을 도입한다.
  3. 가설 생성 — 단순 variation이 아니라 구분 가능한 hypothesis class를 만든다.
  4. 판별실험 — 경쟁 가설을 가장 잘 구분할 수 있는 experiment를 설계한다.
  5. 예측 — 사후설명이 아니라 사전 예측을 제출한다.
  6. 반증·수정 — 실패한 가설을 고집하지 않고 근거에 따라 버리거나 수정한다.
향후 Einstein Test에는 search efficiency와 별도로 representation shift, conceptual novelty, autonomous problem reformulation, failed-hypothesis revision을 독립 평가축으로 두는 것이 타당하다.

이 평가를 신뢰하려면 task 자체도 expert-validated, temporally isolated, open-ended여야 한다. 그래야 알려진 정답을 기억하거나 benchmark leakage에 기대는 능력보다 실제 discovery process에 가까운 능력을 측정할 수 있다.

Part V · §7

두 연구가 함께 말하는 한 가지

닫힌 문제는 예상보다 빨리 포화될 수 있지만, 열린 연구에서는 “무엇을 새롭게 생각할 것인가”가 여전히 병목이다.

§7 · Synthesis

더 어려운 정답문제보다 더 낯선 발견상황이 필요하다

두 연구를 함께 보면 closed-ended 과학 문제는 benchmark 결함을 고치면 예상보다 훨씬 빨리 포화되는 반면, open-ended research에서는 여전히 무엇을 새롭게 생각할 것인가가 병목으로 남아 있다.

따라서 AGI의 과학적 발견 능력을 판별하려는 Einstein Test가 단순히 더 어려운 기존 문제를 추가하는 방향으로 가면 ceiling effect와 contamination 문제를 동시에 겪을 수 있다. 더 설득력 있는 방향은 비공개·시간격리된 현상을 주고, AI가 문제를 스스로 정의하고 새로운 표현과 이론을 만들고 판별실험을 설계하며 결과에 따라 가설을 수정하도록 평가하는 것이다.

Einstein Test의 핵심 질문은 “얼마나 어려운 문제를 풀었는가?”에서 “아직 문제로 정식화되지 않은 현상에서 새로운 설명을 만들고 틀렸을 때 스스로 고칠 수 있는가?”로 이동해야 한다.Interpretive conclusion grounded in the two 2026 preprints
References

이번 업데이트의 신규 근거

첨부 연구노트에 직접 포함된 두 2026년 9월 프리프린트만을 근거문헌으로 사용했다.

[01]
How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks
Ali Ansari et al. · arXiv v1 · 2026-09-11
6개 물리 benchmark의 expert audit를 통해 grading 오류와 near-saturation 문제를 분석한다. arXiv HTML
[02]
Autonomous Research for Open-Ended Problems: A Case Study on Telecom Ticket Retrieval
Junghyun Min · Huseyin Uzunalioglu · Mohamed Trabelsi · arXiv v1 · 2026-09-11
넓은 search space를 가진 실제 산업 ML 문제에서 autonomous research system의 속도·성능·창의성 한계를 분석한다. arXiv