이번 추적에서는 Einstein Test 자체, Singularity Gate, SCILAWS-BENCH, TruthInsightBench의 공식 중대 업데이트는 확인되지 않았다. 대신 2026년 9월 11일 공개된 두 프리프린트가 AGI의 과학적 발견 능력을 무엇으로 측정해야 하는지에 중요한 압력을 가한다.
첫 연구는 전문가 재채점을 통해 일부 고난도 물리 benchmark가 모델 능력을 실제보다 낮게 평가했을 가능성을 보여준다. 두 번째 연구는 open-ended industrial research에서 AI가 빠른 탐색과 최적화에는 강하지만 새로운 representation, 독립적 research direction, hypothesis class를 발명하는 능력은 여전히 병목임을 보여준다.
이번 주의 공식 상태
헤드라인은 “새 Einstein Test가 등장했다”가 아니다. 기존 핵심 benchmark의 공식 중대 업데이트는 없었고, 대신 평가철학을 흔드는 외부 증거가 두 건 추가됐다.
직접 업데이트 없음, 평가 방향에는 의미 있는 변화
Source fact이번 확인에서는 Einstein Test, Singularity Gate, SCILAWS-BENCH, TruthInsightBench 자체의 공식 중대 업데이트가 확인되지 않았다.
다만 9월 14일 arXiv 신규 목록에서 이전 실행 이후 확인할 가치가 큰 두 프리프린트가 발견됐다. 공통 질문은 하나다.
물리 benchmark는 모델보다 grader가 먼저 틀릴 수 있다
전문가가 정답과 문제를 다시 감사하자 frontier model의 점수가 크게 상승했다. 이는 closed-ended science evaluation의 신뢰성 문제를 직접 보여준다.
6개 물리 benchmark를 전문가가 다시 감사했다
Source factHow Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks는 Ali Ansari et al.의 2026년 9월 11일 arXiv v1 프리프린트다. 연구진은 Yale University, Jump Trading Group, University of Cambridge, University of Southern California에 소속돼 있으며, HLE-Physics, CMT-Benchmark, CritPt, PHYBench, PRISM-Physics, UGPhysics 등 6개 물리 benchmark를 분야 전문가가 재감사했다.
그 결과 기존에 모델 오류로 처리된 사례 상당수가 잘못된 정답, 모호한 문제, grader 오류였다고 보고한다.
| Benchmark / Metric | 기존 | 수정 후 | 의미 |
|---|---|---|---|
| HLE-Physics · GPT-5.6-Sol mean@4 | 47.3% | 78.7% | 재채점 후 성능 해석이 크게 달라짐 |
| CMT-Benchmark | 61.0% | 87.2% | 평가오류 수정이 모델 성능 추정에 큰 영향 |
| CritPt · pass@4 | — | 94.4% | 수정된 closed-ended task가 포화에 접근 |
Source fact저자들은 검증된 closed-ended physics task가 사실상 포화에 접근하고 있다고 결론내린다.
“낮은 물리 QA 점수 = AGI의 과학적 추론 한계”라는 해석은 약해진다
Analysis이 결과가 맞다면 고난도 물리 QA 점수가 낮다는 사실만으로 AGI의 과학적 추론 한계를 판단하기는 더 어려워진다. benchmark 자체가 잘못된 정답이나 모호한 문항을 포함하면 모델 성능과 평가오류가 섞이기 때문이다.
따라서 Einstein Test는 expert-validated + temporally isolated + open-ended discovery evaluation로 이동할 필요가 커진다. 특히 공개 자료 기반 문제는 학습오염 가능성도 고려해야 한다.
Open-ended research는 아직 다른 종류의 벽을 갖고 있다
속도와 search depth는 크게 향상됐지만, 무엇을 새롭게 표현하고 어떤 방향으로 연구할지 스스로 정하는 능력은 여전히 인간보다 약했다.
10개월짜리 연구를 10주로 줄였지만 인간의 창의적 해법을 넘지는 못했다
Source factAutonomous Research for Open-Ended Problems: A Case Study on Telecom Ticket Retrieval은 Junghyun Min, Huseyin Uzunalioglu, Mohamed Trabelsi의 2026년 9월 11일 arXiv v1 프리프린트다. 연구진은 Georgetown University와 Nokia Bell Labs 소속이다.
기존 autonomous-research 연구가 좁은 search space에 치우쳤다는 문제의식에서 출발해, representation·architecture·training-data generation의 자유도가 큰 실제 산업 ML 문제에서 single/multi-agent 연구 시스템을 시험했다.
Performance
최소한의 인간 감독으로 내부 human SOTA의 약 90% 수준에 도달했다. Recall@1은 AI system 0.34, human SOTA 0.38이었다.
Research Time
연구기간을 약 10개월에서 10주 수준으로 단축했다.
그러나 최고 시스템은 사람이 만든 ensemble, data augmentation, re-ranking 같은 창의적 해법을 넘지 못했다. 저자들은 현 시스템이 깊은 hyperparameter search에는 강하지만 인간 수준의 직관·창의성, 독립적인 연구방향 설정에는 약하고 운영상 인간 개입도 필요하다고 보고한다.
search efficiency와 scientific novelty를 분리해서 측정해야 한다
Analysis결과점수나 연구속도만으로 Einstein-level discovery를 판정하기 어렵다는 negative evidence에 가깝다. 기존 search space 안에서 빠르게 최적화하는 능력과 새로운 representation·research direction·hypothesis class 자체를 발명하는 능력은 서로 다른 평가축이어야 한다.
Scope이 연구는 자연과학 discovery나 temporal isolation을 직접 평가한 것은 아니다. 따라서 Einstein Test의 직접 benchmark라기보다 open-ended autonomous research의 현재 한계를 보여주는 보조 증거로 보는 것이 정확하다.
Einstein Test는 무엇을 측정해야 하는가
기존 정답 복원에서 문제발견·표현변경·가설생성·판별실험·예측·반증·수정의 연쇄능력으로 평가대상을 바꿔야 한다.
정답형 benchmark 다음에 필요한 여섯 단계
- 새로운 문제의 발견 — 주어진 질문에 답하는 데서 끝나지 않고 중요한 미해결 문제를 스스로 포착한다.
- 표현 변경 — 기존 feature, variable, ontology로 해결되지 않을 때 새로운 representation을 도입한다.
- 가설 생성 — 단순 variation이 아니라 구분 가능한 hypothesis class를 만든다.
- 판별실험 — 경쟁 가설을 가장 잘 구분할 수 있는 experiment를 설계한다.
- 예측 — 사후설명이 아니라 사전 예측을 제출한다.
- 반증·수정 — 실패한 가설을 고집하지 않고 근거에 따라 버리거나 수정한다.
이 평가를 신뢰하려면 task 자체도 expert-validated, temporally isolated, open-ended여야 한다. 그래야 알려진 정답을 기억하거나 benchmark leakage에 기대는 능력보다 실제 discovery process에 가까운 능력을 측정할 수 있다.
두 연구가 함께 말하는 한 가지
닫힌 문제는 예상보다 빨리 포화될 수 있지만, 열린 연구에서는 “무엇을 새롭게 생각할 것인가”가 여전히 병목이다.
더 어려운 정답문제보다 더 낯선 발견상황이 필요하다
두 연구를 함께 보면 closed-ended 과학 문제는 benchmark 결함을 고치면 예상보다 훨씬 빨리 포화되는 반면, open-ended research에서는 여전히 무엇을 새롭게 생각할 것인가가 병목으로 남아 있다.
따라서 AGI의 과학적 발견 능력을 판별하려는 Einstein Test가 단순히 더 어려운 기존 문제를 추가하는 방향으로 가면 ceiling effect와 contamination 문제를 동시에 겪을 수 있다. 더 설득력 있는 방향은 비공개·시간격리된 현상을 주고, AI가 문제를 스스로 정의하고 새로운 표현과 이론을 만들고 판별실험을 설계하며 결과에 따라 가설을 수정하도록 평가하는 것이다.
이번 업데이트의 신규 근거
첨부 연구노트에 직접 포함된 두 2026년 9월 프리프린트만을 근거문헌으로 사용했다.