과제 하나가 늘면,
과학적 자율성 평가는
어떻게 달라지는가
Einstein Test Research Watch: Autonomous Science Bench, Task Coverage, and Reliability
ASB 0.1의 여섯 과제와 변화한 순위를 검토하고, 반복실행 신뢰성·영역 간 강건성·미래의 실물 검증을 분리한다.
게시 기준일: 2026-10-04. 본문에 명시된 문서 기준일·갱신일을 게시 기준일로 사용한다. 원문에 명시된 개별 발표일과 검색 기간은 본문에 보존했다. 수치는 첨부가 기록한 2026-10-04 스냅샷이다. 과제당 한 번의 실행으로 얻은 순위와 미래의 실제 실험 검증 계획을 구분한다.
ASB 0.1 · 여섯 과제와 순위의 변화
이번 점검에서는 이전 실행 이후 의미 있는 변경 1건만 확인했다. 새 논문·프리프린트 중에서는 앞서 보고한 EurekaBench 등을 넘어설 정도의 신규 항목이 없었고, Autonomous Science Bench 0.1의 공식 평가 구성이 실제로 확장되면서 순위가 갈린 변화가 확인됐다.
Autonomous Science Bench 0.1 — pilot 5개 → 6개로 확장, 선두 모델 분리
제목: Autonomous Science Bench: Evaluating AI for Autonomous Scientific Discovery
작성/기관: Autonomous Science Bench Team; 공개 페이지 작성자 Yibo Wen (Northwestern University CS PhD candidate). 미국 NSF Programmable Cloud Laboratory 생태계의 연구 workflow를 기반으로 한다. Yibo Wen
최초 공개일: 2026년 10월 1일
이번 변경 확인: 2026년 10월 4일 기준 공식 페이지
이전 실행에서 공식 초기 스냅샷은 5개 pilot task 기준으로 소개됐지만, 현재 공식 페이지는 6개 task를 명시한다. 새로 확인되는 것은 생물학 영역의 Nuclease active learning이며, 현재 구성은 Protein active learning, Biosensor active learning, Nuclease active learning, Propylene active learning, Sparse defect scan, Inverse lithography이다. Yibo Wen
이에 따라 leaderboard도 의미 있게 달라졌다. 현재 Claude Opus 5.5 + Claude Code가 5/6 = 83%로 단독 1위, GPT-5.6 Terra + Codex가 4/6 = 67%로 2위이다. 이어 GLM-5.3 Flash 50%, GPT-5.6 Luna와 Qwen3.8-27B가 각각 33%, Sonnet 5.5가 17%이다. 공식 설명에 따르면 Opus 5.5는 Inverse Lithography를 통과한 유일한 구성이고 Biosensor task만 실패했다. 다만 아직 task당 1회 실행이므로 작은 점수 차이를 통계적으로 확정적으로 해석해서는 안 된다고 명시한다. Yibo Wen
과제 범위와 과학적 일반화
Einstein Test / AGI 평가와의 관련성: 이번 변경은 단순 리더보드 업데이트 이상으로 의미가 있다. task 수가 늘면서 이전에는 같은 성능으로 보였던 두 최상위 agent가 분리됐기 때문이다. 이는 과학 AGI 평가에서
라는 점을 다시 보여준다. 특히 새로운 Nuclease task처럼 서로 다른 실험공간을 추가했을 때 성능 격차가 나타나는지가 scientific generality를 판단하는 데 중요한다.
더 중요한 것은 benchmark의 향후 구조가 그대로 유지된다는 점이다. 현재 결과는 여전히 v0 Replay Oracle이고, 이후 v1 Digital Twin → v2 Live Programmable Cloud Lab으로 전환하도록 설계돼 있다. v2에서는 실제 장비, queue, 비용, 실패가 포함되며, contamination 방지를 위해 private final evaluation·controlled data access·fresh experiments를 사용할 계획이다. Yibo Wen
반복 신뢰성과 실제 실험 검증
따라서 Operational Einstein Test에는 단순 평균 성공률 외에 최소한 다음 개념을 분리해 두는 것이 타당한다.
현재 ASB 0.1은 첫 두 요소를 점차 확장하고 있지만, 반복실행 안정성과 실제 prospective physical discovery는 아직 검증 전이다. 특히 공식 페이지가 스스로 “one trial per task”라고 경고하고 있으므로, 83%를 Einstein-level scientific autonomy의 증거로 해석해서는 안 됩니다. Yibo Wen
출처: Autonomous Science Bench 0.1 공식 페이지
이번 점검에서는 이 변경 외에 Singularity Gate v1.1, TruthInsightBench, EurekaBench에서 새로 보고할 정도의 중대한 프로토콜 변경은 확인되지 않았다. Singularity Gate는 현재도 contamination-cleaned v1.1을 유지하고 있다. singularitygate.org
자료와 출처
구성 자료: Einstein Test-Trends-1004.md. 첨부의 모든 연구 항목, 비교, 수치, 표, 수식, 한계와 후속 연구 제안을 수록했다. 대화 시스템의 인용 표시와 알림 문구는 편집 과정에서 제거했다. 본문 링크는 해당 자료로 연결된다.