과학 문제를 풀 수 있다는 것과 과학 연구를 스스로 조직할 수 있다는 것은 다른 능력이다. ASI-Bench는 바로 그 사이의 틈을 측정한다.
논문은 기존 benchmark가 주로 이미 알려진 답을 맞히거나, 사람이 충분한 방법과 절차를 준 상태에서 task를 완수하는지를 평가한다고 비판한다. 이에 ASI-Bench는 같은 project를 유지한 채 인간의 방법론적 지침을 B1에서 B4로 점차 걷어내는 방식으로 AI의 scientific autonomy를 측정한다. 40명 넘는 전문가가 31,000시간 이상을 투입해 11개 과학영역의 60개 project-level research task를 만들었고, 18개의 Agent×Model 구성을 평가한다.
지식을 많이 아는 AI와 연구를 스스로 하는 AI는 다르다
ASI-Bench의 출발점은 정답률이 아니라, 열린 문제에서 연구 방향을 결정하고 실행 가능한 artifact까지 만드는 능력이다.
답을 아는가가 아니라 길을 만들 수 있는가
논문이 던지는 질문은 직접적이다. AI가 인간이 축적한 지식을 학습·압축·적용하는 수준을 넘어 낯선 문제를 탐색하고, 새로운 solution strategy를 만들고, 이를 검증 가능한 결과로 바꿀 수 있는가. 기존 평가에서는 문제와 답, 또는 해결 절차가 상당 부분 주어지는 경우가 많아 이 질문을 분리하기 어렵다.
ASI-Bench는 이를 cross-domain generality, method autonomy, end-to-end research, guidance gradient라는 네 축으로 묶는다. 문제만 어렵게 만든 것이 아니라, 연구의 책임을 인간에게서 AI로 단계적으로 넘긴다.
기존 benchmark가 잘하는 것과 ASI-Bench가 추가하는 것
| Benchmark | Task Setting | Cross-domain | Method autonomy | End-to-end research | Guidance gradient |
|---|---|---|---|---|---|
| Humanity's Last Exam | Academic QA | ✓ | – | – | – |
| Terminal-Bench | Terminal tasks | – | △ | △ | – |
| ScienceAgentBench | Scientific analysis | △ | △ | △ | – |
| PaperBench | Research replication | – | – | ✓ | – |
| MLE-Bench | ML engineering | – | △ | ✓ | – |
| RE-Bench | AI R&D | – | ✓ | ✓ | – |
| DiscoveryBench | Scientific discovery | △ | ✓ | △ | – |
| SciCode | Scientific coding | ✓ | △ | – | – |
| ASI-Bench | Project-level research | ✓ | ✓ | ✓ | ✓ |
표의 ✓는 명시적 coverage, △는 부분적 또는 domain-limited coverage, –는 명시적으로 평가하지 않음을 뜻한다. ASI-Bench의 차별점은 한 capability만 새로 추가한 것이 아니라 네 축을 같은 project instance 안에서 함께 측정한다는 데 있다.
다른 benchmark에서 높게 나오는 시스템도 B3에서는 급격히 낮아진다
논문의 Figure 2는 Kimi K3, Claude Opus 5, GPT-5.6 Sol, GLM-5.2를 HLE·SWE-bench·Terminal-Bench·ASI-Bench B3에서 비교한다. Figure에 표시된 ASI-Bench B3 값은 각각 27.8, 40.7, 51.6, 30.3이다. 같은 그림에서 Terminal-Bench 값은 88.3, 89.1, 88.8, 81.0으로 훨씬 높다.
이 차이는 benchmark 간 난이도를 단순 서열화하는 근거는 아니다. task 종류와 metric이 다르기 때문이다. 그러나 잘 정의된 실행 능력과 방법을 스스로 정하는 project-level research 사이에 큰 간극이 있다는 논문의 문제의식을 시각적으로 보여준다.
B1–B4: 같은 연구문제에서 인간의 지침만 걷어낸다
objective, data, output, scoring은 고정하고 method/procedure information만 조절해 autonomy와 robustness를 분리한다.
네 단계는 연구의 책임이 누구에게 있는지 바꾼다
B1 · Full guidance
방법, equation, numerical formulation, solver procedure, parameter choice까지 충분히 제공한다. 주된 과제는 정확히 구현하고 실행하는 것이다.
B2 · Method only
의도된 method class와 constraints는 알려주지만 full procedure를 제거한다. agent가 방법을 실행 가능한 workflow로 바꿔야 한다.
B3 · Goal + data
scientific objective, input, constraint, required artifact만 제공한다. method, solver, effective evolution strategy는 agent가 결정한다.
B4 · Distractors
B3를 유지하면서 사실이지만 불필요한 context와 plausible alternative를 넣어 research direction을 유지하는지 본다.
60개의 task는 한 번의 답변이 아니라 긴 연구과정이다
전체 task를 완수하는 과정은 2,600회가 넘는 interaction turn, 2,400회가 넘는 execution step, 35시간이 넘는 agent execution으로 구성된다. agent는 problem understanding, method selection, implementation, experimentation, failure diagnosis, iterative refinement, result validation을 거쳐 검증 가능한 scientific artifact를 만들어야 한다.
중요한 점은 decision point가 서로 의존한다는 것이다. 중간 결과를 잘못 해석하면 뒤의 방법선택과 실험이 모두 흔들린다. 따라서 ASI-Bench는 single-turn reasoning이나 fixed procedure execution보다 연속된 연구 의사결정의 안정성을 평가한다.
한 연구 agent가 서로 다른 과학의 문법을 넘나든다
60개 project는 mathematics, physics, chemistry, biology, astronomy, materials science, earth science, medicine and biostatistics, computer science, robotics, electrical engineering의 11개 분야에 걸친다. 데이터 형식, 방법론, 검증 기준이 서로 다르기 때문에 같은 Agent×Model system이 domain-specific workflow에 갇히지 않는지를 본다.
논문이 제안하는 다섯 가지 사용법
Stronger intelligence
기존 benchmark의 몇 퍼센트 개선보다 low-guidance condition의 reproducible improvement가 higher-order capability의 더 강한 증거라고 본다.
Autonomous research
AI for Science, AI Scientist, automated research system이 방법이 제공되지 않을 때도 project를 계속 수행하는지 진단한다.
Model vs harness
같은 backbone에 다른 agent/harness를 결합하거나 같은 harness에서 backbone을 바꿔 capability source를 분리한다.
Frontier progress
평균 B3가 26.62에 불과해 saturation과 거리가 멀고, 향후 system 간 차이를 측정할 여지가 크다고 본다.
Community expansion
새 domain, problem, scorer와 verified result를 계속 추가해 benchmark가 capability와 함께 진화하도록 설계한다.
31,000시간의 핵심은 task 수가 아니라 검증 구조이다
candidate collection에서 sandbox replay까지, benchmark 자체가 unintended shortcut을 줄이기 위한 research pipeline으로 구축된다.
1,300개 아이디어에서 60개 task가 남기까지
정답 파일 하나가 아니라 artifact와 scorer를 함께 검증한다
각 task는 objective와 input뿐 아니라 required scientific artifact, reference-generation procedure, validity gate, weighted scorer를 가진다. 이 구조는 단순 text answer가 아니라 실제 code, predicted field, diagnostic, figure, analysis artifact를 평가하기 위한 것이다.
논문은 정보 누출과 shortcut도 독립적인 QA 대상으로 둔다. 높은 score가 scientific reasoning이 아니라 hidden hint나 scorer loophole에서 나온다면 benchmark의 목적이 무너진다.
고정된 시험지가 아니라 계속 확장되는 research infrastructure
저자들은 현재 60개 task를 완성품이 아니라 시작점으로 규정한다. 각 분야의 frontier researcher가 진짜 어려운 문제를 가장 잘 알고 있으므로 benchmark도 community contribution으로 넓혀야 한다는 입장이다.
18개 Agent×Model 실험: 가장 어려운 것은 방법선택보다 절차화이다
main result는 external tool access 없이 60개 task를 macro-average하고, 대부분 3회 독립 실행의 평균과 sample standard deviation을 보고한다.
B1에서 B2로 내려갈 때 가장 크게 무너진다
평균 score는 B1→B2에서 21.82점 떨어진다. 반면 B2→B3의 추가 하락은 2.48점이다. B3→B4는 오히려 평균 +0.36점으로 사실상 큰 변화가 없다. 논문은 이 비대칭을 근거로 method selection보다 method operationalization이 더 큰 병목이라고 해석한다.
최상위도 B3 51.60이다
Codex + GPT-5.6 Sol (ultra)은 B3에서 51.60을 기록해 method를 독립적으로 선택해야 하는 setting에서 50점을 넘은 유일한 평가 configuration이다. 같은 harness에서 GPT-5.6 Sol의 xhigh는 B3 40.86이며, ultra는 여기서 10.74점을 더 얻는다. inference-time reasoning 강화가 도움이 되지만, 추가 계산을 써야 중간 수준의 성능에 도달한다는 점이 동시에 드러난다.
Table 2 — 60 project-level tasks의 전체 main result
| Harness | Backbone | B1 | B2 | B3 | B4 | Overall | B2−B1 | B3−B1 | B4−B3 |
|---|---|---|---|---|---|---|---|---|---|
| Codex | GPT-5.5 (xhigh) | 57.57±5.74 | 35.28±2.23 | 29.29±1.57 | 30.46±1.55 | 38.15±1.25 | −22.29±7.37 | −28.27±5.26 | +1.16±3.10 |
| Codex | GPT-5.6 Sol (xhigh) | 62.75±3.05 | 42.96±1.59 | 40.86±2.35 | 40.74±1.77 | 46.83±1.10 | −19.79±1.48 | −21.89±5.27 | −0.12±3.66 |
| Codex | GPT-5.6 Sol (ultra) | 71.78±0.46 | 49.57±2.31 | 51.60±3.65 | 50.41±3.06 | 55.84±1.58 | −22.21±1.90 | −20.18±3.21 | −1.20±5.68 |
| Claude Code | Claude Opus 5† | 72.29 | 45.80 | 40.70 | 42.39 | 50.29 | −26.49 | −31.59 | +1.69 |
| Claude Code | Kimi K3 | 55.79±4.86 | 35.24±3.36 | 27.78±2.02 | 29.57±0.46 | 37.09±1.74 | −20.55±3.88 | −28.02±5.64 | +1.79±2.33 |
| Claude Code | Claude Opus 4.8 | 52.48±6.27 | 36.25±4.57 | 31.73±3.44 | 29.59±1.51 | 37.51±0.79 | −16.24±9.26 | −20.76±8.71 | −2.14±4.46 |
| Claude Code | GLM-5.3 | 63.05±1.40 | 35.45±3.76 | 33.09±1.36 | 35.01±3.40 | 41.65±1.35 | −27.60±4.61 | −29.96±1.30 | +1.92±4.74 |
| Claude Code | GLM-5.2 | 54.01±1.65 | 30.81±2.25 | 30.29±1.96 | 27.27±3.98 | 35.59±0.95 | −23.20±2.54 | −23.72±3.56 | −3.02±2.04 |
| Claude Code | DeepSeek V4 Flash | 51.85±1.71 | 26.49±1.24 | 24.84±2.21 | 24.41±0.95 | 31.90±0.47 | −25.36±0.82 | −27.01±3.56 | −0.43±1.28 |
| Claude Code | Kimi K2.7 | 44.43±1.90 | 23.84±0.40 | 19.75±0.74 | 21.34±2.26 | 27.34±0.61 | −20.59±2.29 | −24.68±2.07 | +1.58±2.99 |
| Claude Code | MiniMax M3 | 43.53±3.60 | 20.86±3.29 | 20.61±1.02 | 21.21±2.85 | 26.55±1.55 | −22.68±2.31 | −22.92±3.20 | +0.60±3.87 |
| Claude Code | DeepSeek V4 Pro | 42.97±0.46 | 18.79±2.88 | 19.20±0.22 | 18.94±1.23 | 24.98±0.57 | −24.18±2.61 | −23.77±0.68 | −0.26±1.28 |
| Claude Code | MiMo V2.5 Pro | 41.70±1.63 | 18.49±2.27 | 16.49±0.07 | 16.33±0.39 | 23.25±1.05 | −23.22±1.20 | −25.21±1.56 | −0.16±0.31 |
| Kimi Code | Kimi K3 | 56.16±4.86 | 34.05±5.08 | 28.15±0.84 | 26.53±0.99 | 36.22±2.22 | −22.11±2.34 | −28.01±4.56 | −1.62±1.45 |
| Kimi Code | Kimi K2.7 | 29.99±3.30 | 17.01±0.10 | 15.65±1.34 | 16.22±0.85 | 19.72±1.19 | −12.98±3.35 | −14.34±1.98 | +0.58±1.56 |
| MiMo Code | MiMo V2.5 Pro | 27.73±4.33 | 11.33±1.40 | 11.50±1.36 | 14.11±3.19 | 16.17±1.39 | −16.40±5.40 | −16.24±5.37 | +2.61±4.11 |
| OpenHands | DeepSeek V4 Flash | 50.60±2.24 | 24.89±5.27 | 21.91±1.75 | 24.99±4.27 | 30.60±3.05 | −25.71±3.27 | −28.69±1.53 | +3.09±4.43 |
| OpenHands | DeepSeek V4 Pro | 37.78±2.28 | 16.66±2.84 | 15.78±1.91 | 16.28±2.52 | 21.63±0.75 | −21.12±3.00 | −22.00±3.42 | +0.50±4.31 |
| All Models (Mean) | 50.91 | 29.10 | 26.62 | 26.99 | 33.41 | −21.82 | −24.29 | +0.36 | |
† Claude Opus 5 결과는 single run이며 standard deviation을 추정하지 않는다. 그 외 result는 원칙적으로 3회 독립 실행의 평균과 sample standard deviation이다. diagnostic difference는 각 run 안에서 먼저 계산한 뒤 집계한다.
Harness와 compute는 능력을 바꾸지만, 돈을 더 쓴다고 연구가 자동으로 좋아지지는 않는다
같은 backbone도 어떤 agent harness를 쓰는지에 따라 달라지고, guidance의 완전성은 성능뿐 아니라 계산비용도 바꾼다.
모델을 비교할 때 surrounding research system을 빼면 capability source가 흐려진다
MiMo V2.5 Pro의 overall score는 MiMo Code에서 16.17이지만 Claude Code에서 23.25로 올라간다. Kimi K2.7도 Kimi Code 19.72에서 Claude Code 27.34로 높아진다. 반면 Kimi K3는 Kimi Code 36.22와 Claude Code 37.09로 차이가 작다.
논문의 결론은 harness effect가 크지만 균일하지 않다는 것이다. scientific capability는 backbone 하나의 성질이라기보다 model × harness interaction에서 발현된다.
불완전한 지침이 오히려 가장 비싸다
| Setting | Avg. tokens / task | vs B1 | Avg. time / task | vs B1 | 해석 |
|---|---|---|---|---|---|
| B1 | 4.35M | baseline | 37.8 min | baseline | method·implementation·parameter가 모두 주어져 search overhead가 가장 작다. |
| B2 | 6.91M | +59% | 49.7 min | +32% | method name은 있지만 missing procedure를 재구성해야 해 가장 비싸다. |
| B3 | 5.4M | +25% | 45.9 min | +22% | 방법 탐색과 iteration 비용이 증가한다. |
| B4 | 5.7M | +30% | 44.5 min | +18% | distractor가 있어도 B3 대비 성능과 시간은 크게 달라지지 않는다. |
비용은 capability의 충분조건이 아니다
Codex + GPT-5.6 Sol xhigh은 B3 40.86을 약 $684/run에 기록한다. Claude Opus 5 + Claude Code는 B3 40.70으로 거의 같지만 약 $2,728/run이다. 최대 성능을 추구하면 Codex + GPT-5.6 Sol ultra가 약 $1,550/run에서 B3 51.60을 기록한다.
논문은 practical autonomous research에서 xhigh을 cost–performance balance, ultra를 absolute performance 우선 선택으로 해석한다. 더 많은 비용이 더 높은 점수를 줄 수 있지만, 비슷한 점수에서 비용차가 몇 배씩 나는 경우도 있어 단순한 scaling rule은 성립하지 않는다.
한 개의 PDE task가 보여주는 자율성의 실체
Appendix의 2D Anisotropic Stiff Dynamics는 equation을 베껴 구현하는 것과 data에서 모델·solver를 스스로 찾는 것이 얼마나 다른지 보여준다.
같은 objective, 같은 data, 같은 artifact — 다른 것은 prompt뿐이다
agent는 periodic spatial domain의 2D nonlinear dynamical system 관측값을 받는다. 입력은 system_info.json, field_evolution.npy, initial_condition.npy다. 해야 할 일은 ① spatial/temporal dynamics characterize, ② observed dynamics를 재현할 model construct, ③ target time의 field predict, ④ physically meaningful diagnostic extract이다.
필수 artifact는 predicted field, spatial spectrum, physical diagnostics, scientific visualization, data-analysis result, complete executable simulation code다.
B1은 governing PDE와 solver까지 준다
원문 B1 prompt는 2D Fourier pseudospectral discretization, \(k_x,k_y\), Fourier-space linear operator, nonlinear term의 conserved-form 계산, 2/3-rule dealiasing, stiff fourth-order term을 위한 ETDRK4, Kassam–Trefethen contour-integral coefficient construction까지 제공한다.
B1 numerical guide의 핵심 식 펼쳐보기
위 식은 Appendix B1 prompt의 내용을 그대로 구조화한 것이다. 이 글은 식의 부호나 discretization을 외부 지식으로 수정하지 않는다.
한 단계씩 정보가 빠지면서 연구자가 해야 할 일이 바뀐다
결국 B4의 목표는 지식량이 아니라 task-relevant evidence를 유지하는 attention discipline을 보는 것이다.
benchmark contribution 자체도 reproducible research package여야 한다
완전한 task contribution은 scientific objective, B1–B4 prompt, input/output specification, reproducible reference-generation procedure, validity checks와 weighted scoring, scientific dependencies, four-condition local evaluation evidence를 포함해야 한다. public authoring scaffold와 online 15-step Guided Flow가 이를 지원한다.
generate_gt.py, evaluation gates, weighted scorer도 포함한다.공식 release에 포함된 task의 contributor는 benchmark release contributor list에 들어간다. 저자들은 contributor를 단순 external data submitter가 아니라 benchmark construction participant로 규정한다.
ASI-Bench가 보여주는 것은 “초지능”보다 자율 연구의 빈칸이다
benchmark의 가치, 관련 연구의 위치, 저자·community 구조, 그리고 이 결과를 과장하지 않기 위해 필요한 경계를 함께 본다.
AI Scientist와 scientific-agent benchmark를 한 계보로 놓는다
Related Work는 tool-augmented chemistry agent, The AI Scientist, AI Scientist-v2, Co-Scientist, Kosmos처럼 더 긴 research workflow를 자동화하는 시스템과, HLE·SciCode·DiscoveryBench·BLADE·DSBench·HypoBench·ScienceAgentBench·MLE-Bench·RE-Bench·PaperBench·CORE-Bench·ReplicationBench·FIRE-Bench·ResearchClawBench·SciAgentArena·DiscoveryWorld·AstaBench·ScienceBoard 등 evaluation line을 함께 정리한다.
논문의 주장은 이렇다. 기존 benchmark는 knowledge, scientific coding, replication, data-driven discovery, long-horizon execution을 각각 잘 측정하지만, 같은 scientific project에서 human method guidance를 단계적으로 제거해 workflow construction과 execution을 분리하는 gradient는 충분히 다루지 못했다.
현재 agent의 약점은 ‘연구 절차를 완성하는 능력’에 집중되어 있다
B1→B2의 큰 하락, B2의 높은 compute cost, B2→B3의 상대적으로 작은 추가 하락을 함께 보면 하나의 일관된 그림이 나온다. method name을 알려주는 것은 충분하지 않다. agent는 parameter choice, implementation order, diagnostic, error recovery, validation을 엮어 완전한 operational workflow를 만들어야 한다.
이는 단순한 “reasoning scale” 문제로 환원하기 어렵다. harness가 같은 backbone 성능을 크게 바꾸는 사례는 memory, orchestration, execution policy, tool-interface, failure recovery 같은 system-level design이 scientific autonomy의 일부임을 보여준다.
이 benchmark 하나로 ASI를 측정했다고 말하면 과하다
- Main experiment의 tool condition. Table 2의 main result는 external tool access 없이 수행된다. 실제 research agent가 외부 scientific tool과 database를 쓰는 환경과는 차이가 있다.
- Finite benchmark. 11개 domain, 60개 task는 넓지만 과학 전체가 아니다. 논문도 community expansion을 benchmark 가치의 전제로 둔다.
- Score is benchmark-specific. 낮은 B3는 autonomy gap의 강한 신호이지만, 숫자 하나가 general intelligence나 innovation 전체를 직접 측정하는 것은 아니다.
- Task/scorer design dependence. 31,000시간의 검증이 reliability를 높이지만, 어떤 artifact와 gate를 중요하게 볼지는 여전히 benchmark design choice다.
- “Dawn of ASI” is framing. source는 이 benchmark를 ASI로 향하는 capability의 reference point로 제안하지만, current systems가 ASI에 도달했다는 empirical conclusion은 내리지 않는다.
사람이 31,000시간을 써서 AI의 자율성을 시험한다는 역설
Core authors는 Junwei Zhou, Zhen Sun, Binyu Li, Jiangyu Zhou, Yuexi Pan, Hengyu Wang, Honghe Ren, Xiaohan Jia, Xueyang Zhou, Xiaoyu Cao, Yongchao Chen이다. Junwei Zhou와 Zhen Sun은 equal contribution, Yongchao Chen은 corresponding author로 표시된다.
Contributors and affiliations 펼쳐보기
Contributors: Yuanning Feng, Junhao Wu, Cheng Zhang, Sijia Chen, Haoyu Xue, Chengsong You, Huan Wang, Koutian Wu, Peigan Gao, Jiakun Wu, Wenzhe Li, Ergan Shang, Qingyuan Zheng, Jingjing Zhou, Ruixuan Jia, Yan Xu, Hongrui Zhang, Xiao-Han Ma, Zhengxiang Cheng, Yuexing Hao, Liting Mai, Xianglin Ji, Wenjun Zhang, Zhuofan Chen, Yixiao Huang, Chi Wang, Wenyue Hua, Yilun Hao, Yuantao Zhai, Ziyan Zhao, Jingyan Xie.
Affiliations: Tsinghua University; Massachusetts Institute of Technology; Harvard University; Carnegie Mellon University; University of Michigan; University of Illinois Urbana–Champaign; Boston University; The University of Queensland; University of Science and Technology of China; Flatiron Institute; Microsoft Research; AG2 AI; Independent Researcher.
Task contributors retained in the final benchmark: Yuexi Pan, Hengyu Wang, Honghe Ren, Peigan Gao, Jiangyu Zhou, Sijia Chen, Junhao Wu, Huan Wang, Koutian Wu, Cheng Zhang, Yuanning Feng, Qingyuan Zheng, Wenzhe Li, Jiakun Wu, Ruixuan Jia, Junwei Zhou, Ergan Shang, Jingjing Zhou, Yan Xu, Hongrui Zhang, Liting Mai.
논문은 다섯 review round에서 1,100건이 넘는 task-review assignment가 수행됐다고 보고하며, reviewer list도 별도로 공개한다.
연구 agent의 다음 병목은 지식이 아니라 연구 운영체계일 수 있다
따라서 다음 세대 scientific agent 연구의 질문도 달라질 수 있다. 더 많은 knowledge를 넣는 것만으로 충분한가. 아니면 research planning, executable methodology synthesis, validation, memory, failure recovery, harness design을 하나의 시스템으로 다시 설계해야 하는가. ASI-Bench의 결과는 후자의 필요성을 강하게 시사한다. 다만 이것은 benchmark 결과에서 도출한 해석이며, 단일 leaderboard가 과학적 창의성 전체를 대체하지는 않는다.