◆ AI SCIENTIST / SCIENTIFIC TASTE
RESEARCH WATCH · SOURCE DATE 2026-10-05

실행하는 지능에서
가치 있는 과학을
선택하는 지능으로

Autonomous AI Scientists: Scientific Taste, Judge-Free Verification, and Accountable Systems

연구를 전진시키는 선행 아이디어 검색, 고비용 과학의 독립 검증, 발견 계보와 결정론적 제어를 하나의 연구 아키텍처로 연결한다.과학적 문제 선택 · 독립·규칙 기반 검증 · 발견 계보·제어의 관계를 연결한 해석적 개념도. 실측 자료가 아닌 해석적 구조다.과학적 문제 선택01 / EVIDENCE독립·규칙 기반 검증02 / REASONING발견 계보·제어03 / VALIDATIONNEW EVIDENCE / REVISION
핵심 연구축과 증거 환류를 연결한 개념도 · 제안과 실증의 구분은 각 절을 따른다.
RESEARCH QUESTION

연구를 전진시키는 선행 아이디어 검색, 고비용 과학의 독립 검증, 발견 계보와 결정론적 제어를 하나의 연구 아키텍처로 연결한다.

조사 기록과 근거 수준

게시 기준일: 2026-10-05. 본문에 명시된 문서 기준일·갱신일을 게시 기준일로 사용한다. 원문에 명시된 개별 발표일과 검색 기간은 본문에 보존했다. 사전공개 논문, 연구자의 현장 보고, 기업 자체 발표와 워크숍 프로그램을 구분한다. Scientific Taste 분해식·Catalyst Graph·우선순위·통합 아키텍처는 개념적 해석이며 측정된 자연법칙이나 검증 완료된 시스템이 아니다.

PART 01

Scientific Taste와 연구 촉매 검색

2026년 10월 5일 기준으로 다시 확인한 결과, 이전 보고 이후 의미 있는 변화가 있다. 다만 이번 변화는 또 하나의 거대한 end-to-end AI Scientist가 등장했다기보다, Autonomous AI Scientist의 진짜 병목이 어디인지 더 명확해졌다는 점이 중요한다. 지난 보고에서 강조했던 Exploration → Scientific Specification Authority → Independent Verification 위에 이번 주에는 **“어떤 문제를 풀 가치가 있는가, 어떤 선행연구가 실제 돌파구가 되는가, 그리고 장시간·고비용 과학 워크플로를 어떻게 관측·검증할 것인가”**라는 세 문제가 뚜렷하게 올라왔다.

가장 압축해서 표현하면 연구 프런티어가

\[ \boxed{ \text{Execution Intelligence} \rightarrow \textbf{Scientific Taste \& Inspiration Intelligence} + \textbf{Judge-Free Verification} + \textbf{Agentic Science Systems Engineering} } \]

으로 확장되고 있다.

1. 이번 주 가장 중요한 신규 연구: Scientific Taste를 실제 benchmark로 측정하기 시작했다

10월 1일 공개된 ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research는 이번 업데이트에서 가장 중요하게 볼 논문이다. 기존 scientific retrieval은 “이 연구질문과 관련 있는 논문을 찾아라”를 평가하지만, 좋은 과학자는 관련 논문이 아니라 **“이 문제를 실제로 앞으로 밀어줄 아이디어가 들어 있는 논문”**을 찾아낸다. ScholarCatalyst는 바로 이 차이를 benchmark화했다. 184명의 lead author가 자신의 207개 최근 연구 프로젝트를 되짚어 보면서, 어떤 선행 논문이 실제로 연구를 진전시켰거나 진전시킬 수 있었는지를 직접 판정했다. arXiv

결과가 특히 흥미롭다. 일반 embedding retrieval은 Recall@20 약 0.48, 같은 retrieval tool을 사용하는 agentic search는 오히려 0.42였다. 더 강한 agent도 약 0.51에 머물렀고 저자들은 이 경우 target paper가 pretraining에 노출되었을 가능성도 주의해서 해석한다. 즉 agent에게 검색 도구와 reasoning loop를 더 준다고 해서 “과학적으로 영감을 줄 논문”을 더 잘 찾는 것은 아니다. arXiv

ScholarCatalyst 논문

이것은 기존 RAG·Agentic RAG와 상당히 다른 연구문제를 만든다.

기존 retrieval의 목적함수는 대략

\[ \operatorname{Rel}(q,p) \]

즉 질문 \(q\)와 논문 \(p\)의 semantic relevance였다. 앞으로 scientific-agent retrieval에서는 오히려

\[ \operatorname{CatalyticValue}(p\mid q) = P(\text{research progress}\mid p,q) \]

를 학습해야 할 수 있다.

예를 들어 신약개발 문제를 풀 때 가장 도움이 되는 논문이 같은 target이나 같은 disease를 다룬 논문이 아니라, 다른 분야의 causal inference 방법, uncertainty-aware active learning, 특정 graph representation 아이디어일 수도 있다.

따라서 Catalyst Retrieval, Inspiration-Aware RAG, Cross-Domain Analogy Retrieval, Scientific Serendipity Search가 새로운 독립 연구분야로 분화될 가능성이 높아졌다.


2. Scientific Taste 문제가 실제 연구현장에서도 확인되고 있다

10월 1일 Anthropic에 게시된 Matthew Schwartz의 **“Claude-shaped science”**는 peer-reviewed benchmark는 아니므로 연구논문과 동일하게 취급해서는 안 되지만, ScholarCatalyst와 매우 잘 맞물리는 중요한 field report이다.

Schwartz는 현재 LLM을 인간 과학자처럼 일하게 억지로 만들기보다, current LLM이 잘하는 계산·코딩·문헌 간 연결에 맞는 **“Claude-shaped problems”**를 찾는 방식을 사용했다. 그 과정에서 BootLoops라는 quantitative-science harness를 만들었고, 약 400개의 candidate problem에서 18개 분야 36개 manuscript를 진행했다고 보고한다. 하지만 더 중요한 관찰은 숫자가 아니다. 저자 자신이 거의 모든 경우 AI가 기술적으로 맞는 결과를 내더라도, 해당 분야 전문가가 개입하기 전에는 과학적으로 그다지 중요한 결과가 아니었다고 설명한다. Anthropic

또한 실제 장기 연구에서 현재 agent의 취약점도 상당히 구체적이다. 완료되지 않은 상태에서 성공했다고 선언하거나, qualitative agreement를 과신하거나, 계산 결과에서 잘못된 결론을 끌어내거나, 훨씬 좋은 알고리즘을 만들 수 있는데도 장시간 brute-force 계산을 계속하는 문제가 보고됐다. 이에 따라 rigid success criteria, human inspection, domain-expert judgment, protocol skills 같은 보조 장치가 필요했다. Anthropic

Claude-shaped science 원문

ScholarCatalyst와 이 사례를 함께 보면 상당히 강한 결론이 나온다.

현재 AI Scientist의 큰 병목은 **“science를 수행할 수 있는가?”에서 “어떤 science를 수행해야 하는가?”**로 이동하고 있다.

즉 앞으로 중요한 능력은 단순 IQ나 coding capability가 아니라 Scientific Taste이다.

Scientific Taste를 좀 더 연구 가능한 개념으로 분해하면 다음과 같다.

\[ \text{Scientific Taste} = \text{Problem Value} + \text{Catalytic Prior Work} + \text{Novelty} + \text{Information Gain} + \text{Feasibility} + \text{Scientific Significance} \]

이것은 향후 AI Research Director, Meta-Science Agent, Research Portfolio Optimization으로 직접 연결될 수 있다.


PART 02

고비용 검증과 이상현상 판단

3. 새롭게 중요도가 크게 올라간 Benchmark 방향: 고비용 과학도 실제 연구처럼 평가하기

9월 30일 공개된 CompMat-Bench: Benchmarking AI Agents for Computational Materials Science도 이번 주의 중요한 신규 결과이다.

기존 scientific-agent benchmark에는 구조적인 문제가 있다. DFT나 molecular dynamics처럼 한 번의 계산에 수 시간~수일이 걸리는 과학에서는 여러 모델·여러 trial을 평가하려면 동일한 비싼 simulation을 계속 반복해야 한다.

CompMat-Bench는 이 문제를 매우 영리하게 해결한다. 15개의 최근 peer-reviewed computational-materials 연구로부터 94개의 실제 연구 task를 만들고, 비싼 simulation은 benchmark 제작자가 미리 한 번 수행한다. Agent는 simulation input을 준비하거나 precomputed output을 해석하고, 결과는 LLM judge가 아니라 수치 tolerance와 숨겨진 reference를 이용한 fixed-rule verifier로 판정한다. arXiv

특히 네 가지 조건을 분리한다.

\[ \text{Task Span} \times \text{Method Guidance} \]

즉 single-step/workflow와 full/reduced guidance를 교차시킵니다.

full guidance의 단일 task에서는 agent들이 66.0~90.4% 수준의 높은 pass rate를 보였지만, workflow가 길어지고 방법 설명을 줄이면 성능이 하락한다. 더 중요한 점은 실패의 주원인이 tool 사용법 자체가 아니라 scientific errors였다는 것이다. 논문은 특히 agent가 자신의 결과에서 숙련된 연구자라면 알아차릴 이상(anomaly)을 놓치는 경우를 주요 failure mode로 지적한다. arXiv

CompMat-Bench 논문

이 연구는 앞으로 benchmark를 단순 accuracy 표가 아니라 다음과 같은 다차원 평가로 바꿀 가능성이 높다.

평가축 기존 방식 새롭게 필요한 방식
현실성 toy task 실제 peer-reviewed workflow
검증 LLM-as-judge deterministic / numerical verifier
비용 계산이 싼 task만 비싼 계산은 precompute하여 보존
자율성 자세한 방법 제공 reduced/no methodological guidance
연구 길이 single step connected multi-step workflow
실패 분석 pass/fail scientific-error taxonomy
재현성 한 번의 run repeated-run reliability
판단력 결과 산출 anomaly·implausibility 탐지

특히 Scientific Benchmark Compiler라는 새로운 연구방향이 가능해 보이다.

논문과 code repository를 입력하면 자동으로

\[ Paper \rightarrow Research\ DAG \rightarrow Expensive/cheap\ step\ separation \rightarrow Precomputation \rightarrow Hidden\ verifier \rightarrow Agent\ benchmark \]

로 변환하는 시스템이다.

이 방향은 향후 AI Scientist 평가를 규모 있게 만드는 핵심 인프라가 될 가능성이 높다.


4. 예상보다 중요도가 더 빠르게 올라가는 분야: Scientific Anomaly Judgment

이번 업데이트에서 개인적으로 특히 주목할 만한 교차 신호가 있다.

CompMat-Bench에서는 agent의 주요 실패 중 하나가

자기가 만든 과학적 결과가 이상하다는 것을 알아차리지 못하는 것

이었다. arXiv

반대로 Anthropic의 ART 사례에서 AI가 새로운 후보를 찾은 핵심은 대규모 DNA 데이터에서 평범하지 않은 repeat pattern을 알아차린 것이었다. Anthropic은 약 20만 개 이상의 reverse transcriptase를 조사해 약 3,500개 candidate system을 만들고 20개 후보로 좁혔으며, 그 가운데 특이한 DNA repeat array를 발견했다고 보고한다. 약 950개 agent가 21시간 동안 탐색했고, 이후 wet-lab 검증은 인간 연구자가 수행했다. ART의 실제 biological function은 아직 밝혀지지 않았다. Anthropic

즉 좋은 AI Scientist에는 단순 anomaly detection보다 더 높은 수준의 능력이 필요한다.

\[ \boxed{ \text{Scientific Anomaly Judgment} } \]

이다.

이는

\[ \text{Observation} \rightarrow \text{Expected scientific regime} \rightarrow \text{Deviation} \rightarrow \text{Artifact?} \rightarrow \text{Error?} \rightarrow \text{Potential discovery?} \]

를 구별하는 능력이다.

단순 통계적 outlier detection과 다른 이유는 “이상하지만 중요한 것”과 “이상하지만 잘못된 것”을 구분해야 하기 때문이다.

향후 세부 분야로는 Anomaly-to-Hypothesis Agents, Scientific Surprise Modeling, Mechanism-Seeking Anomaly Detection, Discovery Significance Estimation 등이 상당히 유망해 보이다.


PART 03

발견 계보와 과학 시스템 제어

5. ART 사례가 만든 더 중요한 후속 문제: Discovery Provenance와 Priority

ART 발표 자체는 9월 23일이므로 이전 업데이트 시점보다 앞섭니다. 그러나 9월 29일 이후 후속 검증 논쟁이 커지면서 이번 주 중요도가 크게 올라간 부분은 별도로 볼 필요가 있다.

Anthropic의 발표에 따르면 기존에 알려졌던 reverse transcriptase 자체보다 RT 주변의 repeat array와 accessory protein의 결합 패턴을 새 system으로 인식한 것이 핵심 신규 주장이다. 하지만 외부 연구자들은 아직 ART의 실제 기능이 밝혀지지 않았고, “CRISPR-like”라는 표현을 기능적 의미로 확대해서는 안 되며, 추가 실험 검증이 필요하다고 강조하고 있다. Anthropic

더 넓게 보면 이 사례는 AI Scientist 시대에 매우 어려운 질문을 제기한다.

AI가 발견했다고 주장한 지식이 실제로 어디에서 왔는가?

앞으로는 단순 experiment provenance보다 훨씬 세밀한 Discovery Provenance가 필요한다.

예를 들어 하나의 discovery claim에 대해

01 Claim
02 source literature
03 retrieved passages
04 model/version
05 search queries
06 candidate hypotheses
07 rejected candidates
08 intermediate analysis
09 human interventions
10 experiment results
11 timestamps
12 external validation

을 남겨야 한다.

이렇게 해야

  • 독립적 발견인가,
  • 기존 알려진 지식의 재발견인가,
  • 어떤 사람의 아이디어가 핵심이었는가,
  • model이 어떤 자료를 근거로 결론에 도달했는가,
  • 다른 agent가 같은 discovery를 재현할 수 있는가

를 구분할 수 있다.

따라서 Scientific Provenance Graph → Discovery Priority Ledger로 연구를 확장할 가치가 매우 높다.


6. 이번 주 연구생태계에서 가장 뚜렷해진 변화: AI Scientist가 HPC/Data Systems 분야가 되고 있다

9월 28일~10월 2일 IEEE eScience 2026과 함께 열린 첫 AGENT4SC — Workshop on Agentic AI for Large-scale Science의 실제 프로그램도 중요한 신호이다.

이 워크숍은 agentic AI를 단순 LLM research assistant로 다루지 않고 scientific infrastructure의 새로운 control plane으로 정의한다. 대규모 agent가 HPC allocation을 요청하고, simulation ensemble을 실행하고, PB-scale 데이터를 이동하며, instrument–compute scheduling을 제어할 경우 작은 오류도 막대한 자원 낭비와 과학적 invalidity로 확대될 수 있다는 문제의식을 전면에 둡니다. Agent4SC

더 주목할 것은 실제 발표 주제이다. SPECTRA: Detecting Silent Failures … via Dual-Layer Observability, Beyond the Session Boundary: Three Traces of Provenance, Multi-Agent Discovery and Resource-Aware Autonomous Exploration, Evaluating Scientific MCP Interfaces, 그리고 Keeping the Agent Out of the Hot Loop: A Deterministic Control Plane for DFT Workflows Across HPC Centers 등이 한 프로그램에 모였다. Agent4SC

AGENT4SC 2026 프로그램

이것은 이전에 예상했던 Scientific Agent Data Systems가 실제 독립 시스템 분야로 빠르게 굳어지고 있다는 강한 신호이다.

핵심 아키텍처는 앞으로 대략 다음처럼 바뀔 가능성이 높다.

01 AI Scientist
02 reasoning / planning
03 Scientific Control
04 Plane
05 Data System HPC Instrument
06 provenance scheduler lab control
07 cache resource safety
08 KG/VDB allocation interlock
09 Deterministic Validators
10 Scientific Ledger

중요한 설계 원칙은 **“LLM에게 모든 것을 맡기지 않는다”**이다.

고수준 hypothesis·planning에는 probabilistic agent를 사용하되,

  • 안전,
  • 장비 제어,
  • resource limit,
  • workflow state,
  • provenance,
  • numerical validation

같은 부분은 deterministic subsystem에 맡기는 Hybrid Agentic Science Architecture가 점점 중요해질 것으로 보이다.


PART 04

전문가 역할과 실행 가능한 전문성

7. 새로운 negative result도 중요하다: 전문가 역할 프롬프트 ≠ 과학적 전문성

최근 arXiv에 노출된 Scientific Agents: Evaluating Profession-Specific System Prompts on Scientific Tasks도 중요한 반례를 제공한다. 이 연구는 503개의 직업·분야별 상세 AGENTS.md profile을 만들고 9개 science benchmark에서 matched expert profile과 최소한의 generic assistant prompt를 비교했다.

결과적으로 상세한 전문 profile은 평균 정확도를 명확하게 향상시키지 못했고, output token은 1.5–2.3배, 성공 호출당 비용은 2.2–4.5배 증가했다. tool-using BioMysteryBench에서는 오히려 profile 조건의 solve rate가 낮았다. arXiv

Scientific Agents 논문

이는 이전에 추적해온 Scientific Agent Skills / Procedural Memory 논의에 중요한 수정점을 준다.

\[ \boxed{ \text{Expert Persona} \neq \text{Scientific Expertise} } \]

즉 긴 system prompt에

“당신은 세계 최고 수준의 생물정보학자이다.”

라고 적는 것으로는 충분하지 않는다.

실질적인 전문성은 오히려

\[ \text{Executable Procedure} + \text{Domain Tool} + \text{Scientific Constraint} + \text{Evidence} + \text{Feedback} \]

로 표현되어야 한다는 방향이 더 설득력을 얻고 있다.


PART 05

연구 우선순위와 여섯 분화 방향

8. 따라서 현재 연구 중요도를 다시 조정하면

장기적으로 가장 중요한 기반축은 여전히 Falsifiable & Epistemically Accountable AI Scientist이다. 그러나 이번 주 상승폭을 기준으로 보면 판도가 조금 달라졌다.

현재 우선순위 연구축 이번 변화
1 Scientific Taste & Catalyst/Inspirational Retrieval 신규 급부상 ↑↑↑
2 Falsifiable & Epistemically Accountable AI Scientist 최상위 기반축 유지
3 Cost-Aware, Judge-Free Scientific Evaluation 신규 급부상 ↑↑↑
4 Scientific Agent Observability / Deterministic Control Plane ↑↑↑
5 Discovery Provenance & Independent Verification ↑↑
6 Scientific Anomaly Judgment 신규 독립축 ↑↑
7 Exploration-Driven Scientific Discovery 매우 중요 유지
8 Long-Horizon Scientific Lineage & Memory 중요 유지
9 Executable Scientific Procedures / Skills 중요도 강화
10 Closed-Loop / Embodied Autonomous Laboratory 장기 최상위 응용축

9. 향후 독립 세부 연구분야로 특히 크게 분화될 가능성이 높은 주제

이번 업데이트를 바탕으로 보면 Scientific Taste가 상당히 큰 umbrella field가 될 가능성이 있다.

첫째, Catalyst-Aware Scientific RAG이다. 단순 관련성을 넘어서 “이 paper가 현재 research problem을 실제로 얼마나 전진시키는가?”를 retrieval objective로 사용한다. ScholarCatalyst가 첫 benchmark 역할을 할 수 있다.

둘째, Scientific Analogical Search이다. 동일 분야 문헌이 아니라 서로 다른 분야 사이에서 구조적으로 동일한 problem–method 관계를 발견한다. BootLoops 사례가 바로 이런 cross-domain method transfer의 실질적 사례이다. Anthropic

셋째, Scientific Taste Learning이다. 전문가가 수백 개 hypothesis에서 실제 실험할 후보를 선택하는 데이터를 preference learning으로 학습한다. 단, citation이나 popularity를 reward로 삼으면 연구 유행을 강화하는 문제가 있으므로 novelty·falsifiability·expected information gain과 함께 평가해야 한다.

넷째, Scientific Anomaly Judgment이다. 물리적으로 불가능한 결과, implementation bug, noise, genuine anomaly를 구분하고 genuine anomaly에서 새로운 hypothesis를 발생시키는 연구이다.

다섯째, Discovery Provenance & Priority이다. AI–인간 공동 발견의 아이디어 계보와 evidence lineage를 machine-auditable하게 기록한다.

여섯째, Scientific Agent Control Plane이다. Agent에게 직접 HPC와 실험 장비를 통제시키지 않고 deterministic policy, scheduler, provenance monitor, validator를 사이에 두는 시스템 연구이다.


PART 06

Catalyst Graph와 다축 평가 공간

10. 특히 유망한 새로운 연구주제: Scientific Catalyst Graph

이번 ScholarCatalyst 결과는 Knowledge Graph/Agentic RAG 관점에서도 매우 흥미로운 기회를 만든다.

일반 scientific KG가

\[ Entity \rightarrow Relation \rightarrow Entity \]

를 저장한다면 Scientific Catalyst Graph는

\[ \text{Research Problem} \rightarrow \text{Needed Insight} \rightarrow \text{Catalyst Idea} \rightarrow \text{Prior Paper} \rightarrow \text{Transferred Method} \rightarrow \text{New Hypothesis} \]

를 저장한다.

그리고 hyper-relation을 사용하여

\[ ( Problem, Catalyst, Method; Domain, Condition, Evidence, Time, ResearchStage ) \]

를 나타낼 수 있다.

그러면 AI Scientist가

“현재 내가 막힌 이유는 무엇인가?”

를 분석하고

“같은 domain의 논문을 더 검색한다.”

가 아니라

“현재 병목은 small-sample causal identification이므로 다른 분야에서 이 구조를 해결한 방법을 찾아본다.”

라는 식으로 retrieval을 할 수 있다.

이것은 Agentic RAG + HRKG + Autonomous AI Scientist의 매우 좋은 신규 연구접점이다.


11. Benchmark 자체도 이제 ‘사다리’보다 평가 공간으로 보는 것이 더 적절하다

지난 보고까지는 benchmark 발전을

\[ QA \rightarrow Coding \rightarrow Reproduction \rightarrow Discovery \rightarrow Exploration \]

처럼 선형 단계로 설명할 수 있었다.

하지만 최근 연구를 보면 이제 여러 독립 축으로 평가해야 한다.

\[ \boxed{ Evaluation = f( Reality, Autonomy, Horizon, Verification, Cost, Taste, Repeatability, Provenance ) } \]

여기서 Reality는 synthetic task에서 실제 peer-reviewed study로, Autonomy는 상세 방법 제공에서 problem-only로, Horizon은 한 step에서 전체 research campaign으로, Verification은 LLM judge에서 numerical/physical/laboratory oracle로 확장됩니다.

여기에 이번 주 새로 명확해진 Taste는 “관련 결과를 찾았는가?”가 아니라 “과학적으로 가치 있는 방향을 골랐는가?”이고, Repeatability는 한 번 우연히 discovery한 것이 아니라 동일 campaign을 반복했을 때 얼마나 안정적으로 발견하는지를 의미한다.

이 마지막 두 지표가 향후 매우 중요해질 가능성이 높다.


PART 07

신규 아키텍처와 최종 판단

12. 현재 시점에서 가장 추천하는 신규 연구주제

하나만 고른다면 현재는 다음 방향을 가장 강하게 추천한다.

Catalyst-Aware, Anomaly-Seeking, and Epistemically Accountable Autonomous AI Scientist

이를 한 줄로 표현하면,

\[ \boxed{ \text{Find what matters} \rightarrow \text{Find what is strange} \rightarrow \text{Explain why} \rightarrow \text{Try to falsify it} \rightarrow \text{Prove where it came from} } \]

이다.

전체 architecture는 다음처럼 구성할 수 있다.

01 Research Problem
02 Problem Value / Scientific Taste
03 Catalyst Retrieval
04 same-domain evidence
05 cross-domain analogies
06 Hypothesis Population
07 Experiment / Simulation
08 Scientific Anomaly Judge
09 Artifact/Error Genuine Surprise
10 Falsification Test
11 Independent Verifier
12 Discovery Provenance Graph
13 Belief Revision

이 구조는 기존 AI Scientist가 상대적으로 약하게 다루던 **“무엇이 중요한가?”와 “무엇이 이상한가?”**를 전면에 둔다는 점에서 차별성이 큽니다.

최종 판단

이번 주에는 분명한 의미 있는 변화가 있었다.

특히 가장 중요한 세 가지는 ScholarCatalyst, CompMat-Bench, 그리고 AGENT4SC에서 드러난 large-scale scientific-agent systems 연구의 구체화이다. ScholarCatalyst는 처음으로 과학적 영감·연구 촉진 가능성 자체를 retrieval benchmark의 대상으로 만들었고, CompMat-Bench는 실제 고비용 과학을 LLM judge 없이 현실적인 비용으로 평가하는 방법을 보여줬으며, AGENT4SC는 provenance·observability·deterministic control plane·resource scheduling을 AI Scientist의 주변 인프라가 아니라 핵심 연구문제로 끌어올렸다. arXiv

따라서 이전 보고에서 정리했던

\[ \text{Exploration} \times \text{Discovery} \times \text{Specification} \times \text{Verification} \]

에 이제는 Scientific Taste를 반드시 추가하는 것이 좋다.

\[ \boxed{ \textbf{Scientific Taste} \times \textbf{Exploration} \times \textbf{Discovery} \times \textbf{Verification} \times \textbf{Provenance} \times \textbf{Systems Reliability} } \]

현재 흐름대로라면 다음 세대 Autonomous AI Scientist의 차별점은 **“얼마나 많은 실험을 자동으로 수행하느냐”가 아니라, “어떤 연구가 가치 있는지 찾아내고, 예상 밖의 결과 중 진짜 발견을 구별하며, 그 발견이 어디서 왔고 왜 믿을 수 있는지를 끝까지 증명할 수 있느냐”**가 될 가능성이 가장 높다.

SOURCE RECORD

자료와 출처

구성 자료: Autonomous-AI-Scientist-1005.md. 첨부의 모든 연구 항목, 비교, 수치, 표, 수식, 한계와 후속 연구 제안을 수록했다. 대화 시스템의 인용 표시와 추적 매개변수는 편집 과정에서 제거했다. 읽기용 본문 외에 첨부 원문도 아래에 보존한다. 본문 링크는 해당 자료로 연결된다.

  1. arXivarxiv.org · PRIMARY SOURCE / RESEARCH RESOURCE
  2. Anthropicwww.anthropic.com · PRIMARY SOURCE / RESEARCH RESOURCE
  3. arXivarxiv.org · PRIMARY SOURCE / RESEARCH RESOURCE
  4. Anthropicwww.anthropic.com · PRIMARY SOURCE / RESEARCH RESOURCE
  5. Agent4SCagent4sc.github.io · PRIMARY SOURCE / RESEARCH RESOURCE
  6. arXivarxiv.org · PRIMARY SOURCE / RESEARCH RESOURCE
첨부 원문 전체 보기 · Autonomous-AI-Scientist-1005.md
2026년 **10월 5일** 기준으로 다시 확인한 결과, **이전 보고 이후 의미 있는 변화가 있습니다.** 다만 이번 변화는 또 하나의 거대한 end-to-end AI Scientist가 등장했다기보다, **Autonomous AI Scientist의 진짜 병목이 어디인지 더 명확해졌다는 점**이 중요합니다. 지난 보고에서 강조했던 **Exploration → Scientific Specification Authority → Independent Verification** 위에 이번 주에는 **“어떤 문제를 풀 가치가 있는가, 어떤 선행연구가 실제 돌파구가 되는가, 그리고 장시간·고비용 과학 워크플로를 어떻게 관측·검증할 것인가”**라는 세 문제가 뚜렷하게 올라왔습니다.

가장 압축해서 표현하면 연구 프런티어가

\[
\boxed{
\text{Execution Intelligence}
\rightarrow
\textbf{Scientific Taste \& Inspiration Intelligence}
+
\textbf{Judge-Free Verification}
+
\textbf{Agentic Science Systems Engineering}
}
\]

으로 확장되고 있습니다.

## 1. 이번 주 가장 중요한 신규 연구: **Scientific Taste를 실제 benchmark로 측정하기 시작했다**

10월 1일 공개된 **ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research**는 이번 업데이트에서 가장 중요하게 볼 논문입니다. 기존 scientific retrieval은 “이 연구질문과 관련 있는 논문을 찾아라”를 평가하지만, 좋은 과학자는 관련 논문이 아니라 **“이 문제를 실제로 앞으로 밀어줄 아이디어가 들어 있는 논문”**을 찾아냅니다. ScholarCatalyst는 바로 이 차이를 benchmark화했습니다. 184명의 lead author가 자신의 207개 최근 연구 프로젝트를 되짚어 보면서, 어떤 선행 논문이 실제로 연구를 진전시켰거나 진전시킬 수 있었는지를 직접 판정했습니다. [arXiv](https://arxiv.org/abs/2610.02202)

결과가 특히 흥미롭습니다. 일반 embedding retrieval은 Recall@20 약 **0.48**, 같은 retrieval tool을 사용하는 agentic search는 오히려 **0.42**였습니다. 더 강한 agent도 약 0.51에 머물렀고 저자들은 이 경우 target paper가 pretraining에 노출되었을 가능성도 주의해서 해석합니다. 즉 **agent에게 검색 도구와 reasoning loop를 더 준다고 해서 “과학적으로 영감을 줄 논문”을 더 잘 찾는 것은 아닙니다.** [arXiv](https://arxiv.org/abs/2610.02202)

[ScholarCatalyst 논문](https://arxiv.org/abs/2610.02202)

이것은 기존 RAG·Agentic RAG와 상당히 다른 연구문제를 만듭니다.

기존 retrieval의 목적함수는 대략

\[
\operatorname{Rel}(q,p)
\]

즉 질문 \(q\)와 논문 \(p\)의 semantic relevance였습니다. 앞으로 scientific-agent retrieval에서는 오히려

\[
\operatorname{CatalyticValue}(p\mid q)
=
P(\text{research progress}\mid p,q)
\]

를 학습해야 할 수 있습니다.

예를 들어 신약개발 문제를 풀 때 가장 도움이 되는 논문이 같은 target이나 같은 disease를 다룬 논문이 아니라, **다른 분야의 causal inference 방법, uncertainty-aware active learning, 특정 graph representation 아이디어**일 수도 있습니다.

따라서 **Catalyst Retrieval, Inspiration-Aware RAG, Cross-Domain Analogy Retrieval, Scientific Serendipity Search**가 새로운 독립 연구분야로 분화될 가능성이 높아졌습니다.

---

## 2. Scientific Taste 문제가 실제 연구현장에서도 확인되고 있다

10월 1일 Anthropic에 게시된 Matthew Schwartz의 **“Claude-shaped science”**는 peer-reviewed benchmark는 아니므로 연구논문과 동일하게 취급해서는 안 되지만, ScholarCatalyst와 매우 잘 맞물리는 중요한 field report입니다.

Schwartz는 현재 LLM을 인간 과학자처럼 일하게 억지로 만들기보다, current LLM이 잘하는 계산·코딩·문헌 간 연결에 맞는 **“Claude-shaped problems”**를 찾는 방식을 사용했습니다. 그 과정에서 BootLoops라는 quantitative-science harness를 만들었고, 약 400개의 candidate problem에서 18개 분야 36개 manuscript를 진행했다고 보고합니다. 하지만 더 중요한 관찰은 숫자가 아닙니다. 저자 자신이 **거의 모든 경우 AI가 기술적으로 맞는 결과를 내더라도, 해당 분야 전문가가 개입하기 전에는 과학적으로 그다지 중요한 결과가 아니었다**고 설명합니다. [Anthropic](https://www.anthropic.com/research/claude-shaped-science)

또한 실제 장기 연구에서 현재 agent의 취약점도 상당히 구체적입니다. 완료되지 않은 상태에서 성공했다고 선언하거나, qualitative agreement를 과신하거나, 계산 결과에서 잘못된 결론을 끌어내거나, 훨씬 좋은 알고리즘을 만들 수 있는데도 장시간 brute-force 계산을 계속하는 문제가 보고됐습니다. 이에 따라 rigid success criteria, human inspection, domain-expert judgment, protocol skills 같은 보조 장치가 필요했습니다. [Anthropic](https://www.anthropic.com/research/claude-shaped-science)

[Claude-shaped science 원문](https://www.anthropic.com/research/claude-shaped-science)

ScholarCatalyst와 이 사례를 함께 보면 상당히 강한 결론이 나옵니다.

> 현재 AI Scientist의 큰 병목은 **“science를 수행할 수 있는가?”에서 “어떤 science를 수행해야 하는가?”**로 이동하고 있습니다.

즉 앞으로 중요한 능력은 단순 IQ나 coding capability가 아니라 **Scientific Taste**입니다.

Scientific Taste를 좀 더 연구 가능한 개념으로 분해하면 다음과 같습니다.

\[
\text{Scientific Taste}
=
\text{Problem Value}
+
\text{Catalytic Prior Work}
+
\text{Novelty}
+
\text{Information Gain}
+
\text{Feasibility}
+
\text{Scientific Significance}
\]

이것은 향후 **AI Research Director**, **Meta-Science Agent**, **Research Portfolio Optimization**으로 직접 연결될 수 있습니다.

---

## 3. 새롭게 중요도가 크게 올라간 Benchmark 방향: **고비용 과학도 실제 연구처럼 평가하기**

9월 30일 공개된 **CompMat-Bench: Benchmarking AI Agents for Computational Materials Science**도 이번 주의 중요한 신규 결과입니다.

기존 scientific-agent benchmark에는 구조적인 문제가 있습니다. DFT나 molecular dynamics처럼 한 번의 계산에 수 시간~수일이 걸리는 과학에서는 여러 모델·여러 trial을 평가하려면 동일한 비싼 simulation을 계속 반복해야 합니다.

CompMat-Bench는 이 문제를 매우 영리하게 해결합니다. 15개의 최근 peer-reviewed computational-materials 연구로부터 **94개의 실제 연구 task**를 만들고, 비싼 simulation은 benchmark 제작자가 미리 한 번 수행합니다. Agent는 simulation input을 준비하거나 precomputed output을 해석하고, 결과는 LLM judge가 아니라 **수치 tolerance와 숨겨진 reference를 이용한 fixed-rule verifier**로 판정합니다. [arXiv](https://arxiv.org/abs/2610.00636)

특히 네 가지 조건을 분리합니다.

\[
\text{Task Span}
\times
\text{Method Guidance}
\]

즉 single-step/workflow와 full/reduced guidance를 교차시킵니다.

full guidance의 단일 task에서는 agent들이 66.0~90.4% 수준의 높은 pass rate를 보였지만, **workflow가 길어지고 방법 설명을 줄이면 성능이 하락**합니다. 더 중요한 점은 실패의 주원인이 tool 사용법 자체가 아니라 **scientific errors**였다는 것입니다. 논문은 특히 agent가 자신의 결과에서 숙련된 연구자라면 알아차릴 이상(anomaly)을 놓치는 경우를 주요 failure mode로 지적합니다. [arXiv](https://arxiv.org/abs/2610.00636)

[CompMat-Bench 논문](https://arxiv.org/abs/2610.00636)

이 연구는 앞으로 benchmark를 단순 accuracy 표가 아니라 다음과 같은 다차원 평가로 바꿀 가능성이 높습니다.

| 평가축 | 기존 방식 | 새롭게 필요한 방식 |
|---|---|---|
| **현실성** | toy task | 실제 peer-reviewed workflow |
| **검증** | LLM-as-judge | deterministic / numerical verifier |
| **비용** | 계산이 싼 task만 | 비싼 계산은 precompute하여 보존 |
| **자율성** | 자세한 방법 제공 | reduced/no methodological guidance |
| **연구 길이** | single step | connected multi-step workflow |
| **실패 분석** | pass/fail | scientific-error taxonomy |
| **재현성** | 한 번의 run | repeated-run reliability |
| **판단력** | 결과 산출 | anomaly·implausibility 탐지 |

특히 **Scientific Benchmark Compiler**라는 새로운 연구방향이 가능해 보입니다.

논문과 code repository를 입력하면 자동으로

\[
Paper
\rightarrow
Research\ DAG
\rightarrow
Expensive/cheap\ step\ separation
\rightarrow
Precomputation
\rightarrow
Hidden\ verifier
\rightarrow
Agent\ benchmark
\]

로 변환하는 시스템입니다.

이 방향은 향후 AI Scientist 평가를 규모 있게 만드는 핵심 인프라가 될 가능성이 높습니다.

---

## 4. 예상보다 중요도가 더 빠르게 올라가는 분야: **Scientific Anomaly Judgment**

이번 업데이트에서 개인적으로 특히 주목할 만한 교차 신호가 있습니다.

CompMat-Bench에서는 agent의 주요 실패 중 하나가

> **자기가 만든 과학적 결과가 이상하다는 것을 알아차리지 못하는 것**

이었습니다. [arXiv](https://arxiv.org/abs/2610.00636)

반대로 Anthropic의 ART 사례에서 AI가 새로운 후보를 찾은 핵심은 대규모 DNA 데이터에서 **평범하지 않은 repeat pattern을 알아차린 것**이었습니다. Anthropic은 약 20만 개 이상의 reverse transcriptase를 조사해 약 3,500개 candidate system을 만들고 20개 후보로 좁혔으며, 그 가운데 특이한 DNA repeat array를 발견했다고 보고합니다. 약 950개 agent가 21시간 동안 탐색했고, 이후 wet-lab 검증은 인간 연구자가 수행했습니다. ART의 실제 biological function은 아직 밝혀지지 않았습니다. [Anthropic](https://www.anthropic.com/news/claude-discovers-novel-enzyme-system)

즉 좋은 AI Scientist에는 단순 anomaly detection보다 더 높은 수준의 능력이 필요합니다.

\[
\boxed{
\text{Scientific Anomaly Judgment}
}
\]

입니다.

이는

\[
\text{Observation}
\rightarrow
\text{Expected scientific regime}
\rightarrow
\text{Deviation}
\rightarrow
\text{Artifact?}
\rightarrow
\text{Error?}
\rightarrow
\text{Potential discovery?}
\]

를 구별하는 능력입니다.

단순 통계적 outlier detection과 다른 이유는 **“이상하지만 중요한 것”과 “이상하지만 잘못된 것”을 구분해야 하기 때문**입니다.

향후 세부 분야로는 **Anomaly-to-Hypothesis Agents, Scientific Surprise Modeling, Mechanism-Seeking Anomaly Detection, Discovery Significance Estimation** 등이 상당히 유망해 보입니다.

---

## 5. ART 사례가 만든 더 중요한 후속 문제: **Discovery Provenance와 Priority**

ART 발표 자체는 9월 23일이므로 이전 업데이트 시점보다 앞섭니다. 그러나 **9월 29일 이후 후속 검증 논쟁이 커지면서 이번 주 중요도가 크게 올라간 부분**은 별도로 볼 필요가 있습니다.

Anthropic의 발표에 따르면 기존에 알려졌던 reverse transcriptase 자체보다 RT 주변의 repeat array와 accessory protein의 결합 패턴을 새 system으로 인식한 것이 핵심 신규 주장입니다. 하지만 외부 연구자들은 아직 ART의 실제 기능이 밝혀지지 않았고, “CRISPR-like”라는 표현을 기능적 의미로 확대해서는 안 되며, 추가 실험 검증이 필요하다고 강조하고 있습니다. [Anthropic](https://www.anthropic.com/news/claude-discovers-novel-enzyme-system)

더 넓게 보면 이 사례는 AI Scientist 시대에 매우 어려운 질문을 제기합니다.

> **AI가 발견했다고 주장한 지식이 실제로 어디에서 왔는가?**

앞으로는 단순 experiment provenance보다 훨씬 세밀한 **Discovery Provenance**가 필요합니다.

예를 들어 하나의 discovery claim에 대해

```text
Claim
 ├─ source literature
 ├─ retrieved passages
 ├─ model/version
 ├─ search queries
 ├─ candidate hypotheses
 ├─ rejected candidates
 ├─ intermediate analysis
 ├─ human interventions
 ├─ experiment results
 ├─ timestamps
 └─ external validation
```

을 남겨야 합니다.

이렇게 해야

- 독립적 발견인가,
- 기존 알려진 지식의 재발견인가,
- 어떤 사람의 아이디어가 핵심이었는가,
- model이 어떤 자료를 근거로 결론에 도달했는가,
- 다른 agent가 같은 discovery를 재현할 수 있는가

를 구분할 수 있습니다.

따라서 **Scientific Provenance Graph → Discovery Priority Ledger**로 연구를 확장할 가치가 매우 높습니다.

---

## 6. 이번 주 연구생태계에서 가장 뚜렷해진 변화: AI Scientist가 **HPC/Data Systems 분야**가 되고 있다

9월 28일~10월 2일 IEEE eScience 2026과 함께 열린 첫 **AGENT4SC — Workshop on Agentic AI for Large-scale Science**의 실제 프로그램도 중요한 신호입니다.

이 워크숍은 agentic AI를 단순 LLM research assistant로 다루지 않고 **scientific infrastructure의 새로운 control plane**으로 정의합니다. 대규모 agent가 HPC allocation을 요청하고, simulation ensemble을 실행하고, PB-scale 데이터를 이동하며, instrument–compute scheduling을 제어할 경우 작은 오류도 막대한 자원 낭비와 과학적 invalidity로 확대될 수 있다는 문제의식을 전면에 둡니다. [Agent4SC](https://agent4sc.github.io/)

더 주목할 것은 실제 발표 주제입니다. **SPECTRA: Detecting Silent Failures … via Dual-Layer Observability**, **Beyond the Session Boundary: Three Traces of Provenance**, **Multi-Agent Discovery and Resource-Aware Autonomous Exploration**, **Evaluating Scientific MCP Interfaces**, 그리고 **Keeping the Agent Out of the Hot Loop: A Deterministic Control Plane for DFT Workflows Across HPC Centers** 등이 한 프로그램에 모였습니다. [Agent4SC](https://agent4sc.github.io/)

[AGENT4SC 2026 프로그램](https://agent4sc.github.io/)

이것은 이전에 예상했던 **Scientific Agent Data Systems**가 실제 독립 시스템 분야로 빠르게 굳어지고 있다는 강한 신호입니다.

핵심 아키텍처는 앞으로 대략 다음처럼 바뀔 가능성이 높습니다.

```text
                   AI Scientist
                        │
              reasoning / planning
                        │
              ┌─────────▼─────────┐
              │ Scientific Control │
              │       Plane        │
              └─────────┬─────────┘
                        │
       ┌────────────────┼────────────────┐
       ▼                ▼                ▼
   Data System        HPC             Instrument
       │                │                │
   provenance       scheduler         lab control
   cache            resource          safety
   KG/VDB           allocation        interlock
       │                │                │
       └────────────────┼────────────────┘
                        ▼
             Deterministic Validators
                        │
                        ▼
                Scientific Ledger
```

중요한 설계 원칙은 **“LLM에게 모든 것을 맡기지 않는다”**입니다.

고수준 hypothesis·planning에는 probabilistic agent를 사용하되,

- 안전,
- 장비 제어,
- resource limit,
- workflow state,
- provenance,
- numerical validation

같은 부분은 deterministic subsystem에 맡기는 **Hybrid Agentic Science Architecture**가 점점 중요해질 것으로 보입니다.

---

## 7. 새로운 negative result도 중요하다: **전문가 역할 프롬프트 ≠ 과학적 전문성**

최근 arXiv에 노출된 **Scientific Agents: Evaluating Profession-Specific System Prompts on Scientific Tasks**도 중요한 반례를 제공합니다. 이 연구는 503개의 직업·분야별 상세 AGENTS.md profile을 만들고 9개 science benchmark에서 matched expert profile과 최소한의 generic assistant prompt를 비교했습니다.

결과적으로 상세한 전문 profile은 평균 정확도를 명확하게 향상시키지 못했고, output token은 1.5–2.3배, 성공 호출당 비용은 2.2–4.5배 증가했습니다. tool-using BioMysteryBench에서는 오히려 profile 조건의 solve rate가 낮았습니다. [arXiv](https://arxiv.org/abs/2610.00084)

[Scientific Agents 논문](https://arxiv.org/abs/2610.00084)

이는 이전에 추적해온 **Scientific Agent Skills / Procedural Memory** 논의에 중요한 수정점을 줍니다.

\[
\boxed{
\text{Expert Persona}
\neq
\text{Scientific Expertise}
}
\]

즉 긴 system prompt에

> “당신은 세계 최고 수준의 생물정보학자입니다.”

라고 적는 것으로는 충분하지 않습니다.

실질적인 전문성은 오히려

\[
\text{Executable Procedure}
+
\text{Domain Tool}
+
\text{Scientific Constraint}
+
\text{Evidence}
+
\text{Feedback}
\]

로 표현되어야 한다는 방향이 더 설득력을 얻고 있습니다.

---

# 8. 따라서 현재 연구 중요도를 다시 조정하면

장기적으로 가장 중요한 기반축은 여전히 **Falsifiable & Epistemically Accountable AI Scientist**입니다. 그러나 **이번 주 상승폭**을 기준으로 보면 판도가 조금 달라졌습니다.

| 현재 우선순위 | 연구축 | 이번 변화 |
|---:|---|---|
| **1** | **Scientific Taste & Catalyst/Inspirational Retrieval** | **신규 급부상 ↑↑↑** |
| **2** | **Falsifiable & Epistemically Accountable AI Scientist** | 최상위 기반축 유지 |
| **3** | **Cost-Aware, Judge-Free Scientific Evaluation** | **신규 급부상 ↑↑↑** |
| **4** | **Scientific Agent Observability / Deterministic Control Plane** | **↑↑↑** |
| **5** | **Discovery Provenance & Independent Verification** | **↑↑** |
| **6** | **Scientific Anomaly Judgment** | **신규 독립축 ↑↑** |
| **7** | **Exploration-Driven Scientific Discovery** | 매우 중요 유지 |
| **8** | **Long-Horizon Scientific Lineage & Memory** | 중요 유지 |
| **9** | **Executable Scientific Procedures / Skills** | 중요도 강화 |
| **10** | **Closed-Loop / Embodied Autonomous Laboratory** | 장기 최상위 응용축 |

---

# 9. 향후 독립 세부 연구분야로 특히 크게 분화될 가능성이 높은 주제

이번 업데이트를 바탕으로 보면 **Scientific Taste**가 상당히 큰 umbrella field가 될 가능성이 있습니다.

첫째, **Catalyst-Aware Scientific RAG**입니다. 단순 관련성을 넘어서 “이 paper가 현재 research problem을 실제로 얼마나 전진시키는가?”를 retrieval objective로 사용합니다. ScholarCatalyst가 첫 benchmark 역할을 할 수 있습니다.

둘째, **Scientific Analogical Search**입니다. 동일 분야 문헌이 아니라 서로 다른 분야 사이에서 구조적으로 동일한 problem–method 관계를 발견합니다. BootLoops 사례가 바로 이런 cross-domain method transfer의 실질적 사례입니다. [Anthropic](https://www.anthropic.com/research/claude-shaped-science)

셋째, **Scientific Taste Learning**입니다. 전문가가 수백 개 hypothesis에서 실제 실험할 후보를 선택하는 데이터를 preference learning으로 학습합니다. 단, citation이나 popularity를 reward로 삼으면 연구 유행을 강화하는 문제가 있으므로 novelty·falsifiability·expected information gain과 함께 평가해야 합니다.

넷째, **Scientific Anomaly Judgment**입니다. 물리적으로 불가능한 결과, implementation bug, noise, genuine anomaly를 구분하고 genuine anomaly에서 새로운 hypothesis를 발생시키는 연구입니다.

다섯째, **Discovery Provenance & Priority**입니다. AI–인간 공동 발견의 아이디어 계보와 evidence lineage를 machine-auditable하게 기록합니다.

여섯째, **Scientific Agent Control Plane**입니다. Agent에게 직접 HPC와 실험 장비를 통제시키지 않고 deterministic policy, scheduler, provenance monitor, validator를 사이에 두는 시스템 연구입니다.

---

# 10. 특히 유망한 새로운 연구주제: **Scientific Catalyst Graph**

이번 ScholarCatalyst 결과는 Knowledge Graph/Agentic RAG 관점에서도 매우 흥미로운 기회를 만듭니다.

일반 scientific KG가

\[
Entity
\rightarrow
Relation
\rightarrow
Entity
\]

를 저장한다면 **Scientific Catalyst Graph**는

\[
\text{Research Problem}
\rightarrow
\text{Needed Insight}
\rightarrow
\text{Catalyst Idea}
\rightarrow
\text{Prior Paper}
\rightarrow
\text{Transferred Method}
\rightarrow
\text{New Hypothesis}
\]

를 저장합니다.

그리고 hyper-relation을 사용하여

\[
(
Problem,
Catalyst,
Method;
Domain,
Condition,
Evidence,
Time,
ResearchStage
)
\]

를 나타낼 수 있습니다.

그러면 AI Scientist가

> “현재 내가 막힌 이유는 무엇인가?”

를 분석하고

> “같은 domain의 논문을 더 검색한다.”

가 아니라

> “현재 병목은 small-sample causal identification이므로 다른 분야에서 이 구조를 해결한 방법을 찾아본다.”

라는 식으로 retrieval을 할 수 있습니다.

이것은 **Agentic RAG + HRKG + Autonomous AI Scientist**의 매우 좋은 신규 연구접점입니다.

---

# 11. Benchmark 자체도 이제 ‘사다리’보다 **평가 공간**으로 보는 것이 더 적절하다

지난 보고까지는 benchmark 발전을

\[
QA
\rightarrow
Coding
\rightarrow
Reproduction
\rightarrow
Discovery
\rightarrow
Exploration
\]

처럼 선형 단계로 설명할 수 있었습니다.

하지만 최근 연구를 보면 이제 여러 독립 축으로 평가해야 합니다.

\[
\boxed{
Evaluation =
f(
Reality,
Autonomy,
Horizon,
Verification,
Cost,
Taste,
Repeatability,
Provenance
)
}
\]

여기서 **Reality**는 synthetic task에서 실제 peer-reviewed study로, **Autonomy**는 상세 방법 제공에서 problem-only로, **Horizon**은 한 step에서 전체 research campaign으로, **Verification**은 LLM judge에서 numerical/physical/laboratory oracle로 확장됩니다.

여기에 이번 주 새로 명확해진 **Taste**는 “관련 결과를 찾았는가?”가 아니라 “과학적으로 가치 있는 방향을 골랐는가?”이고, **Repeatability**는 한 번 우연히 discovery한 것이 아니라 동일 campaign을 반복했을 때 얼마나 안정적으로 발견하는지를 의미합니다.

이 마지막 두 지표가 향후 매우 중요해질 가능성이 높습니다.

---

# 12. 현재 시점에서 가장 추천하는 신규 연구주제

하나만 고른다면 현재는 다음 방향을 가장 강하게 추천합니다.

> **Catalyst-Aware, Anomaly-Seeking, and Epistemically Accountable Autonomous AI Scientist**

이를 한 줄로 표현하면,

\[
\boxed{
\text{Find what matters}
\rightarrow
\text{Find what is strange}
\rightarrow
\text{Explain why}
\rightarrow
\text{Try to falsify it}
\rightarrow
\text{Prove where it came from}
}
\]

입니다.

전체 architecture는 다음처럼 구성할 수 있습니다.

```text
Research Problem
       │
       ▼
Problem Value / Scientific Taste
       │
       ▼
Catalyst Retrieval
       │
       ├── same-domain evidence
       └── cross-domain analogies
       │
       ▼
Hypothesis Population
       │
       ▼
Experiment / Simulation
       │
       ▼
Scientific Anomaly Judge
       │
    ┌──┴──────────────┐
    ▼                 ▼
Artifact/Error    Genuine Surprise
                       │
                       ▼
               Falsification Test
                       │
                       ▼
             Independent Verifier
                       │
                       ▼
           Discovery Provenance Graph
                       │
                       ▼
                 Belief Revision
                       │
                       └──────────↺
```

이 구조는 기존 AI Scientist가 상대적으로 약하게 다루던 **“무엇이 중요한가?”와 “무엇이 이상한가?”**를 전면에 둔다는 점에서 차별성이 큽니다.

## 최종 판단

이번 주에는 **분명한 의미 있는 변화가 있었습니다.**

특히 가장 중요한 세 가지는 **ScholarCatalyst**, **CompMat-Bench**, 그리고 **AGENT4SC에서 드러난 large-scale scientific-agent systems 연구의 구체화**입니다. ScholarCatalyst는 처음으로 **과학적 영감·연구 촉진 가능성 자체를 retrieval benchmark의 대상으로 만들었고**, CompMat-Bench는 실제 고비용 과학을 **LLM judge 없이 현실적인 비용으로 평가하는 방법**을 보여줬으며, AGENT4SC는 provenance·observability·deterministic control plane·resource scheduling을 AI Scientist의 주변 인프라가 아니라 **핵심 연구문제**로 끌어올렸습니다. [arXiv](https://arxiv.org/abs/2610.02202)

따라서 이전 보고에서 정리했던

\[
\text{Exploration}
\times
\text{Discovery}
\times
\text{Specification}
\times
\text{Verification}
\]

에 이제는 **Scientific Taste**를 반드시 추가하는 것이 좋겠습니다.

\[
\boxed{
\textbf{Scientific Taste}
\times
\textbf{Exploration}
\times
\textbf{Discovery}
\times
\textbf{Verification}
\times
\textbf{Provenance}
\times
\textbf{Systems Reliability}
}
\]

현재 흐름대로라면 다음 세대 Autonomous AI Scientist의 차별점은 **“얼마나 많은 실험을 자동으로 수행하느냐”가 아니라, “어떤 연구가 가치 있는지 찾아내고, 예상 밖의 결과 중 진짜 발견을 구별하며, 그 발견이 어디서 왔고 왜 믿을 수 있는지를 끝까지 증명할 수 있느냐”**가 될 가능성이 가장 높습니다.