AI Research Blog/Neuro-Symbolic AI Co-ScientistEvidence · Belief · Certification · Experiment · 2026-09-09
Neuro-Symbolic AI × Drug DiscoveryBayesian World ModelsClaim StateFormal Certification

가설을 만드는 AI에서, 증거를 축적하고 믿음을 수정하는 AI로

From Evidence Graphs to Causally Revisable Beliefs: Neuro-Symbolic Co-Scientists for Drug Discovery

Editorial Abstract

이번 업데이트는 완성형 drug-discovery Co-Scientist 하나를 추가한 것이 아니다. 대신 지금까지 비어 있던 네 층—causal world-model discovery, epistemic state management, formal hypothesis certification, multimodal evidence graph—을 실제 알고리즘과 benchmark로 채우는 연구 네 건을 연결한다.

Model Discovery Agent는 LLM을 최종 심판이 아니라 mechanistic model의 창의적 proposer로 제한하고, 실제 belief는 Sequential Monte Carlo 기반 Bayesian posterior로 관리한다. StatefulDiscovery는 claim을 자연어 reflection에 맡기지 않고 외부화된 epistemic state로 관리한다. NxN E-valuation은 LLM이 생성한 가설을 e-value와 Conditional Randomization Test 기반의 통계적 gate에 통과시킨다. SciDocBench와 SciDocIR은 text, equation, figure, table, code, dataset을 provenance를 보존한 typed evidence graph로 묶는다.

Evidence Boundary

이 글은 첨부된 Neurosymbolic-AI-Trends-0909.md 전체를 1차 출처로 사용한다. 네 연구 모두 완성형 신약개발 Neuro-Symbolic AI Co-Scientist는 아니며, 첨부 자료가 제안한 통합 구조와 연구주제는 여러 결과를 연결한 inference이다. 특히 이 전체 폐루프를 하나의 시스템으로 구현해 prospective wet-lab까지 검증한 연구는 자료상 여전히 명확한 공백으로 남아 있다.

MDA
M-open

hypothesis class가 실패하면 predictive check가 새 mechanism 제안을 촉발.

StatefulDiscovery
40 tasks

real-data discovery task에서 structured hypothesis, local adjudication, frontier control을 ablation으로 평가.

SciDocBench
62.6 / 100

가장 강한 시스템도 이 수준에 머물러 evidence grounding과 cross-document reasoning이 병목임을 보임.

SciDocIR
15K + 8K

약 15K SFT sample과 8K RL sample을 typed evidence graph 기반으로 구축.

Part I · Four Missing Layers

Neuro-Symbolic Co-Scientist의 빈칸이 네 개의 알고리즘으로 채워지고 있다

가설 생성과 critic만으로는 부족하다. 증거, 믿음, 검증, 실험선택을 서로 다른 상태와 규칙으로 분리해야 한다.

§1 · The Shift

“가설을 만들고 critic이 평가한다”에서 더 엄격한 과학적 상태기계로

기존 Neuro-Symbolic AI Co-Scientist의 전형적인 그림은 LLM이 가설을 만들고 다른 agent 또는 critic이 평가하는 구조였다. 이번에 추가된 연구들은 이 단순 loop를 훨씬 더 세밀하게 분해한다. evidence는 graph에, claim maturity는 explicit state에, competing mechanism에 대한 믿음은 posterior에, 개별 hypothesis의 통계적 통과 여부는 certification gate에 둔다.

Multimodal Scientific Evidence → Typed Evidence Graph → Epistemic Claim State → Bayesian Mechanistic Model Population → Statistical Certification → Value-of-Information Experiment → Causal / Wet-Lab Falsification → Belief-State Transition

중요한 변화는 모든 것을 자연어 memory 하나에 섞지 않는다는 점이다. evidence storage와 belief state, statistical validity와 mechanistic truth, experiment planning과 claim status를 서로 분리한다.

§2 · Why This Matters in Drug Discovery

신약개발은 조건·근거·기전·반례가 동시에 움직이는 문제다

target validation이나 mechanism-of-action 분석에서는 동일한 claim이라도 assay, dose, cell line, mutation, time point에 따라 의미가 달라진다. 따라서 “무슨 evidence가 있었는가”와 “그 evidence를 바탕으로 어떤 mechanism을 얼마나 믿는가”를 같은 객체로 취급하면 안 된다. 이 분리가 이번 네 연구를 하나의 연구프로그램으로 연결하는 핵심이다.

Part II · Model Discovery Agent

LLM은 mechanism의 proposer이고, 믿음은 Bayesian posterior가 관리한다

2026년 8월 10일 최초 공개, 8월 25일 v4 개정. 이번 재검색에서 가장 중요하게 추가된 연구다.

§3 · LLM as Creative Proposer

LLM에게 “무엇이 참인가”를 맡기지 않는다

Model Discovery Agent(MDA)는 LLM을 새로운 mechanistic model의 후보 구조를 제안하는 창의적 proposer로 제한한다. 실제 belief state는 모델·파라미터·latent variable에 대한 Sequential Monte Carlo 기반 Bayesian posterior로 관리한다. 다음 실험은 posterior uncertainty를 줄이는 Value of Information(VoI)이 가장 큰 intervention을 선택한다.

\[p(M,\theta,z\mid D)\xrightarrow{\text{VoI}}a^*=\arg\max_a\;\mathbb{E}[\text{information gain}\mid a]\]

이 구조의 장점은 가설 생성과 믿음 업데이트를 분리하는 데 있다. LLM의 언어적 확신이 belief probability를 대신하지 않는다.

§4 · M-open Discovery

현재 hypothesis class가 틀렸다면 모델 공간 자체를 확장한다

현재 후보 mechanism들이 관측을 설명하지 못하면 predictive check가 실패를 감지하고 LLM이 새로운 mechanism을 제안한다. 즉 닫힌 후보집합 안에서 순위만 바꾸는 것이 아니라 M-open discovery loop를 사용한다.

Posteriorcompeting mechanistic models
Predictive Checkcurrent class explains data?
ExpandLLM proposes new mechanism
InterveneVoI-optimal experiment

MDA는 물리학뿐 아니라 chemical kineticspartially observed single-neuron electrophysiology에서도 평가되었다.

§5 · Drug-Discovery Translation

Target mechanism validation과 dose-response 설계에 바로 연결된다

첨부 자료는 MDA를 target mechanism validation, mechanism-of-action 규명, pathway perturbation, dose-response/combination assay 설계에 특히 적합한 구조로 본다. 예를 들어 Drug → Target → Pathway → Phenotype에 대한 여러 competing mechanism을 유지하고, CRISPR, inhibitor, dose, combination intervention 가운데 posterior entropy를 가장 크게 줄이는 실험을 선택할 수 있다.

Analysis

EvoSCM이 causal graph 자체의 진화에 더 초점을 둔다면, MDA는 probabilistic belief distribution + hypothesis-space expansion + information-optimal experimentation을 동일한 Bayesian loop에 묶는다. 이 차이가 신약개발 Co-Scientist에서 중요하다.

§6 · Research Opportunity

Epistemic HRKG + Bayesian Mechanistic Model Population

첨부 자료가 제안하는 가장 자연스러운 확장은 HRKG가 assay·dose·cell line·mutation·provenance를 관리하고, MDA가 causal-mechanistic posterior를 관리하도록 역할을 분리하는 것이다. 그러면 “증거 저장”과 “기전 belief”가 혼동되지 않는다.

Part III · StatefulDiscovery

claim은 자유로운 reflection이 아니라 명시적인 epistemic state를 가진다

2026년 6월 10일 최초 공개, 9월 3일 v2. EMNLP 2026 Findings 채택.

§7 · Externalized Investigation State

현재 claim의 evidence maturity가 다음 행동을 결정한다

StatefulDiscovery는 scientific agent가 생성한 claim을 자연어 memory에만 남기지 않고 외부화된 investigation/epistemic state로 관리한다. 이 state가 다음 탐색 frontier, 필요한 evidence acquisition, claim adjudication을 동시에 제어한다.

40개의 real-data discovery task에서 structured hypothesis, local adjudication, frontier control이 각각 성능에 기여함을 ablation으로 확인했다.

§8 · Evidence Gap as an Action Objective

근거가 부족하면 새로운 결론보다 “무엇이 비어 있는가”가 next action이 된다

기존 reflection loop가 “잘못된 답을 다시 생각하라”는 식이라면 StatefulDiscovery는 현재 claim의 evidence maturity가 다음 행동의 목적함수를 바꾼다. evidence가 부족한 상태에서는 새로운 결론을 서둘러 만들기보다 evidence gap 자체를 다음 탐색 대상으로 삼는다.

신약개발에서 좋은 Co-Scientist는 confidence가 높은 문장을 더 잘 쓰는 시스템이 아니라, 어떤 증거가 없어서 아직 claim을 올릴 수 없는지 아는 시스템이어야 한다.
§9 · Claim State Machine

candidate → supported → contradicted → accepted → rejected

예를 들어 Target X is causally relevant to Disease Y라는 claim을 candidate → partially supported → contradicted → provisionally accepted → rejected 같은 explicit state로 관리할 수 있다. 전이 조건은 independent replication, perturbation evidence, assay consistency, counter-evidence 등으로 정의할 수 있다.

Inference

첨부 자료는 이를 HRKG-native Claim State Machine으로 확장하는 연구기회를 제안한다. claim node의 상태전이를 symbolic rule로 정의하고, Epistemic HRKG의 evidence pattern이 충족될 때만 transition을 허용하면 belief revision이 자연어 reflection이 아니라 machine-checkable state transition이 된다.

Part IV · NxN E-valuation

LLM이 만든 가설을 다시 LLM에게 판정시키지 않는다

2026년 8월 6일 최초 공개, 9월 3일 v3. falsification/verification layer를 가장 직접적으로 보완한다.

§10 · Statistical Certification Gate

e-value와 Conditional Randomization Test로 hypothesis를 통과·보류시킨다

NxN E-valuation: Hypothesis Certification via a Conformal CRT Null은 LLM이 가설을 만들고 다시 LLM이 평가하는 circular self-verification과 단순 held-out validation의 약점을 문제로 삼는다. 대신 e-value와 Conditional Randomization Test(CRT)를 이용해 생성 가설을 통계적으로 certification한다.

핵심 아이디어는 충분한 데이터가 있을 때 서로 다른 sample들을 서로의 null 역할로 사용해 case-specific null hypothesis를 일일이 수작업으로 설계하지 않고도 가설을 검증하는 것이다.

§11 · Benchmark vs Gate

TruthInsightBench와 역할이 다르다

TruthInsightBench가 “agent가 falsifiable science를 하는가”를 benchmark 수준에서 평가한다면, NxN E-valuation은 개별 LLM-generated hypothesis를 실제로 통과 또는 보류시킬 수 있는 statistical gate를 제공한다.

신약개발에서는 transcriptomics, proteomics, single-cell, phenotypic screening처럼 sample이 많은 환경에서 특히 의미가 있다. AI가 수천 개의 biomarker, responder subgroup, gene–drug interaction hypothesis를 만들더라도 LLM critic보다 먼저 formal statistical certification layer를 둘 수 있다.

§12 · Important Boundary

통계적 certification은 mechanistic falsification과 같지 않다

NxN의 통계적 null certification을 Popper적 의미의 mechanistic falsification과 동일시하면 안 된다. 통계적 gate를 통과한 가설도 causal intervention 또는 wet-lab falsification이 필요하다.

\[\text{LLM Hypothesis}\rightarrow\text{NxN Statistical Certification}\rightarrow\text{Causal Discrimination}\rightarrow\text{Wet-Lab Falsification}\]
Part V · SciDocBench and SciDocIR

멀티모달 scientific document를 text chunk가 아니라 typed evidence graph로 읽는다

2026년 9월 4일 공개. 과학특화 멀티모달 FM × Knowledge Graph 측면에서 가장 직접적인 신규 연구다.

§13 · Scientific Document Understanding

text, equation, figure, table, code, dataset을 함께 추론한다

SciDocBench는 논문을 단순 text chunk로 보지 않는다. text, equation, figure, table, code, dataset을 함께 추론하면서 supporting evidence의 provenance를 보존하는 능력을 평가한다. benchmark는 124개 expert-authored question, 19개 subtask, 496개 controlled evaluation instance로 구성되며, 가장 강한 시스템도 62.6/100에 머물렀다.

첨부 자료는 이를 document perception, evidence grounding, verification, cross-document reasoning이 여전히 병목이라는 신호로 해석한다.

§14 · SciDocIR

논문의 object·layout·cross-reference·provenance를 보존하는 typed evidence graph

더 중요한 구성요소는 SciDocIR이다. 논문의 object, layout, cross-reference, provenance를 보존하는 typed evidence graph representation을 정의하고, 이를 바탕으로 약 15K SFT sample과 8K RL sample을 구축한다.

Analysis

이 접근은 multimodal scientific document understanding을 VLM의 단순 점수경쟁에서 evidence graph construction problem으로 바꾼다. 어떤 claim을 어느 figure, table, equation, method, source가 지지하는지 구조적으로 보존할 수 있기 때문이다.

§15 · Drug-Discovery Evidence Substrate

PDB 구조·binding table·dose-response curve·omics figure를 같은 provenance graph에 연결한다

신약개발 Co-Scientist에서는 약리논문의 dose-response plot, structural biology figure, assay table, supplementary protocol, numerical result를 독립 modality로 읽고 Claim → Figure/Table/Data → Measurement → Method → Source 구조로 묶은 뒤 Epistemic HRKG로 승격시킬 수 있다.

첨부 자료가 제안하는 핵심 연구기회는 Multimodal Scientific Evidence Graph → Epistemic HRKG pipeline이다. PDB 구조 이미지, binding table, dose-response curve, omics figure, 본문 claim 사이의 cross-modal provenance를 유지하면 text-centric biomedical GraphRAG보다 더 강한 Neuro-Symbolic evidence substrate를 만들 수 있다.

Part VI · The Integrated Closed Loop

증거 graph와 causal posterior가 연결될 때 비로소 “수정 가능한 믿음”이 된다

네 연구의 기능을 겹치지 않게 배치하면 Neuro-Symbolic Co-Scientist의 다음 architecture가 보인다.

§16 · Separation of Responsibilities

Evidence, Claim, Mechanism, Certification, Experiment를 서로 다른 계층으로

LayerRepresentative contributionDrug-discovery role
Multimodal evidence graphSciDocIRassay·figure·table·structure·omics·provenance 보존
Epistemic claim stateStatefulDiscoverycandidate/supported/contradicted/accepted/rejected 상태관리
Mechanistic belief populationMDAcompeting mechanism에 대한 Bayesian posterior와 M-open expansion
Statistical certificationNxN E-valuationLLM-generated hypothesis의 formal pass/hold gate
Experiment selectionMDA VoIposterior uncertainty를 가장 크게 줄이는 perturbation 선택
Causal / wet-lab falsificationOpen research layermechanism을 직접 challenge하고 결과로 belief를 수정
§17 · Proposed Architecture

Statistically Certified, Causally Revisable Neuro-Symbolic Co-Scientist

Multimodal Scientific Evidence → Typed Evidence Graph / Epistemic HRKG → Claim-State Machine → Bayesian Mechanistic Model Population → NxN Statistical Certification → Value-of-Information Experiment Selection → Causal / Wet-Lab Falsification → Claim-State Transition + Posterior Update

이 구조의 핵심은 모든 검증을 하나의 critic score로 환원하지 않는 데 있다. provenance는 graph가 보존하고, evidence maturity는 state machine이 통제하며, mechanism uncertainty는 Bayesian posterior가 관리하고, 통계적 가설은 formal gate를 통과하고, 다음 실험은 information gain으로 선택한다.

§18 · Core Research Question

AI가 증거와 믿음을 분리하고, 반증에 따라 둘을 함께 수정할 수 있는가

AI Co-Scientist가 multimodal biomedical evidence를 provenance-aware graph로 구축하고, competing mechanistic hypotheses에 확률적 belief를 부여하며, 통계적으로 인증된 가설만을 대상으로 가장 판별력 높은 실험을 선택하고, 결과에 따라 claim state와 causal model을 자동 수정하거나 폐기할 수 있는가?

Research question synthesized in the attached update
Part VII · Gap and Research Agenda

아직 남은 가장 큰 공백은 하나의 prospective drug-discovery loop로 닫는 일이다

각 구성요소는 나타났지만, 전체를 한 시스템으로 묶어 실제 wet-lab 결과로 belief를 수정한 prospective demonstration은 자료상 확인되지 않는다.

§19 · What Is Still Missing

네 연구의 합은 아직 하나의 검증된 Co-Scientist가 아니다

첨부 자료는 이 전체 폐루프를 신약개발에서 하나의 시스템으로 구현하고 prospective wet-lab까지 검증한 연구가 여전히 뚜렷한 공백이라고 정리한다. 따라서 네 연구를 연결한 architecture는 강한 연구가설이지만 아직 실증된 end-to-end system은 아니다.

§20 · High-Value Research Program

Statistically Certified, Causally Revisable Neuro-Symbolic Co-Scientist for Drug Discovery

첨부 자료가 특히 강하게 제안하는 신규 연구주제는 “Statistically Certified, Causally Revisable Neuro-Symbolic Co-Scientist for Drug Discovery”이다. 이 주제는 네 축을 동시에 요구한다.

Evidence Substrate

multimodal scientific evidence를 typed graph와 Epistemic HRKG로 구축.

Epistemic Governance

claim state를 explicit transition rule로 관리하고 counter-evidence를 상태전이에 반영.

Mechanistic Uncertainty

competing causal models에 posterior를 부여하고 M-open expansion 허용.

Formal Gate

LLM critic을 대체하거나 보완하는 statistical certification layer.

Information-Optimal Experiment

예측성공률뿐 아니라 competing hypothesis를 가장 잘 구분하는 intervention 선택.

Prospective Revision

wet-lab success와 failure 모두 claim state와 causal posterior를 갱신.

§21 · Key Takeaways

이번 업데이트를 여덟 문장으로 압축하면

01 · Four missing layers

causal world-model discovery, epistemic state management, formal certification, multimodal evidence graph가 구체적 알고리즘으로 추가되었다.

02 · LLM is not the belief state

MDA는 LLM을 proposer로 제한하고 SMC 기반 posterior가 competing mechanism에 대한 믿음을 관리한다.

03 · Evidence gaps drive actions

StatefulDiscovery에서는 claim의 evidence maturity가 다음 탐색과 acquisition을 결정한다.

04 · Certification precedes mechanism

NxN E-valuation은 통계적 gate를 제공하지만 causal/wet-lab falsification을 대체하지 않는다.

05 · Scientific documents become graphs

SciDocIR은 multimodal scientific document를 provenance-aware typed evidence graph로 표현한다.

06 · HRKG has a clearer role

HRKG는 evidence와 context를 관리하고 Bayesian model population은 mechanistic belief를 관리하는 역할분리가 가능하다.

07 · VoI closes the reasoning loop

다음 실험은 가장 높은 점수보다 posterior uncertainty를 가장 많이 줄이는 intervention이어야 한다.

08 · Prospective loop remains open

typed evidence graph → claim state → posterior → certification → VoI → wet-lab falsification → belief revision 전체를 prospective하게 검증하는 것이 다음 핵심 연구기회다.

Source Reference Map

References

첨부 연구동향 문서가 직접 제시한 네 개의 원문 링크를 유지한다.

01
Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
arXiv:2608.09696 · 2026

Sequential Monte Carlo posterior, M-open mechanism discovery, Value-of-Information intervention selection의 핵심 출처.

02
StatefulDiscovery: Evidence-Calibrated Claim Formation in Open-Ended Scientific Discovery
arXiv:2606.11851 · EMNLP 2026 Findings

externalized investigation/epistemic state, structured hypothesis, local adjudication, frontier control의 출처.

03
NxN E-valuation: Hypothesis Certification via a Conformal CRT Null
arXiv:2608.06621 · 2026

e-value와 Conditional Randomization Test를 이용한 LLM-generated hypothesis statistical certification의 출처.

04
SciDocBench: A Workflow-Centered Benchmark and Data Pipeline for Scientific Document Understanding
arXiv:2609.05141 · 4 Sep 2026

124 expert-authored questions, 19 subtasks, 496 controlled instances, SciDocIR typed evidence graph, 15K SFT/8K RL sample의 출처.