AI Research Blog·Neuro-Symbolic Drug Co-Scientist2026 · 09 · 16
AI for Science·Drug Discovery·Neuro-Symbolic AI

과학적 믿음은 결과만이 아니라
실행·모델·증거의 계보를 가져야 한다

Provenance-Complete Neuro-Symbolic AI Co-Scientist for Drug Discovery: Action Ledgers, Model Fusion, and Evidence Trust

STRUCTURAL MODELSLITERATURE / KGEPISTEMIC HRKGEXECUTABLE SESSIONDUAL LEDGERSBELIEF REVISIONAlphaFold3 · ProtenixESMFold2 · OpenDDEsource · replication · assaystime · species · contextclaim + qualifiers + trustcode as actionscience as sessionsAction LedgerEvidence Ledgermaintain · weaken · rejectNEW EVIDENCE → TRUST UPDATE → FALSIFICATION → CLAIM-STATE REVISION
Central Update

이번 추적에서 새로 추가할 가치가 큰 연구는 세 건이다. 핵심은 또 하나의 “완성형 Neuro-Symbolic Drug Co-Scientist”가 등장했다는 데 있지 않다. 완성형 시스템에 반드시 필요하지만 서로 따로 존재하던 세 계층—실행 provenance, 다중 구조 파운데이션 모델, evidence trust—이 각각 구체적 연구로 나타났다는 데 의미가 있다.

이전 추적에서 다룬 AutoScreen, ADMET-EvO, HypoKG, AssayLoop, ARCHE, Fluxion, Hakken, Tunsr, AResKGLM과 중복되지 않는 신규 변화라는 점도 중요하다. 이번 업데이트는 “무엇을 발견할 것인가”보다 그 발견이 어떤 모델·실행·증거를 통해 만들어졌는지 끝까지 추적 가능한가라는 질문을 전면에 놓는다.

OpenAI4S는 과학행동의 재현 가능한 실행계보, SoupFold는 복수 구조모델의 상보적 representation, ProLiVis 2.0은 KG evidence의 신뢰도 상태를 각각 구체화한다. 세 축을 결합하면 Neuro-Symbolic Co-Scientist의 belief revision을 자연어 reflection이 아니라 machine-executable evidence update로 설계할 수 있다.Source-grounded synthesis
Part I · §1-§2

세 연구가 채우는 것은 서로 다른 결손이다

과학적 Co-Scientist는 모델의 답, KG의 edge, 실행 로그를 한 덩어리로 취급해서는 안 된다. 어떤 계산을 했는지, 어떤 구조모델을 신뢰했는지, 어떤 evidence가 그 믿음을 지탱하는지를 분리해 관리해야 한다.

§1 · Update Map

장기 실행, 구조 세계모델, evidence trust

연구핵심 계층무엇을 해결하는가Drug Co-Scientist 의미
OpenAI4SPersistent scientific session코드 실행, 환경, artifact, checkpoint의 computational provenanceAction Ledger를 통해 “어떤 실행이 이 결론을 만들었는가”를 역추적한다.
SoupFoldMulti-foundation structural representation단일 구조모델 선택 대신 여러 co-folding model의 representation fusion구조 가설을 meta-foundation layer에서 결합하고 향후 epistemic arbitration으로 확장한다.
ProLiVis 2.0Citation-trust / Epistemic KGKG edge마다 evidence quality와 독립적 replication을 구분edge를 사실로 고정하지 않고 evidence state와 claim state를 업데이트한다.
§2 · Two Ledgers

Action Ledger와 Evidence Ledger는 같은 장부가 아니다

Action Ledger

무엇을 실행했는가. 코드, 파라미터, 모델, 데이터, 실행환경, 생성된 artifact, checkpoint를 추적한다.

Evidence Ledger

그 결과가 어떤 가설을 지지하거나 반박하는가. claim, evidence strength, counter-evidence, epistemic verdict를 관리한다.

Analysis두 ledger를 Epistemic HRKG와 연결하면 belief revision의 이유와 계산경로를 동시에 재현할 수 있다. 어떤 hypothesis가 폐기되었을 때 “모델이 그렇게 판단했다”가 아니라, 그 결론을 만든 코드·파라미터·데이터·실험 결과·문헌 근거까지 다시 따라갈 수 있는 구조다.

Part II · §3-§5

OpenAI4S: 과학을 대화가 아니라 “지속 가능한 세션”으로 기록한다

Code as Action, Science as Sessions. 장기 계산 연구를 중단·재개·branching하더라도 어떤 결과가 어떤 실행에서 나왔는지 보존한다.

§3 · Persistent Research Session

과학행동을 완전한 실행 코드 cell로 남긴다

Source factOpenAI4S: Code as Action, Science as Sessions는 장기 과학연구를 일회성 agent conversation이 아니라 persistent research session으로 정의한다. 과학적 행동은 Python/R의 완전한 실행 코드 cell로 남고, append-only Action Ledger, cell별 execution record, versioned artifact, environment record, workspace checkpoint를 함께 보존한다.

Executable Code Cell ↓ Execution Record ↓ Versioned Artifact + Environment Record ↓ Append-only Action Ledger ↓ Workspace Checkpoint ↓ Pause / Resume / Branch / Reproduce

이 구조의 목적은 수십 단계의 계산 연구에서 “최종 답”만 저장하는 것이 아니다. 결과를 만든 실행과 상태를 시간순으로 보존해 computational provenance를 연구 객체로 만드는 것이다.

§4 · Drug Discovery Contact Point

36개 시나리오에 retrosynthesis부터 binder design까지 포함된다

36
Research Scenarios
reported evaluation set
7.83
Overall Score
OpenAI4S
5.7–6.4
Coding-Agent Harness
reported comparison range
Long-Horizon
Largest Difference
compute-intensive workflows

Source fact평가한 36개 연구 시나리오에는 retrosynthesis, molecular dynamics, protein binder design, protein mutation, catalyst screening이 포함된다. 원 자료는 일반 coding-agent harness의 5.7–6.4점과 비교해 OpenAI4S가 전체 7.83점을 기록했으며, 특히 장기·계산집약 workflow에서 차이가 컸다고 정리한다.

Limitation저자들 스스로 environment specification과 완전 재실행성은 아직 충분하지 않다고 지적한다. 따라서 provenance를 기록하는 구조가 있다는 사실과 완전한 reproducibility가 달성됐다는 주장은 구분해야 한다.

§5 · Relation to Existing Co-Scientist Work

무엇을 믿을지와 어떻게 그 믿음에 도달했는지는 다른 문제다

원 자료는 기존 HypoForge나 ADMET-EvO와 OpenAI4S의 차이를 분명하게 구분한다. ADMET-EvO의 Evidence Ledger가 epistemic verdict를 관리한다면, OpenAI4S의 Action Ledger는 computational provenance를 관리한다.

Analysis신약개발 Co-Scientist에서는 이 두 장부를 분리하는 편이 설계적으로 강하다. 실행의 재현성과 믿음의 정당화를 같은 데이터구조에 억지로 넣지 않고, 연결 가능한 독립 계층으로 유지할 수 있기 때문이다.

Part III · §6-§8

SoupFold: “어느 모델을 쓸까?”를 “어떻게 결합할까?”로 바꾼다

AlphaFold3, Protenix, ESMFold2, OpenDDE 사이의 내부 representation을 연결해 단일 구조 파운데이션 모델 선택의 한계를 넘어선다.

§6 · Representation Fusion

기존 co-folding model을 다시 학습하지 않고 representation을 주입한다

Source factSoupFold: Synthesizing State-of-the-Art Structure Predictions from Soup of Co-folding Models는 AlphaFold3, Protenix, ESMFold2, OpenDDE가 학습한 내부 representation 사이에 간단한 mapping을 학습하고, 추론 시 다른 모델의 representation을 현재 구조예측 모델에 주입한다. 기존 co-folding model 자체를 다시 학습하지 않는 것이 특징이다.

FoldBench의 protein–protein 및 protein–ligand structure prediction에서 여러 모델의 표현을 결합해 state-of-the-art 성능을 보고했다. 첨부 자료는 정확한 수치보다 구조적 의미에 초점을 둔다.

§7 · Structural World Model

단일 구조모델 대신 meta-foundation layer

Analysis실용적 함의는 AlphaFold3류와 OpenDDE류 가운데 어느 하나를 Co-Scientist의 구조모델로 선택하는 문제를 넘어선다는 데 있다. 각 모델이 포착한 상보적 구조 지식을 동시에 사용하는 meta-foundation layer를 설계할 수 있다.

원 자료는 Fluxion과 MutexaGPT와의 역할 차이도 구분한다. Fluxion은 explicit reaction mechanism을 생성하고, MutexaGPT는 과학적 직관을 physics workflow로 바꾸는 반면, SoupFold는 그보다 아래 계층의 구조 세계모델 자체를 multi-model consensus / representation fusion으로 강화한다.

§8 · From Fusion to Epistemic Arbitration

다음 단계는 평균이 아니라 “어느 구조를 믿을 것인가”다

신약개발에서 직접 연결되는 영역은 hit validation, protein–ligand complex prediction, binding-mode hypothesis, protein–protein therapeutic design이다.

model provenance + target-family novelty + confidence + physical constraint + experimental evidence

Inference향후 확장은 단순 representation fusion보다 epistemic model arbitration일 수 있다. AlphaFold3·Protenix·OpenDDE의 예측이 충돌할 때 단순 평균하지 않고 위의 조건을 이용해 현재 hypothesis에 admissible한 구조를 선택하거나 보류하는 Co-Scientist를 설계하는 것이다.

첨부 자료는 이 방향을 “Epistemically Routed Multi-Foundation-Model Co-Scientist”라는 후속 연구주제로 제안한다.

Part IV · §9-§11

ProLiVis 2.0: KG edge를 사실이 아니라 evidence state로 본다

한 논문에서 한 번 보고된 interaction과 여러 독립 연구실에서 반복 검증된 interaction을 같은 edge로 취급하는 biomedical KG의 한계를 citation-trust로 드러낸다.

§9 · Citation-Trust Model

논문 수보다 독립적인 연구실 수가 중요하다

Source factProLiVis 2.0은 기존 BioGRID류 PPI 데이터베이스가 evidence strength가 매우 다른 interaction을 동일한 edge로 저장하는 문제를 지적한다. 각 interaction에 7개 요소로 구성된 citation-trust score를 부여하며, 단순 supporting publication 수만 세지 않고 publication affiliation을 이용해 독립적인 연구실 수를 추정한다.

§10 · BioGRID SARS-CoV-2 Subgraph

Curated edge라는 이유만으로 강한 evidence는 아니다

34,540
Interactions
BioGRID 5.0.260 SARS-CoV-2 subgraph
24,344
Single-Paper Support
reported count
≈70%
Single-Source Share
of interactions
11,320
Remain at 0.2
trust threshold

Source factBioGRID 5.0.260의 SARS-CoV-2 subgraph에서 34,540개 interaction 가운데 24,344개, 약 70%가 단 하나의 논문에만 근거하고 있었다. trust threshold를 0.2로 올리면 11,320개만 남았다.

Analysis이 수치는 “curated KG edge”라는 상태와 “강한 과학적 evidence”를 동일시해서는 안 됨을 보여주는 사례다.

§11 · Epistemic HRKG

Relation보다 qualifier와 claim state가 중요해진다

일반적인 biomedical KG가 Protein A —interacts_with→ Protein B처럼 relation만 보존한다면, Neuro-Symbolic Co-Scientist는 최소한 다음 qualifier를 유지해야 한다.

independent_labs · number_of_assays · assay_types · replication source · time · species · cell_context · counter_evidence

첨부 자료가 제안하는 확장 예시는 다음과 같다.

(A, interacts_with, B, independent_labs=5, assays=3, replication=high, counter_evidence=1, provenance=...)

InferenceProLiVis의 citation-trust 개념을 Epistemic HRKG로 확장하면 edge 자체가 아니라 evidence state를 추론 대상으로 만드는 구조가 가능하다. 새 실험이 기존 interaction을 반박하더라도 relation을 즉시 삭제하지 않고 evidence weight와 claim state를 재계산할 수 있다. 이는 falsification과 belief revision을 정형화하는 데 직접 연결된다.

Part V · §12-§14

통합 방향: Provenance-Complete Neuro-Symbolic AI Co-Scientist

실행 provenance, 구조 모델 arbitration, evidence trust를 하나의 닫힌 scientific reasoning loop로 묶는다. 핵심 산출물은 답이 아니라 유지·약화·폐기 가능한 scientific belief다.

§12 · Integrated Architecture

모델 선택에서 belief revision까지 하나의 증거사슬로 연결한다

Multi-Foundation Structural Models ↓ Epistemic HRKG ↓ Competing Mechanistic Hypotheses ↓ Executable Scientific Session ↓ Action Ledger ↓ Experimental / Computational Evidence ↓ Evidence-Trust Update ↓ Symbolic Falsification ↓ Belief Revision

Analysis이 구조에서 SoupFold류 모델은 구조적 가능성을 넓히고, Epistemic HRKG는 각 claim의 근거와 조건을 표현하며, OpenAI4S류 session은 실험·계산의 실행 provenance를 보존한다. ProLiVis류 trust model은 evidence strength를 업데이트한다. 마지막 단계에서 symbolic falsification이 competing hypothesis를 걸러내고 belief state를 갱신한다.

§13 · Core Research Question

높은 confidence를 고르는 것과 과학적으로 믿을 만한 것을 고르는 것은 다르다

AI Co-Scientist가 단순히 가장 높은 confidence의 모델과 KG edge를 선택하는 것이 아니라, 독립적 replication·모델 간 disagreement·실험 provenance·실행 이력을 함께 고려하여 어떤 scientific belief를 유지·약화·폐기할지를 machine-executable하게 결정할 수 있는가?Research question distilled from the attached update

이 질문은 Neuro-Symbolic AI에서 symbol과 neural representation을 결합하는 것만으로 충분하지 않음을 보여준다. 무엇을 믿는가뿐 아니라 왜 믿는지, 어떤 실행이 그 믿음을 만들었는지, 반증이 들어오면 무엇을 얼마나 바꿀지까지 형식화해야 한다.

§14 · What Changed This Week

세 요소가 각각 독립적인 최신 연구로 구체화됐다

Execution Provenance

OpenAI4S가 persistent session, Action Ledger, execution record, versioned artifact, checkpoint를 구체화했다.

Multi-Model Representation

SoupFold가 구조 파운데이션 모델의 경쟁을 representation fusion과 향후 arbitration 문제로 바꿨다.

Evidence Trust

ProLiVis 2.0이 KG edge의 과학적 신뢰도를 독립 replication과 citation evidence로 계량하는 방향을 보였다.

Inference이 세 층을 통합하면 가장 유망한 다음 연구방향은 “Provenance-Complete Neuro-Symbolic AI Co-Scientist for Drug Discovery”라고 볼 수 있다. 다만 첨부 자료가 강조하듯, 이는 세 논문이 이미 하나의 완성형 시스템을 구현했다는 뜻이 아니라 서로 독립적인 최신 연구결과를 연결해 얻은 통합 설계 가설이다.

References

이번 업데이트의 근거 자료

아래 링크는 첨부 연구노트가 직접 제시한 출처다. 본문은 첨부 자료의 주장과 수치 범위를 보존해 재구성했다.

[01]
OpenAI4S: Code as Action, Science as Sessions
arXiv:2609.15096 · 2026-09-14
persistent research sessions, Action Ledger, execution records, versioned artifacts, workspace checkpoints를 다룬다. arXiv · Cool Papers
[02]
Synthesizing State-of-the-Art Structure Predictions from Soup of Co-folding Models
arXiv:2609.15552 · 2026-09-14
AlphaFold3, Protenix, ESMFold2, OpenDDE 등 co-folding model 사이의 representation fusion을 다룬다. arXiv · Cool Papers · Index
[03]
ProLiVis 2.0: Literature-Centric Visualization of Protein–Protein Interaction Networks, with a Citation-Trust Model for Interaction Evidence
arXiv:2609.15236 · 2026-09-14
PPI edge에 citation-trust score를 부여하고 독립적 연구실 수를 evidence signal로 사용하는 접근을 다룬다. arXiv · Cool Papers