가설을 계산하고,
증거로 믿음을 갱신한다
Neuro-Symbolic AI Co-Scientists: Mechanistic World Models and Evidence-Based Belief Revision
GEMOT, 폐루프 hit-to-lead 에이전트, Enchant v3를 명시적 기전모델과 반증 기반 믿음 갱신의 관점에서 연결한다.
게시일: 2026-09-30 · 첨부 조사 기준: 2026-09-30. 원문에 명시된 개별 발표일과 검색 기간은 본문에 보존했다. 논문 결과, 기업 자체 발표, 아직 실행되지 않은 후속 연구 제안을 구분한다. 검색 범위에서 신규 결과가 확인되지 않았다는 판단은 관련 연구 전체의 부재를 의미하지 않는다.
연구 범위와 핵심 질문
2026년 9월 30일 오전 기준으로 bioRxiv·arXiv와 주요 연구기관/기업의 최신 공개분을 다시 확인했다. 이전에 추적한 CELLAUDIT, SHERLOCK, PRAXIS-VirtualCell, T-REX, AnewDDE, SpecOpt, ArticleMiner, SynCraft 등과 중복되지 않으면서 추적할 가치가 큰 신규 항목은 3건이다. 이 가운데 연구적으로 가장 중요한 것은 GEMOT이다. LLM의 암묵적 추론을 명시적인 기전 가설과 수학식으로 변환하고, 가설 생성과 수치 검증을 구조적으로 분리한다는 점에서 지금까지 추적한 연구 중 Neuro-Symbolic AI Co-Scientist에 가장 가까운 구성요소 중 하나이다.
| 우선순위 | 신규 연구/발표 | 공개일 | 핵심 연결축 |
|---|---|---|---|
| A+ | GEMOT: Towards Mechanistic World Models for Biology | 2026-09-28 | Agentic science · 명시적 기전모델 · symbolic equations · competing hypotheses · auditability |
| A | A closed-loop language-model agent for target-specific multi-objective hit-to-lead optimization | 2026-09-24 | Drug Co-Scientist · closed-loop medicinal chemistry · feedback memory · multi-objective optimization |
| A− | Enchant v3: Molecular superintelligence for end-to-end drug R&D | 2026-09-21 | 과학특화 multimodal FM · 16 modalities · uncertainty · automated experimental loop |
GEMOT — Towards Mechanistic World Models for Biology
발표일: 2026년 9월 28일, bioRxiv · Francis Crick Institute. GEMOT은 이번 업데이트에서 가장 중요한 연구이다. 기존 LLM이 biological mechanism을 자연어 설명이나 latent representation 안에 암묵적으로 보유하는 것과 달리, GEMOT은 생물학적 관측에서 latent biological states와 governing equations를 동시에 탐색하여 명시적·모듈식·재사용 가능한 mechanistic model을 구축한다. 연구진은 molecular biology, epidemiology, immune-cell differentiation을 포함한 18개 기존 생물학 문제에서 시스템을 평가했으며, 문제별로 최대 1,755개 측정치, 65개 observable, 170개 experimental condition, 3개 modality를 다뤘다. 자율적으로 구성한 모델은 모든 문제에서 기준 reference model과 동등하거나 더 좋은 fit/parsimony를 보였으며, held-out 조건이 있는 경우 일반화도 평가했다.
Neuro-Symbolic 관점에서 특히 중요한 것은 semantic layer와 numerical evaluator의 분리이다. Semantic layer가 각 scientific hypothesis를 명시적으로 기록하고, Model Context Protocol 기반 계층이 “가설을 제안하는 과정”과 “가설을 실제 데이터로 수치 평가하는 과정”을 분리한다. 따라서 LLM이 “이 가설의 score가 좋다”고 임의로 주장할 수 없고, 실제 계산 계층을 거쳐야 한다. 이는 PRAXIS-VirtualCell의 biological contract나 Genome Skeptic의 deterministic adjudicator보다 더 직접적으로 scientific hypothesis 자체를 machine-readable object로 만든다는 점에서 진전이다.
기존 연구 대비 신규성도 명확한다. SHERLOCK은 이미 정해진 causal representation 안에서 intervention/counterfactual effect를 추정하고, CELLAUDIT은 모델이 주장하는 perturbation dependency를 반증한다. GEMOT은 이보다 한 단계 앞에서 “어떤 상태와 어떤 수학적 관계가 실제 기전을 설명하는가?” 자체를 agent가 탐색한다. 따라서 prediction model이 아니라 mechanism-discovery engine에 가깝다. 저자들은 interventional data에서 여러 competing mechanistic hypotheses를 생성하고, 향후 이들을 구별하는 실험을 설계하는 것을 명시적 목표로 제시한다.
신약개발에서는 Target Validation → Mechanism-of-Action → pathway modeling → resistance mechanism → combination hypothesis → experiment design에 특히 의미가 큽니다. 예를 들어 단순히 “Drug A가 pathway B를 억제한다”는 KG edge 대신, Drug → Target → latent state → signaling dynamics → phenotype을 실제로 시뮬레이션할 수 있는 수학적 기전으로 만들 수 있다. 약물 투여·CRISPR perturbation·time-course omics를 함께 넣으면 서로 다른 MoA hypothesis를 실제 데이터 적합도와 복잡도로 경쟁시킬 수 있다.
가장 강한 연구기회는 GEMOT × Epistemic HRKG × Falsification이다. GEMOT이 생성한 각 mechanistic model을 HRKG에
(Hypothesis H, explains, Phenotype P | equations, latent_states, conditions, evidence, likelihood, complexity, provenance)
형태로 저장하고, 경쟁가설 \(H_1,H_2,H_3\)를 동시에 유지하는 것이다. 이후 prospective wet-lab experiment에서 \(H_1\)만 예측한 결과가 나오지 않으면 supported → weakened → falsified 상태로 바꾸고, 식·parameter·causal edge 중 어떤 부분을 수정해야 하는지 기록하게 할 수 있다. 이것은 지속적으로 추적해 온 formal belief revision과 매우 직접적으로 연결됩니다.
A closed-loop language-model agent for target-specific multi-objective hit-to-lead optimization
발표일: 2026년 9월 24일, bioRxiv. 이 연구는 신약개발 자체에 가장 직접적인 신규 항목이다. Agent가 target과 starting hit → PubMed 문헌검색 → molecular-property 계산 → docking → 이전 round 후보의 점수 기억 → 다음 analogue 설계를 반복하면서 hit-to-lead optimization을 수행한다. 6개 kinase target, 6개 비교방법, campaign당 40개 candidate budget, 방법별 6회 독립 campaign이라는 matched computational benchmark에서 사전에 정의한 composite objective 기준으로 6개 target 중 4개에서 가장 높은 평균 aggregate score를 기록했다.
가장 중요한 점은 단순한 LLM → molecule → docking pipeline이 아니라 이전 후보의 평가결과를 다음 설계 round의 상태로 유지하는 closed-loop memory이다. Ablation 결과에서도 장점은 docking 자체보다는 scored-candidate feedback의 유지와 높은 QED 영역으로의 이동에서 주로 발생했다. 또한 동일 후보집합이라도 drug-likeness-gated docking과 hypervolume 등 평가규칙을 바꾸면 target별 승자가 달라졌다. 이는 Co-Scientist에서 “무엇을 최적화하느냐”라는 symbolic objective definition 자체가 결과를 바꾼다는 중요한 관찰이다.
SpecOpt와 비교하면 SpecOpt가 target/off-target contact difference → minimal edit → constraint gate에 특화됐다면, 이번 연구는 한 starting hit를 여러 medicinal-chemistry objective 아래 반복적으로 개선하는 campaign-level closed loop가 중심이다. AnewDDE가 실제 wet-lab feedback을 포함한다면, 이 연구는 더 엄격한 controlled computational benchmark를 제공한다는 차이가 있다.
신약개발 단계에서는 Hit-to-Lead → Lead Optimization에 직접 대응한다. 다만 저자들이 명확히 밝히듯, 모든 결과는 in silico이며 선정된 후보가 실험적으로 lead라고 검증된 것은 아니다. 따라서 다음 단계는 FEP·합성·biochemical assay·ADME 데이터를 closed loop에 실제로 넣는 것이다.
Neuro-Symbolic 확장에서는 현재의 scalar composite score 대신 objective/constraint graph를 두는 것이 유망한다. 예를 들어 potency, selectivity, permeability, toxicity, synthesis, scaffold preservation을 각각 독립적인 rule node로 만들고, 후보가 실패할 때 “왜 실패했는지”를 HRKG에 남길 수 있다. 그러면 단순 score feedback이 scientific design belief revision으로 바뀝니다.
Iambic Enchant v3 — 과학특화 Multimodal Foundation Model의 중요한 신규 신호
발표일: 2026년 9월 21일 · Iambic Therapeutics 공식 발표. 직전 업데이트에서 빠졌지만 이번 조사의 “과학특화 멀티모달 파운데이션 모델” 축에서 중요도가 높아 이번에 보완한다. Enchant v3는 410억 parameter, 4.5조 token pretraining, 6,000개 이상의 molecular property, 16개 biomedical modality를 다루는 multimodal transformer/Mixture-of-Experts 계열 모델이다. 입력에는 biomedical text, assay, molecular/protein/3D structure, image, multi-omics, biologics, clinical-trial data, pharmacokinetics 등이 포함됩니다. Iambic은 여러 drug-design hypothesis를 병렬 평가하고 uncertainty quantification을 통해 어떤 compound와 어떤 실험에 자원을 배분할지 결정하도록 설계했다고 설명한다.
여기서 중요한 차이는 일반적인 chemistry FM이 아니라 preclinical과 clinical endpoint 사이의 데이터 장벽을 하나의 model family에서 연결하려는 시도라는 점이다. 또한 회사 발표 기준 Enchant는 in-house automated chemistry/biology와 연결되어, 모델이 실험을 prioritization하고 새 실험 데이터가 다시 모델을 개선하는 model → bench → model cycle을 구성한다.
다만 이 항목은 논문이나 독립 benchmark가 아니라 기업의 공식 기술발표이다. 41B 모델의 상세 training corpus, 독립 검증, ablation, calibration 데이터가 충분히 공개된 것은 아니므로, “Neuro-Symbolic Co-Scientist가 구현됐다”고 보기는 어렵다. Knowledge Graph, explicit logic, causal model, formal falsification, belief revision도 공개 구조에는 없다. 따라서 현재 의미는 Co-Scientist의 neural/multimodal foundation layer와 automated experimentation layer가 산업 규모로 결합되고 있다는 신호이다.
가장 유망한 연구기회는 Enchant 같은 multimodal FM을 의사결정권자로 직접 사용하지 않고 GEMOT/HRKG 계층의 evidence generator로 제한하는 것이다. 즉 FM은 structure·omics·assay·clinical evidence를 통합해 후보가설을 생성하지만, 최종 mechanistic belief는 explicit equations, causal constraints, provenance, counter-evidence를 가진 symbolic layer에서만 갱신하도록 하는 구조이다.
종합 전망
이번 업데이트의 핵심은 GEMOT이다. 지금까지는 LLM hypothesis generation, SCM counterfactual reasoning, falsification, deterministic constraint, automated experiment가 각각 따로 진전해 왔다. GEMOT은 여기에 **“가설을 명시적·계산 가능한 mechanistic model로 만드는 계층”**을 추가한다. 따라서 현재 가장 설득력 있는 차세대 신약개발 Neuro-Symbolic AI Co-Scientist 구조는 다음과 같이 좁혀지고 있다.
Multimodal Scientific FM → Evidence/Provenance HRKG → GEMOT-type Competing Mechanistic Models → SCM/Counterfactual Reasoning → Formal Constraints → Agentic Experiment Planning → Computational/Wet-Lab Experiment → CELLAUDIT-type Falsification → HRKG/Equation-level Belief Revision
여전히 최신 공개 연구에서도 이 모든 계층을 하나로 통합하여, 실제 신약개발 wet-lab counter-evidence에 따라 HRKG와 수학적 causal mechanism을 동시에 수정하는 end-to-end 시스템은 확인되지 않았다. 따라서 지금 가장 높은 신규성을 갖는 연구공백은 “Epistemic HRKG + Executable Mechanistic World Model + Falsification-driven Belief Revision”의 통합이라고 판단됩니다.
자료와 출처
구성 자료: Neurosymbolic-AI-Trends-0930.md. 첨부의 모든 연구 항목, 비교, 수치, 표, 수식, 한계와 후속 연구 제안을 수록했다. 대화 시스템의 인용 표시와 알림 문구는 편집 과정에서 제거했다. 본문 링크는 해당 자료로 연결된다.