AI Research · PINNs · Symbolic Regression · Drug Discovery24 Aug 2026 · Seoul
2025–2026 Research Synthesis/Physics-Informed Neural Networks/Symbolic Regression/AI Co-Scientist

빈칸을 메우는 AI에서
법칙을 쓰는 AI로

Equation-Discovering Physics-Grounded AI Co-Scientists for Drug Discovery

Central thesis

신약개발 AI의 다음 단계는 더 정확한 숫자를 맞히는 데만 있지 않다. 이미 알고 있는 PK/PD·QSP 법칙은 지키면서, 우리가 모르는 약물작용의 빈칸을 데이터로 학습하고, 그 빈칸을 사람이 읽을 수 있는 방정식으로 다시 써내는 데 있다.

Physics-Informed Neural Networks(PINNs)와 Symbolic Regression(SR)은 이 일을 서로 다른 방식으로 나눈다. PINN은 알려진 법칙을 위반하지 않는 연속적인 상태와 hidden dynamics를 복원한다. SR은 그 hidden dynamics를 explicit mathematical law로 압축한다. 멀티에이전트 AI Co-Scientist가 여기에 들어오면 역할이 하나 더 생긴다. 어떤 law가 plausible한지 논쟁하고, 서로 다른 방정식을 구별할 실험을 설계하고, 결과가 틀렸다고 말하면 방정식 자체를 고친다.

Evidence boundary

2026년 8월 현재, 과학특화 멀티모달 파운데이션 모델·멀티에이전트 AI Co-Scientist·PINN·Symbolic Regression을 모두 하나의 end-to-end 신약개발 시스템으로 결합하고 prospective wet-lab까지 검증한 대표 연구는 아직 확립되지 않았다. 이 글의 통합 아키텍처는 2025–2026년 각 분야의 검증된 구성요소를 연결한 연구제안이다.

Part I · Definition & Problem

아는 법칙과 모르는 법칙을 분리한다

PINN은 known mechanism을 보존하고, SR은 unknown mechanism을 explicit equation으로 발견한다. 두 방법을 같은 문제로 뭉개지 않는 것이 출발점이다.

§1 · Physics-Informed Neural Networks

데이터를 맞추는 것만으로는 충분하지 않다

PINN은 관측값과의 오차뿐 아니라 governing equation, conservation law, initial condition, boundary condition의 위반까지 loss에 포함한다.

\[\mathcal L=\lambda_{\mathrm{data}}\mathcal L_{\mathrm{data}}+\lambda_{\mathrm{physics}}\mathcal L_{\mathrm{physics}}+\lambda_{\mathrm{IC}}\mathcal L_{\mathrm{IC}}+\lambda_{\mathrm{BC}}\mathcal L_{\mathrm{BC}}\]

PK compartment model을 예로 들면 neural network가 예측한 \(\hat{\mathbf C}(t)\)가 concentration data에 맞는 것뿐 아니라 다음 ODE residual도 작게 만들어야 한다.

\[\mathcal R(t)=\frac{d\hat{\mathbf C}(t)}{dt}-\mathbf f(\hat{\mathbf C}(t),t,\boldsymbol\eta)\]

신약개발에서 여기서 말하는 “physics”는 문자 그대로 기계역학만 뜻하지 않는다. PK/PBPK, PK/PD, QSP, receptor-binding kinetics, diffusion, mass balance, reaction kinetics, tumor-growth dynamics 등 기전적 수학모델 전체를 포함한다고 보는 편이 정확하다.

§2 · Symbolic Regression

계수만이 아니라 함수의 형태까지 찾는다

일반 regression은 \(y=ax+b\)라는 식을 미리 정하고 \(a,b\)를 찾는다. Symbolic Regression은 함수 형태 \(f\) 자체를 탐색한다.

\[f^*=\arg\min_{f\in\mathcal F}\big[\mathrm{Error}(f)+\lambda\,\mathrm{Complexity}(f)\big]\]

탐색공간에는 \(+,-,\times,\div,\exp,\log,\sqrt{\cdot}\) 같은 연산뿐 아니라 Hill, Michaelis–Menten, saturation term 같은 domain operator를 넣을 수도 있다. 최종 산출물은 neural embedding이 아니라 사람이 읽고 검증할 수 있는 explicit mathematical expression이다.

§3 · Complementarity

PINN은 알려진 법칙을 지키고, SR은 모르는 법칙을 찾는다

Method이미 알고 있는 것찾아야 하는 것핵심 산출물
PINNgoverning equations의 상당 부분hidden state, parameters, 일부 unknown termphysics-consistent neural solution
Symbolic Regressiondata와 일부 domain constraintsfunctional formexplicit interpretable equation
PINN + SRknown physics/mechanismunknown law/mechanismphysics-consistent explicit law

2025년 PINN+SR 연구가 PINN으로 nonlinear PDE solution을 학습한 뒤 PySR로 compact analytical expression을 추출한 것은 이 결합의 직접적인 방법론적 선례다. 대상은 arterial blood flow였지만, neural scientific state → equation distillation이라는 구조는 약동학과 약력학에도 자연스럽게 옮겨갈 수 있다.

§4 · Core problem

신약개발의 진짜 문제는 식의 일부만 알고 있다는 것이다

예를 들어 tumor dynamics가 다음과 같다고 하자.

\[\frac{dT}{dt}=rT-\underbrace{g(C,T)}_{\text{unknown drug action}}\]

tumor growth term은 어느 정도 알고 있지만 drug-action function \(g(C,T)\)는 불확실할 수 있다. 2025년 Universal PINN 연구는 log-kill, Norton–Simon, \(E_{\max}\) 계열 chemotherapy drug-action term과 doxorubicin PD model의 unknown component를 학습하는 문제를 다뤘다.

그러나 neural function \(g_\phi\)를 잘 학습했다고 해서 과학적 법칙을 발견했다고 말하기는 어렵다. 그래서 다음 단계가 필요하다.

\[g_\phi(C,T)\xrightarrow{\mathrm{Symbolic\ Regression}}\frac{E_{\max}C}{EC_{50}+C}T\]

이때 통합문제는 known mechanism + PINN-discovered unknown dynamics + symbolic equation discovery가 된다.

Part II · Introduction & Motivation

2025–2026년, 세 흐름이 한곳으로 모인다

AI Co-Scientist는 실험루프로, PINN은 실제 pharmacology로, SR은 interpretable law discovery로 들어오고 있다.

§5 · Agentic science

AI가 답을 쓰는 것에서 과학적 workflow를 운영하는 것으로 이동한다

Nature의 Co-Scientist는 Generation, Reflection, Ranking, Evolution, Proximity, Meta-review agents를 통해 가설을 만들고 비판하고 진화시킨다. drug repurposing, target discovery, antimicrobial-resistance mechanism을 biomedical validation과 연결했고, 향후 public databases·multimodal data에 대한 직접 reasoning과 laboratory automation의 closed-loop integration을 future direction으로 제시했다.

Robin은 observation → hypothesis → experiment → data analysis → updated hypothesis를 multi-agent workflow로 엮는다. 이 흐름에 PINN과 SR을 더하면 AI가 자연어 hypothesis뿐 아니라 수학적 mechanism hypothesis를 만들고 수정하는 구조로 발전할 수 있다.

§6 · PINN enters pharmacology

기전적 제약이 PK/PD와 compound selection으로 들어간다

2025년 CMINNs 연구는 PINN/fPINN을 PK와 integrated PK–PD에 적용해 absorption, anomalous diffusion, resistance, persistence, tolerance처럼 time-varying dynamics를 모델링했다.

2026년 D-PINN은 논문에 mean±variance로만 공개된 aggregate PK data에서도 population-level parameter distribution을 추정하는 방향을 제시하고 monoclonal-antibody mPBPK 데이터에 적용했다.

더 직접적으로 Sanofi 연구진의 2026년 비교연구는 molecular structure로부터 rat concentration–time profile을 예측하는 CMT-PINN을 평가했다. 논문이 비교한 다섯 방법 중 CMT-PINN은 R²-log 0.854, Spearman 0.933, 관측값의 2-fold 안에 들어간 prediction 65.9%를 보고했다. 여기서 중요한 것은 숫자 하나보다 molecule → mechanistic PK trajectory가 pre-synthesis compound selection과 연결되기 시작했다는 점이다.

§7 · Symbolic law discovery enters drug development

explicit equation이 pharmacokinetics와 virtual screening에 등장한다

2026년 AAPS Journal 연구는 Fc-fusion protein의 구조·물성 descriptor를 symbolic regression으로 PBPK scaling factor의 explicit formula로 변환했다. 독립 validation set에서 평가했으며 전체 model의 median AAFE 1.18을 보고했다.

같은 해 ligand-based virtual screening 연구는 Genetic Programming으로 symbolic fragment-weighting equation을 진화시켜 ChEMBL-derived 15 activity class를 비교했고 14/15 class에서 median EF@1% 향상을 보고했다. SR이 더 이상 “수학식 복원 toy problem”에만 머물지 않고 pharmacology와 screening의 decision rule을 직접 표현하기 시작한 셈이다.

§8 · Why the pieces need each other

Foundation Model, PINN, SR는 각각 혼자서는 부족하다

Foundation Model

molecule·protein·3D·omics의 고차원 패턴을 읽지만 시간적 mechanism equation을 자동으로 제공하지 않는다.

PINN

known mechanism을 지키며 state와 parameter를 추정하지만 unknown neural term은 여전히 black box일 수 있다.

Symbolic Regression

explicit law를 주지만 탐색공간 폭발과 spurious equation, derivative noise에 취약하다.

그래서 가장 자연스러운 조합은 foundation model이 의미 있는 과학변수와 prior를 제안하고, PINN이 sparse/noisy time series를 physics-consistent trajectory로 복원하며, SR이 unknown dynamics를 식으로 쓰고, Co-Scientist가 그 식을 검증·반증하는 구조다.

Part III · Core Concepts

상태를 찾는 일과 법칙을 찾는 일을 구분한다

이 구분을 명확히 해야 PINN의 예측을 mechanism discovery로 과장하지 않고, SR의 식을 scientific law로 섣불리 받아들이지 않을 수 있다.

§9 · Concept map

Equation-Discovering Co-Scientist를 이루는 열두 요소

Concept의미Drug-discovery 역할
Physics / Mechanism PriorPK/PD, QSP, PBPK, diffusion, binding kinetics가능한 solution space 축소
Physics Residualgoverning equation violation비기전적 prediction 억제
Inverse PINN관측값으로 hidden parameter 추정clearance, diffusion, rate constant estimation
Universal PINNunknown equation component를 NN으로 학습미지의 drug-action term discovery
Symbolic Regressionexplicit functional law searchblack box를 equation으로 변환
Physics-Informed SRunit·stoichiometry·physical constraint를 SR에 적용spurious equation 감소
Equation DistillationPINN response를 compact formula로 압축해석성·simulation efficiency
Mechanism Discoverykinetic/pathway law 발견새 biological hypothesis
Uncertainty Quantificationparameter/equation uncertainty과신 억제
Active Experiment Design경쟁식 구분에 최적인 실험 선택실험비용 절감
Multi-Agent Debate여러 mechanism 후보 비교scientific falsification
Belief Revision실험 후 model structure 갱신closed-loop discovery
§10 · State vs law

PINN이 찾는 것과 SR이 찾는 것은 다르다

PINN은 주로 연속적인 state \(\hat x(t)\), hidden state, parameter를 복원한다. Symbolic Regression은 다음의 \(F\)가 무엇인지 찾는다.

\[\frac{dx}{dt}=F(x,u)\]

이 차이를 무시하면 두 가지 과장이 생긴다. trajectory fit이 좋다고 “새 mechanism을 발견했다”고 주장하거나, training range에서 잘 맞는 symbolic equation을 “true law”라고 부르게 된다. AI Co-Scientist는 이 둘 사이를 연결하되 증거수준을 분리해야 한다.

§11 · LLM-assisted SR

언어모델은 법칙의 판사가 아니라 후보를 제안하는 조력자다

2026년 Scientific Reports 연구는 LLM의 domain/context knowledge를 symbolic regression loss와 연결해 dimensional consistency, simplicity, physical realism을 평가하도록 했다. richer domain prompt가 equation reconstruction을 개선했다고 보고했다.

하지만 LLM proposal ≠ physical law다. LLM은 operator·constraint·candidate mechanism을 제안할 수 있지만, 최종 판정은 deterministic unit check, physics residual, independent data, prospective experiment가 맡아야 한다.
Part IV · Challenges & Research Questions

잘못된 법칙을 넣으면 AI는 틀린 세계를 더 잘 학습한다

Physics-informed라는 이름은 정확성을 보증하지 않는다. 가장 중요한 위험은 wrong physics, non-identifiability, spurious equation, circular validation이다.

§12 · Challenges

열두 개의 실패모드

Wrong physics

잘못된 ODE/PDE를 넣으면 PINN은 틀린 law를 성실하게 만족할 수 있다.

Parameter identifiability

서로 다른 parameter set이 같은 PK/PD curve를 만들 수 있다.

Loss imbalance

data·ODE·IC·BC loss의 scale과 convergence 속도가 달라 training을 방해한다.

Stiff / multiscale dynamics

binding→cell→tissue→whole-body 사이의 time scale이 크게 다르다.

Hidden variables

intracellular concentration, target occupancy 등이 측정되지 않는다.

SR search explosion

operator와 변수 수가 늘수록 candidate formula가 기하급수적으로 증가한다.

Spurious equations

training data에 잘 맞지만 mechanism이 틀린 식이 살아남을 수 있다.

Dimensional inconsistency

unit이 맞지 않는 식이 수치적으로는 높은 fit을 낼 수 있다.

Equation uncertainty

여러 mechanism이 비슷한 curve를 설명할 수 있다.

Domain shift

species, scaffold, assay, mutation, disease context가 달라지면 law가 깨질 수 있다.

Agent hallucination

Co-Scientist가 존재하지 않는 mechanism을 physics prior로 제안할 수 있다.

Circular validation

FM→PINN→SR→같은 FM 평가구조가 자기확증을 만들 수 있다.

특히 mechanism recovery는 prediction accuracy와 분리해 평가해야 한다. concentration curve를 잘 맞추었다고 추정한 clearance·distribution·target-mediated process가 유일한 설명이라는 보장은 없기 때문이다.

§13 · Research questions

좋은 논문은 “PINN을 썼다”가 아니라 무엇을 반증할지를 묻는다

multimodal foundation-model-only Co-Scientist보다 PINN-grounded Co-Scientist가 PK/PD OOD generalization과 physical consistency를 향상시키는가?
PINN이 학습한 unknown drug-action term을 SR로 distill했을 때 알려진 Emax, Hill, Michaelis–Menten, log-kill 형태를 얼마나 정확히 recover하는가?
SR를 raw experimental data에 직접 적용하는 것보다 PINN이 denoise/interpolate한 continuous state와 derivative에 적용하는 것이 equation recovery를 개선하는가?
multimodal FM이 molecule/protein/omics를 이용해 compound-specific PINN parameter prior를 제공하면 cold-start prediction이 좋아지는가?
physics-informed SR가 unconstrained SR보다 더 적은 실험으로 true drug mechanism을 복원하는가?
LLM이 제안한 candidate equation을 dimensional, stoichiometric, thermodynamic, pharmacological constraint로 검증하면 hallucinated mechanism을 줄이는가?
Falsifier Agent가 competing symbolic mechanisms를 비교하고 discriminative experiment를 선택하면 실험횟수를 줄이는가?
molecule→structure→binding→cellular PD→PK로 이어지는 multiscale equation discovery가 가능한가?
single best equation 대신 posterior over equations를 유지하는 Bayesian/ensemble SR가 scientific uncertainty를 더 잘 표현하는가?
prospective assay에서 새로 발견한 symbolic law가 기존 QSP/PBPK model보다 예측성과 mechanistic interpretability를 동시에 개선하는가?

특히 강한 조합은 RQ2 + RQ5 + RQ7 + RQ10이다. unknown drug mechanism을 PINN으로 학습하고, physics-informed SR로 equation을 찾고, Falsifier Agent가 경쟁식을 비교하고, active experiment로 prospective validation하는 구조다.

Part V · Approaches & Methods

방정식을 만드는 파이프라인이 아니라, 방정식을 반증하는 시스템을 만든다

추천 구조는 foundation model → mechanism formulation → PINN → physics-informed SR → validator/falsifier → active experiment → equation revision이다.

§14 · Reference architecture

Physics-Grounded Equation-Discovering AI Co-Scientist

Stage 01
Scientific Multimodal Evidence
papers · patents · assays · SMILES · protein sequence/structure · omics · PK/PD time series
Stage 02
Multimodal Foundation Models
MAMMAL · BioMatrix · TxGemma · Boltz-2 and domain-specific encoders
Stage 03
Mechanism Formulation Agent
known states · known equations · unknown terms · units · constraints · priors
Stage 04
Physics-Informed Neural Network
hidden states · parameters · continuous trajectories · unknown neural functions
Stage 05
Physics-Informed Symbolic Regression
candidate equations + complexity + dimensional/stoichiometric/physical constraints
Agent A
Physics Critic
governing equation 자체의 타당성 검토
Agent B
Mechanism / Pharmacology
biological plausibility와 prior literature 점검
Agent C
Falsifier / Ranking
competing equation을 반증 가능한 순서로 정렬
Stage 07
Experiment Designer → Observation → Equation Revision
가설을 가장 잘 구분하는 dose/time/assay를 선택하고 model structure 자체를 업데이트
§15 · Method A

Universal PINN + Symbolic Regression

\[\frac{dx}{dt}=f_{\mathrm{known}}(x,u,\theta)+g_\phi(x,u)\]

known mechanism은 고정하거나 제한적으로 학습하고, unknown term \(g_\phi\)만 neural function으로 둔다. 그 다음 \(g_\phi\rightarrow g_{\mathrm{SR}}\)로 변환한다. 2025년 chemotherapy UPINN 연구가 첫 절반, PINN+SR analytical-expression 연구가 두 번째 절반의 feasibility를 각각 보여준다.

§16 · Method B

Foundation Model → PINN Parameter Prior

\[z=FM(m,p,s),\qquad \theta_{\mathrm{PK/PD}}=g(z)\]

분자·단백질·구조의 multimodal representation을 mechanistic parameter prior로 바꾼다. 새로운 molecule을 합성하기도 전에 molecular structure → PK parameter → concentration–time profile을 예측하는 구조다. CMT-PINN 연구는 이 방향이 초기 compound selection으로 이어질 가능성을 보여준다.

§17 · Method C

PINN as a Scientific Denoiser

SR에서 derivative estimation은 매우 민감하다. sparse noisy observations에서 dx/dt를 직접 계산하면 noise가 증폭된다. PINN으로 continuous differentiable trajectory를 먼저 복원하고 automatic differentiation으로 derivative를 얻은 뒤 SR를 적용할 수 있다.

\[\text{Sparse noisy data}\rightarrow\text{PINN reconstruction}\rightarrow\text{clean derivative}\rightarrow\text{Symbolic Regression}\]
§18 · Method D

Physics-Informed Symbolic Regression

\[\mathcal J(f)=\mathcal L_{\mathrm{data}}+\lambda_c C(f)+\lambda_p P(f)\]

신약개발에서 physics violation term은 unit, mass, stoichiometry, positivity, monotonicity, thermodynamic constraints로 나눌 수 있다. 2026년 PI-ADoK는 physical constraint를 kinetic-model discovery에 삽입해 search space와 experimental demand를 줄이는 방향을 보였다. Stoichiometrically-Informed SR(SISR)은 noisy·sparse chemical time series에서 reaction mechanism, stoichiometry, kinetic expression, rate constant를 함께 복원하는 방향을 제시했다.

§19 · Method E

LLM/FM-Guided Symbolic Regression Agent

Literature/Mechanism Agent는 “concentration=0이면 effect=0”, “effect는 saturation되어야 함”, “dimension은 concentration/time”, “negative concentration 금지” 같은 domain constraints를 제안할 수 있다. 그러나 이 제안은 hard truth가 아니라 search prior다. 2026년 Scientific Reports의 LLM-assisted physics-informed SR는 LLM knowledge를 equation scoring에 포함하는 직접적인 선례를 제공한다.

§20 · Method F

Competing-Equation Tournament

SR가 Emax형, power-law형, exponential-saturation형 같은 서로 다른 후보를 제안하면 Co-Scientist는 fit만 보지 않고 OOD performance, physics consistency, simplicity, identifiability, contradiction을 함께 평가해야 한다.

\[Score(H)=w_1Fit+w_2OOD+w_3Physics+w_4Simplicity+w_5Identifiability-w_6Contradiction\]

그 다음 가장 높은 score의 식을 정답으로 선언하지 않고, 세 식을 가장 잘 구별하는 다음 실험을 찾는다.

\[E^*=\arg\max_E\mathbb E[\mathrm{InformationGain}(H_1,H_2,H_3\mid E)]\]
Part VI · Applications & Open Problems

수학식이 연구의 다음 행동을 바꿀 때 의미가 생긴다

PK/PBPK, drug action, virtual screening, metabolism, signalling, biologics까지 적용 범위를 넓히되, equation identifiability와 context dependence를 중심 위험으로 본다.

§21 · Key applications

신약개발 파이프라인에서 equation discovery가 쓰일 자리

PK / PBPK parameter identification

D-PINN은 aggregate concentration statistics만 있을 때 population parameter distribution을 추정하는 방향을 보였다. SR까지 결합하면 clearance를 molecular weight, charge, hydrophobicity 등의 함수로 표현하는 explicit covariate law를 찾는 문제로 확장된다. Fc-fusion PBPK+SR 연구가 구조·물성 descriptor와 PK scaling factor를 식으로 연결한 직접적인 예다.

Pharmacodynamics / drug-action discovery

기존 QSP의 unknown drug-action term을 UPINN으로 학습하고 SR로 복원하면 “이 response가 Emax형인지 Norton–Simon형인지” 자체가 testable mechanistic hypothesis가 된다.

Hit discovery / virtual screening

SR은 ligand-based screening에서 symbolic weighting rule을 만들 수 있다. 더 발전시키면 Boltz-2 affinity, molecular descriptor, pharmacophore, pocket complementarity를 입력으로 explicit hit-ranking law를 찾을 수 있다.

Drug metabolism / reaction mechanism

SISR류 접근은 time-series concentration에서 hidden reaction network와 kinetic law를 함께 찾는다. 이를 약물대사에 적용하면 Drug → Metabolite₁ → Metabolite₂의 pathway와 rate law를 동시에 discovery하는 문제로 이어진다.

Signalling / mechanistic target validation

2026년 8월 공개된 signalling-dynamics SR preprint는 intracellular signalling의 coarse-grained equation discovery를 다룬다. 아직 peer-reviewed 결과가 아니므로 근거 수준을 구분해야 하지만 target–pathway–phenotype을 dynamical law로 표현하려는 최신 흐름을 보여준다.

Biologics design

Fc-fusion 연구는 protein structure/physicochemical descriptors → symbolic property law → PBPK → PK profile이라는 workflow를 보여준다. BioMatrix/MAMMAL 같은 multimodal FM을 앞단에 결합하면 biologics-design Co-Scientist로 자연스럽게 확장된다.

§22 · Open problems

“좋은 식”과 “참인 법칙” 사이에는 실험이 있다

  1. True equation problem. 생물학에서는 하나의 universal law가 존재하지 않을 수 있다. cell line, mutation, dose, disease state에 따른 context-conditioned symbolic law가 필요할 가능성이 높다.
  2. Equation identifiability. observed range 안에서는 서로 다른 식이 거의 같은 curve를 만들 수 있다. extrapolation·perturbation·intervention으로 구분해야 한다.
  3. Foundation model semantic bottleneck. 수천 차원 embedding을 그대로 SR에 넣으면 식이 해석 불가능해진다. scientifically named latent variable로 압축해야 한다.
  4. Physics misspecification. 잘못된 prior는 PINN을 오히려 왜곡한다. 따라서 “이 ODE 자체가 맞는가”를 검사하는 Physics Critic Agent가 필요하다.
  5. Uncertainty over equations. single best law 대신 posterior 또는 ensemble over competing equations를 유지하는 것이 과학적으로 더 적절하다.
  6. Benchmark 부재. prediction, physics residual, equation recovery, mechanism plausibility, prospective experimental success를 함께 평가하는 benchmark가 없다.
\[\text{Prediction}+\text{Physics}+\text{Equation Recovery}+\text{Mechanism}+\text{Prospective Experiment}\]
Part VII · Future Directions

AI가 이론을 수정하기 시작할 때 Co-Scientist의 의미가 바뀐다

Equation-carrying hypothesis, semantic bottleneck, equation-augmented world model, autonomous theory revision, falsification-driven active science가 다음 연구단계다.

§23 · Equation-carrying hypothesis

자연어 가설에 수학적 law와 반증실험을 붙인다

미래의 Co-Scientist는 “Drug A가 tumor growth를 억제한다”라고만 말해서는 부족하다. 방정식, evidence, alternative equation, uncertainty, counter-evidence, falsification experiment를 함께 반환해야 한다.

\[\frac{dN}{dt}=rN-\frac{E_{\max}C}{EC_{50}+C}N\]

이런 객체를 Equation-Carrying Scientific Hypothesis라고 부를 수 있다. 핵심은 방정식 자체가 검증·교체 가능한 hypothesis라는 점이다.

§24 · Scientific variables before equations

Foundation Model embedding을 바로 SR에 넣지 않는다

\[\text{Representation Learning}\rightarrow\text{Scientific Variable Discovery}\rightarrow\text{Equation Discovery}\]

multimodal FM의 고차원 latent vector를 그대로 식의 변수로 쓰면 해석가능성이 무너진다. Scientific Variable Agent가 kon, koff, CL, Vd, IC50, diffusion coefficient, internalization rate처럼 이름 있는 latent variable을 제안하고 검증한 뒤 SR가 그 관계를 찾는 semantic bottleneck이 필요하다.

§25 · Equation-Augmented Scientific World Model

AI의 기억에 관계뿐 아니라 dynamics를 저장한다

\[W=(G,E,P)\]

여기서 G는 knowledge graph, E는 discovered equations, P는 parameter/distribution이다. “Drug A inhibits Target B”라는 relation뿐 아니라 concentration·time·mutation에 따라 inhibition rate가 어떻게 변하는지라는 dynamics 자체가 memory에 들어간다.

§26 · Autonomous model revision

parameter를 다시 맞추는 것을 넘어 model structure를 바꾼다

실험이 기존 law를 지속적으로 반증하면 agent는 parameter tuning에 머물지 않고 equation form을 바꿔야 한다.

\[H_t:\frac{dC}{dt}=-kC\qquad\Longrightarrow\qquad H_{t+1}:\frac{dC}{dt}=-\frac{V_{\max}C}{K_m+C}\]
\[\text{Parameter Learning}\rightarrow\text{Equation Learning}\rightarrow\text{Theory Revision}\]

이 단계에서 AI Co-Scientist는 기존 방정식의 계산기가 아니라 모델 자체를 수정하는 scientific reasoner에 가까워진다.

§27 · Falsification-driven active science

가장 많은 데이터를 모으는 대신 가장 잘 구분하는 실험을 고른다

\[E^*=\arg\max_E I(H;Y_E)\]

PINN은 후보 law가 예측하는 expected trajectory를 만들고, SR은 competing equations를 제공하며, Experiment Agent는 expected information gain이 가장 큰 dose, time point, assay를 선택한다. 과학적으로 좋은 실험은 데이터를 많이 주는 실험이 아니라 경쟁가설을 가장 명확하게 갈라놓는 실험일 수 있다.

§28 · 2025–2026 literature map

핵심 문헌이 보여주는 수렴

StudyYear핵심 기여본 연구에서의 역할Source
Co-Scientist2026multi-agent hypothesis generation + biomedical validationCo-Scientist backboneNature
Robin2026hypothesis–experiment–analysis–revision loopclosed-loop scienceNature
MAMMAL2026cross-modal biomedical foundation modelmultimodal perceptionnpj Drug Discovery
BioMatrix2026molecule/protein sequence–structure–language FMunified representationarXiv
Boltz-22025structure + affinity foundation modelstructure/affinity specialistbioRxiv
CMINNs2025PINN/fPINN for PK–PD and anomalous dynamicsdrug dynamicsComputers in Biology and Medicine
Learning Chemotherapy Drug Action via UPINNs2025unknown drug-action term learningmechanism discoveryPharmaceutical Research / PubMed
D-PINNs for Population PK2026aggregate mean/variance → parameter distributionsuncertainty-aware PKJPKPD
CMT-PINN2026molecular structure → concentration-time profileearly compound selectionCPT: PSP
Fc-fusion PBPK + SR2026structural properties → symbolic scaling laws → PBPKbiologics PK law discoveryAAPS Journal
PINN + Symbolic Regression2025neural PDE solution → analytical expressionPINN→SR precedentNCA
LLM-assisted Physics-Informed SR2026LLM domain knowledge enters equation scoringCo-Scientist↔SR bridgeScientific Reports
PI-ADoK2026 preprintphysics-constrained kinetic equation discoverylow-data kinetic discoverySSRN
Stoichiometrically-Informed SR2026reaction mechanism + rate constants from time seriesmetabolism/reaction discoveryDigital Discovery
SSA-GP Virtual Screening2026symbolic fragment weighting on ChEMBLhit prioritizationAIMS Medical Science
Symbolic Regression Survey2026physics-informed, hybrid, LLM-assisted SR frontiermethodological roadmapACME

서로 다른 task·dataset·metric을 직접 비교하지 않는다. preprint는 peer-reviewed evidence와 분리해 표기했다. 이 글의 integrated Co-Scientist architecture는 여러 연구의 결과를 종합해 제안한 future research design이다.

§29 · Research proposition

궁극적인 연구질문

Proposed central question

Can a multimodal multi-agent AI Co-Scientist use physics-informed neural networks to infer hidden drug dynamics from sparse experimental data, distill the unknown dynamics into explicit symbolic laws, falsify competing equations, and actively design experiments that revise its mechanistic model?

한국어로 풀면 이렇다. 과학특화 멀티모달 파운데이션 모델이 문헌·분자·단백질·3D 구조·omics를 이해하고, PINN이 알려진 PK/PD·QSP 법칙을 지키면서 관측되지 않은 약물동역학을 추정하며, Symbolic Regression이 hidden dynamics를 사람이 읽고 검증할 수 있는 수학식으로 바꾸고, 멀티에이전트가 경쟁식을 반증하며, 실제 실험을 통해 방정식 자체를 수정할 수 있는가.

\[\textbf{Multimodal FM}\rightarrow\textbf{Mechanism Formulation}\rightarrow\textbf{PINN}\rightarrow\textbf{Physics-Informed SR}\rightarrow\textbf{Falsification}\rightarrow\textbf{Experiment}\rightarrow\textbf{Equation Revision}\]

역할을 한 문장으로 줄이면 더욱 선명하다. Foundation Model은 과학적 세계를 읽고, PINN은 알려진 법칙을 지키며 빈칸을 메우고, Symbolic Regression은 그 빈칸을 방정식으로 쓰고, Multi-Agent Co-Scientist는 서로 다른 방정식을 논쟁하며, 실험은 어느 방정식이 살아남는지를 결정한다.

References

01
Nature · 2026
multi-agent hypothesis generation, critique, ranking, evolution과 biomedical validation을 연결한 대표적 AI Co-Scientist.
02
Nature · 2026
hypothesis–experiment–data-analysis–revision을 연결하는 closed-loop multi-agent scientific workflow.
03
npj Drug Discovery · 2026
molecule, protein/antibody, gene-expression을 cross-modal하게 다루는 biomedical foundation model.
04
arXiv · 2026
molecule/protein sequence–structure–language를 unified representation으로 다루는 biological foundation model.
05
bioRxiv · 2025
biomolecular complex structure와 binding affinity를 연결하는 structure/affinity foundation model.
06
Computers in Biology and Medicine · 2025
PINN/fPINN을 PK·PD, anomalous diffusion, resistance, persistence, tolerance에 적용한 연구.
07
Pharmaceutical Research · 2025
known QSP/PD structure 안에서 unknown drug-action component를 neural function으로 학습하는 연구.
08
JPKPD · 2026
aggregate PK summary statistics에서 population parameter distribution을 추론하는 physics-informed approach.
09
CPT: Pharmacometrics & Systems Pharmacology · 2026
molecular structure에서 rat concentration–time profile을 예측하는 compound-level mechanistic PINN 비교연구.
10
AAPS Journal · 2026
in-silico structural/physicochemical properties에서 PBPK scaling factor의 explicit symbolic laws를 발견.
11
Neural Computing and Applications · 2025
PINN prediction을 PySR로 compact analytical expression으로 distill한 방법론적 선례.
12
Scientific Reports · 2026
LLM domain/context knowledge를 candidate equation의 dimensional consistency, simplicity, physical realism 평가에 통합.
13
Preprint · 2026
physical constraints를 symbolic kinetic-model discovery에 직접 넣어 search space와 실험 요구를 줄이는 접근.
14
Digital Discovery · 2026
time-series concentration data에서 reaction mechanism, stoichiometry, kinetic law, rate constants를 함께 discovery.
15
AIMS Medical Science · 2026
Genetic Programming으로 symbolic fragment-weighting equation을 진화시킨 virtual-screening 연구.
16
Archives of Computational Methods in Engineering · 2026
physics-informed, neural-symbolic, LLM-assisted, human-collaborative SR의 최근 frontier와 open problems를 정리.