Foundation Model
molecule·protein·3D·omics의 고차원 패턴을 읽지만 시간적 mechanism equation을 자동으로 제공하지 않는다.
Equation-Discovering Physics-Grounded AI Co-Scientists for Drug Discovery
신약개발 AI의 다음 단계는 더 정확한 숫자를 맞히는 데만 있지 않다. 이미 알고 있는 PK/PD·QSP 법칙은 지키면서, 우리가 모르는 약물작용의 빈칸을 데이터로 학습하고, 그 빈칸을 사람이 읽을 수 있는 방정식으로 다시 써내는 데 있다.
Physics-Informed Neural Networks(PINNs)와 Symbolic Regression(SR)은 이 일을 서로 다른 방식으로 나눈다. PINN은 알려진 법칙을 위반하지 않는 연속적인 상태와 hidden dynamics를 복원한다. SR은 그 hidden dynamics를 explicit mathematical law로 압축한다. 멀티에이전트 AI Co-Scientist가 여기에 들어오면 역할이 하나 더 생긴다. 어떤 law가 plausible한지 논쟁하고, 서로 다른 방정식을 구별할 실험을 설계하고, 결과가 틀렸다고 말하면 방정식 자체를 고친다.
2026년 8월 현재, 과학특화 멀티모달 파운데이션 모델·멀티에이전트 AI Co-Scientist·PINN·Symbolic Regression을 모두 하나의 end-to-end 신약개발 시스템으로 결합하고 prospective wet-lab까지 검증한 대표 연구는 아직 확립되지 않았다. 이 글의 통합 아키텍처는 2025–2026년 각 분야의 검증된 구성요소를 연결한 연구제안이다.
PINN은 known mechanism을 보존하고, SR은 unknown mechanism을 explicit equation으로 발견한다. 두 방법을 같은 문제로 뭉개지 않는 것이 출발점이다.
PINN은 관측값과의 오차뿐 아니라 governing equation, conservation law, initial condition, boundary condition의 위반까지 loss에 포함한다.
PK compartment model을 예로 들면 neural network가 예측한 \(\hat{\mathbf C}(t)\)가 concentration data에 맞는 것뿐 아니라 다음 ODE residual도 작게 만들어야 한다.
신약개발에서 여기서 말하는 “physics”는 문자 그대로 기계역학만 뜻하지 않는다. PK/PBPK, PK/PD, QSP, receptor-binding kinetics, diffusion, mass balance, reaction kinetics, tumor-growth dynamics 등 기전적 수학모델 전체를 포함한다고 보는 편이 정확하다.
일반 regression은 \(y=ax+b\)라는 식을 미리 정하고 \(a,b\)를 찾는다. Symbolic Regression은 함수 형태 \(f\) 자체를 탐색한다.
탐색공간에는 \(+,-,\times,\div,\exp,\log,\sqrt{\cdot}\) 같은 연산뿐 아니라 Hill, Michaelis–Menten, saturation term 같은 domain operator를 넣을 수도 있다. 최종 산출물은 neural embedding이 아니라 사람이 읽고 검증할 수 있는 explicit mathematical expression이다.
| Method | 이미 알고 있는 것 | 찾아야 하는 것 | 핵심 산출물 |
|---|---|---|---|
| PINN | governing equations의 상당 부분 | hidden state, parameters, 일부 unknown term | physics-consistent neural solution |
| Symbolic Regression | data와 일부 domain constraints | functional form | explicit interpretable equation |
| PINN + SR | known physics/mechanism | unknown law/mechanism | physics-consistent explicit law |
2025년 PINN+SR 연구가 PINN으로 nonlinear PDE solution을 학습한 뒤 PySR로 compact analytical expression을 추출한 것은 이 결합의 직접적인 방법론적 선례다. 대상은 arterial blood flow였지만, neural scientific state → equation distillation이라는 구조는 약동학과 약력학에도 자연스럽게 옮겨갈 수 있다.
예를 들어 tumor dynamics가 다음과 같다고 하자.
tumor growth term은 어느 정도 알고 있지만 drug-action function \(g(C,T)\)는 불확실할 수 있다. 2025년 Universal PINN 연구는 log-kill, Norton–Simon, \(E_{\max}\) 계열 chemotherapy drug-action term과 doxorubicin PD model의 unknown component를 학습하는 문제를 다뤘다.
그러나 neural function \(g_\phi\)를 잘 학습했다고 해서 과학적 법칙을 발견했다고 말하기는 어렵다. 그래서 다음 단계가 필요하다.
이때 통합문제는 known mechanism + PINN-discovered unknown dynamics + symbolic equation discovery가 된다.
AI Co-Scientist는 실험루프로, PINN은 실제 pharmacology로, SR은 interpretable law discovery로 들어오고 있다.
Nature의 Co-Scientist는 Generation, Reflection, Ranking, Evolution, Proximity, Meta-review agents를 통해 가설을 만들고 비판하고 진화시킨다. drug repurposing, target discovery, antimicrobial-resistance mechanism을 biomedical validation과 연결했고, 향후 public databases·multimodal data에 대한 직접 reasoning과 laboratory automation의 closed-loop integration을 future direction으로 제시했다.
Robin은 observation → hypothesis → experiment → data analysis → updated hypothesis를 multi-agent workflow로 엮는다. 이 흐름에 PINN과 SR을 더하면 AI가 자연어 hypothesis뿐 아니라 수학적 mechanism hypothesis를 만들고 수정하는 구조로 발전할 수 있다.
2025년 CMINNs 연구는 PINN/fPINN을 PK와 integrated PK–PD에 적용해 absorption, anomalous diffusion, resistance, persistence, tolerance처럼 time-varying dynamics를 모델링했다.
2026년 D-PINN은 논문에 mean±variance로만 공개된 aggregate PK data에서도 population-level parameter distribution을 추정하는 방향을 제시하고 monoclonal-antibody mPBPK 데이터에 적용했다.
더 직접적으로 Sanofi 연구진의 2026년 비교연구는 molecular structure로부터 rat concentration–time profile을 예측하는 CMT-PINN을 평가했다. 논문이 비교한 다섯 방법 중 CMT-PINN은 R²-log 0.854, Spearman 0.933, 관측값의 2-fold 안에 들어간 prediction 65.9%를 보고했다. 여기서 중요한 것은 숫자 하나보다 molecule → mechanistic PK trajectory가 pre-synthesis compound selection과 연결되기 시작했다는 점이다.
2026년 AAPS Journal 연구는 Fc-fusion protein의 구조·물성 descriptor를 symbolic regression으로 PBPK scaling factor의 explicit formula로 변환했다. 독립 validation set에서 평가했으며 전체 model의 median AAFE 1.18을 보고했다.
같은 해 ligand-based virtual screening 연구는 Genetic Programming으로 symbolic fragment-weighting equation을 진화시켜 ChEMBL-derived 15 activity class를 비교했고 14/15 class에서 median EF@1% 향상을 보고했다. SR이 더 이상 “수학식 복원 toy problem”에만 머물지 않고 pharmacology와 screening의 decision rule을 직접 표현하기 시작한 셈이다.
molecule·protein·3D·omics의 고차원 패턴을 읽지만 시간적 mechanism equation을 자동으로 제공하지 않는다.
known mechanism을 지키며 state와 parameter를 추정하지만 unknown neural term은 여전히 black box일 수 있다.
explicit law를 주지만 탐색공간 폭발과 spurious equation, derivative noise에 취약하다.
그래서 가장 자연스러운 조합은 foundation model이 의미 있는 과학변수와 prior를 제안하고, PINN이 sparse/noisy time series를 physics-consistent trajectory로 복원하며, SR이 unknown dynamics를 식으로 쓰고, Co-Scientist가 그 식을 검증·반증하는 구조다.
이 구분을 명확히 해야 PINN의 예측을 mechanism discovery로 과장하지 않고, SR의 식을 scientific law로 섣불리 받아들이지 않을 수 있다.
| Concept | 의미 | Drug-discovery 역할 |
|---|---|---|
| Physics / Mechanism Prior | PK/PD, QSP, PBPK, diffusion, binding kinetics | 가능한 solution space 축소 |
| Physics Residual | governing equation violation | 비기전적 prediction 억제 |
| Inverse PINN | 관측값으로 hidden parameter 추정 | clearance, diffusion, rate constant estimation |
| Universal PINN | unknown equation component를 NN으로 학습 | 미지의 drug-action term discovery |
| Symbolic Regression | explicit functional law search | black box를 equation으로 변환 |
| Physics-Informed SR | unit·stoichiometry·physical constraint를 SR에 적용 | spurious equation 감소 |
| Equation Distillation | PINN response를 compact formula로 압축 | 해석성·simulation efficiency |
| Mechanism Discovery | kinetic/pathway law 발견 | 새 biological hypothesis |
| Uncertainty Quantification | parameter/equation uncertainty | 과신 억제 |
| Active Experiment Design | 경쟁식 구분에 최적인 실험 선택 | 실험비용 절감 |
| Multi-Agent Debate | 여러 mechanism 후보 비교 | scientific falsification |
| Belief Revision | 실험 후 model structure 갱신 | closed-loop discovery |
PINN은 주로 연속적인 state \(\hat x(t)\), hidden state, parameter를 복원한다. Symbolic Regression은 다음의 \(F\)가 무엇인지 찾는다.
이 차이를 무시하면 두 가지 과장이 생긴다. trajectory fit이 좋다고 “새 mechanism을 발견했다”고 주장하거나, training range에서 잘 맞는 symbolic equation을 “true law”라고 부르게 된다. AI Co-Scientist는 이 둘 사이를 연결하되 증거수준을 분리해야 한다.
2026년 Scientific Reports 연구는 LLM의 domain/context knowledge를 symbolic regression loss와 연결해 dimensional consistency, simplicity, physical realism을 평가하도록 했다. richer domain prompt가 equation reconstruction을 개선했다고 보고했다.
Physics-informed라는 이름은 정확성을 보증하지 않는다. 가장 중요한 위험은 wrong physics, non-identifiability, spurious equation, circular validation이다.
잘못된 ODE/PDE를 넣으면 PINN은 틀린 law를 성실하게 만족할 수 있다.
서로 다른 parameter set이 같은 PK/PD curve를 만들 수 있다.
data·ODE·IC·BC loss의 scale과 convergence 속도가 달라 training을 방해한다.
binding→cell→tissue→whole-body 사이의 time scale이 크게 다르다.
intracellular concentration, target occupancy 등이 측정되지 않는다.
operator와 변수 수가 늘수록 candidate formula가 기하급수적으로 증가한다.
training data에 잘 맞지만 mechanism이 틀린 식이 살아남을 수 있다.
unit이 맞지 않는 식이 수치적으로는 높은 fit을 낼 수 있다.
여러 mechanism이 비슷한 curve를 설명할 수 있다.
species, scaffold, assay, mutation, disease context가 달라지면 law가 깨질 수 있다.
Co-Scientist가 존재하지 않는 mechanism을 physics prior로 제안할 수 있다.
FM→PINN→SR→같은 FM 평가구조가 자기확증을 만들 수 있다.
특히 mechanism recovery는 prediction accuracy와 분리해 평가해야 한다. concentration curve를 잘 맞추었다고 추정한 clearance·distribution·target-mediated process가 유일한 설명이라는 보장은 없기 때문이다.
특히 강한 조합은 RQ2 + RQ5 + RQ7 + RQ10이다. unknown drug mechanism을 PINN으로 학습하고, physics-informed SR로 equation을 찾고, Falsifier Agent가 경쟁식을 비교하고, active experiment로 prospective validation하는 구조다.
추천 구조는 foundation model → mechanism formulation → PINN → physics-informed SR → validator/falsifier → active experiment → equation revision이다.
known mechanism은 고정하거나 제한적으로 학습하고, unknown term \(g_\phi\)만 neural function으로 둔다. 그 다음 \(g_\phi\rightarrow g_{\mathrm{SR}}\)로 변환한다. 2025년 chemotherapy UPINN 연구가 첫 절반, PINN+SR analytical-expression 연구가 두 번째 절반의 feasibility를 각각 보여준다.
분자·단백질·구조의 multimodal representation을 mechanistic parameter prior로 바꾼다. 새로운 molecule을 합성하기도 전에 molecular structure → PK parameter → concentration–time profile을 예측하는 구조다. CMT-PINN 연구는 이 방향이 초기 compound selection으로 이어질 가능성을 보여준다.
SR에서 derivative estimation은 매우 민감하다. sparse noisy observations에서 dx/dt를 직접 계산하면 noise가 증폭된다. PINN으로 continuous differentiable trajectory를 먼저 복원하고 automatic differentiation으로 derivative를 얻은 뒤 SR를 적용할 수 있다.
신약개발에서 physics violation term은 unit, mass, stoichiometry, positivity, monotonicity, thermodynamic constraints로 나눌 수 있다. 2026년 PI-ADoK는 physical constraint를 kinetic-model discovery에 삽입해 search space와 experimental demand를 줄이는 방향을 보였다. Stoichiometrically-Informed SR(SISR)은 noisy·sparse chemical time series에서 reaction mechanism, stoichiometry, kinetic expression, rate constant를 함께 복원하는 방향을 제시했다.
Literature/Mechanism Agent는 “concentration=0이면 effect=0”, “effect는 saturation되어야 함”, “dimension은 concentration/time”, “negative concentration 금지” 같은 domain constraints를 제안할 수 있다. 그러나 이 제안은 hard truth가 아니라 search prior다. 2026년 Scientific Reports의 LLM-assisted physics-informed SR는 LLM knowledge를 equation scoring에 포함하는 직접적인 선례를 제공한다.
SR가 Emax형, power-law형, exponential-saturation형 같은 서로 다른 후보를 제안하면 Co-Scientist는 fit만 보지 않고 OOD performance, physics consistency, simplicity, identifiability, contradiction을 함께 평가해야 한다.
그 다음 가장 높은 score의 식을 정답으로 선언하지 않고, 세 식을 가장 잘 구별하는 다음 실험을 찾는다.
PK/PBPK, drug action, virtual screening, metabolism, signalling, biologics까지 적용 범위를 넓히되, equation identifiability와 context dependence를 중심 위험으로 본다.
D-PINN은 aggregate concentration statistics만 있을 때 population parameter distribution을 추정하는 방향을 보였다. SR까지 결합하면 clearance를 molecular weight, charge, hydrophobicity 등의 함수로 표현하는 explicit covariate law를 찾는 문제로 확장된다. Fc-fusion PBPK+SR 연구가 구조·물성 descriptor와 PK scaling factor를 식으로 연결한 직접적인 예다.
기존 QSP의 unknown drug-action term을 UPINN으로 학습하고 SR로 복원하면 “이 response가 Emax형인지 Norton–Simon형인지” 자체가 testable mechanistic hypothesis가 된다.
SR은 ligand-based screening에서 symbolic weighting rule을 만들 수 있다. 더 발전시키면 Boltz-2 affinity, molecular descriptor, pharmacophore, pocket complementarity를 입력으로 explicit hit-ranking law를 찾을 수 있다.
SISR류 접근은 time-series concentration에서 hidden reaction network와 kinetic law를 함께 찾는다. 이를 약물대사에 적용하면 Drug → Metabolite₁ → Metabolite₂의 pathway와 rate law를 동시에 discovery하는 문제로 이어진다.
2026년 8월 공개된 signalling-dynamics SR preprint는 intracellular signalling의 coarse-grained equation discovery를 다룬다. 아직 peer-reviewed 결과가 아니므로 근거 수준을 구분해야 하지만 target–pathway–phenotype을 dynamical law로 표현하려는 최신 흐름을 보여준다.
Fc-fusion 연구는 protein structure/physicochemical descriptors → symbolic property law → PBPK → PK profile이라는 workflow를 보여준다. BioMatrix/MAMMAL 같은 multimodal FM을 앞단에 결합하면 biologics-design Co-Scientist로 자연스럽게 확장된다.
Equation-carrying hypothesis, semantic bottleneck, equation-augmented world model, autonomous theory revision, falsification-driven active science가 다음 연구단계다.
미래의 Co-Scientist는 “Drug A가 tumor growth를 억제한다”라고만 말해서는 부족하다. 방정식, evidence, alternative equation, uncertainty, counter-evidence, falsification experiment를 함께 반환해야 한다.
이런 객체를 Equation-Carrying Scientific Hypothesis라고 부를 수 있다. 핵심은 방정식 자체가 검증·교체 가능한 hypothesis라는 점이다.
multimodal FM의 고차원 latent vector를 그대로 식의 변수로 쓰면 해석가능성이 무너진다. Scientific Variable Agent가 kon, koff, CL, Vd, IC50, diffusion coefficient, internalization rate처럼 이름 있는 latent variable을 제안하고 검증한 뒤 SR가 그 관계를 찾는 semantic bottleneck이 필요하다.
여기서 G는 knowledge graph, E는 discovered equations, P는 parameter/distribution이다. “Drug A inhibits Target B”라는 relation뿐 아니라 concentration·time·mutation에 따라 inhibition rate가 어떻게 변하는지라는 dynamics 자체가 memory에 들어간다.
실험이 기존 law를 지속적으로 반증하면 agent는 parameter tuning에 머물지 않고 equation form을 바꿔야 한다.
이 단계에서 AI Co-Scientist는 기존 방정식의 계산기가 아니라 모델 자체를 수정하는 scientific reasoner에 가까워진다.
PINN은 후보 law가 예측하는 expected trajectory를 만들고, SR은 competing equations를 제공하며, Experiment Agent는 expected information gain이 가장 큰 dose, time point, assay를 선택한다. 과학적으로 좋은 실험은 데이터를 많이 주는 실험이 아니라 경쟁가설을 가장 명확하게 갈라놓는 실험일 수 있다.
| Study | Year | 핵심 기여 | 본 연구에서의 역할 | Source |
|---|---|---|---|---|
| Co-Scientist | 2026 | multi-agent hypothesis generation + biomedical validation | Co-Scientist backbone | Nature |
| Robin | 2026 | hypothesis–experiment–analysis–revision loop | closed-loop science | Nature |
| MAMMAL | 2026 | cross-modal biomedical foundation model | multimodal perception | npj Drug Discovery |
| BioMatrix | 2026 | molecule/protein sequence–structure–language FM | unified representation | arXiv |
| Boltz-2 | 2025 | structure + affinity foundation model | structure/affinity specialist | bioRxiv |
| CMINNs | 2025 | PINN/fPINN for PK–PD and anomalous dynamics | drug dynamics | Computers in Biology and Medicine |
| Learning Chemotherapy Drug Action via UPINNs | 2025 | unknown drug-action term learning | mechanism discovery | Pharmaceutical Research / PubMed |
| D-PINNs for Population PK | 2026 | aggregate mean/variance → parameter distributions | uncertainty-aware PK | JPKPD |
| CMT-PINN | 2026 | molecular structure → concentration-time profile | early compound selection | CPT: PSP |
| Fc-fusion PBPK + SR | 2026 | structural properties → symbolic scaling laws → PBPK | biologics PK law discovery | AAPS Journal |
| PINN + Symbolic Regression | 2025 | neural PDE solution → analytical expression | PINN→SR precedent | NCA |
| LLM-assisted Physics-Informed SR | 2026 | LLM domain knowledge enters equation scoring | Co-Scientist↔SR bridge | Scientific Reports |
| PI-ADoK | 2026 preprint | physics-constrained kinetic equation discovery | low-data kinetic discovery | SSRN |
| Stoichiometrically-Informed SR | 2026 | reaction mechanism + rate constants from time series | metabolism/reaction discovery | Digital Discovery |
| SSA-GP Virtual Screening | 2026 | symbolic fragment weighting on ChEMBL | hit prioritization | AIMS Medical Science |
| Symbolic Regression Survey | 2026 | physics-informed, hybrid, LLM-assisted SR frontier | methodological roadmap | ACME |
서로 다른 task·dataset·metric을 직접 비교하지 않는다. preprint는 peer-reviewed evidence와 분리해 표기했다. 이 글의 integrated Co-Scientist architecture는 여러 연구의 결과를 종합해 제안한 future research design이다.
Can a multimodal multi-agent AI Co-Scientist use physics-informed neural networks to infer hidden drug dynamics from sparse experimental data, distill the unknown dynamics into explicit symbolic laws, falsify competing equations, and actively design experiments that revise its mechanistic model?
한국어로 풀면 이렇다. 과학특화 멀티모달 파운데이션 모델이 문헌·분자·단백질·3D 구조·omics를 이해하고, PINN이 알려진 PK/PD·QSP 법칙을 지키면서 관측되지 않은 약물동역학을 추정하며, Symbolic Regression이 hidden dynamics를 사람이 읽고 검증할 수 있는 수학식으로 바꾸고, 멀티에이전트가 경쟁식을 반증하며, 실제 실험을 통해 방정식 자체를 수정할 수 있는가.
역할을 한 문장으로 줄이면 더욱 선명하다. Foundation Model은 과학적 세계를 읽고, PINN은 알려진 법칙을 지키며 빈칸을 메우고, Symbolic Regression은 그 빈칸을 방정식으로 쓰고, Multi-Agent Co-Scientist는 서로 다른 방정식을 논쟁하며, 실험은 어느 방정식이 살아남는지를 결정한다.