좋은 점수를 얻은 모델은
무엇을 실제로 배웠는가
Neurosymbolic AI Co-Scientists: Falsification, Campaigns, and Virtual Cells
세포 모델의 입력 의존성을 공격하는 반증 실험, 단백질 설계의 자원 배분, 종을 넘는 세포상태 생성, 실제 합성 자동화. 네 연구의 실증 결과와 연결 가능한 연구 가설을 구분해 읽는다.
이번 업데이트에서 CELLAUDIT은 예측 성능과 기전적 입력 사용이 다를 수 있음을 보인다. T-REX, Speciesformer, PROXINAUT은 각각 전략 제어, virtual cell, 실험 실행의 구성요소다. 반대증거를 근거 그래프의 믿음 수정으로 연결하는 부분은 향후 통합 연구의 제안이다.
원자료 Neurosymbolic-AI-Trends-0925.md의 네 연구, 비교관계, 정량결과, 적용과 한계를 반영했다.
전체 목차
네 연구가 채우는 서로 다른 빈칸
2026년 9월 25일 기준 arXiv·bioRxiv의 최신 공개분을 다시 확인한 결과, 앞선 추적에서 검토한 HypoKG, AssayLoop, HypoEvolve, ScienceBuddy, Andromeda 2, Virtual Biotech, GALILEO, AnewDDE, SpecOpt, ArticleMiner 등과 중복되지 않으면서 추가할 가치가 큰 신규 연구는 4건이다. 이번 업데이트에서는 특히 “generate → score → revise”를 넘어 실제 falsification을 agent loop 안에 넣는 연구, 여러 protein-design 모델을 상황에 맞게 동적으로 선택하는 campaign-level agent, 그리고 virtual-cell 기반 intervention prediction 및 실제 합성 자동화가 동시에 진전했다.
| 신규 연구 | 공개일 | 핵심 연결축 | 중요도 |
|---|---|---|---|
| CELLAUDIT — Discover, Falsify, Revise | 2026-09-23 | falsification · agentic model discovery · perturbation reasoning | 최상 |
| T-REX — Agentic campaign control for de novo binder design | 2026-09-23 | LLM agent · protein design · deterministic constraint/controller | 매우 높음 |
| Speciesformer | 2026-09-23 | generative virtual cell · text↔︎transcriptome · intervention FM | 높음 |
| PROXINAUT | 2026-09-23 | automated synthesis · hit-to-degrader closed workflow | 높음/실험자동화 |
게시 기준일은 첨부 파일의 업데이트 날짜인 2026년 9월 25일이다. 네 연구의 최초 공개일은 9월 23일이며, 모두 사전공개 연구로 읽는다.
CELLAUDIT: 주장한 입력을 정말 쓰는가
예측 성능과 입력 사용의 괴리를 검증 대상으로 삼는다.
발표일: 2026년 9월 23일, arXiv:2609.27234. 이번
추적에서 Neuro-Symbolic AI Co-Scientist 관점으로 가장 중요한
신규 연구이다. 문제의식이 매우 선명하다. Virtual-cell 모델이
drug/compound perturbation을 입력받고 좋은 test score를 내더라도, 실제로
모델이 그 compound 정보를 사용해서 예측했는지는 별개의
문제이다. CELLAUDIT은 이를
입력이 계산 경로에 실제 진입 가능한가 → 예측값이 그 입력 변화에 반응하는가 → 그 의존성이 실제 observed response를 더 잘 설명하는가의
3단계로 감사한다. 근거 ·
원문
실제 BBBC047 morphology–transcriptomics perturbation benchmark에서 agent가 선택한 모델은 held-out Global PCC 0.3153을 얻었지만, compound를 다른 것으로 바꿔도 예측이 사실상 변하지 않았다. compound를 전혀 쓰지 않는 control-profile-only 모델도 0.3142였다. 즉 성능만 보면 “drug-conditioned virtual cell”처럼 보였지만, 사실상 drug identity를 쓰지 않은 모델이었던 셈이다. 48개 후보를 추가 감사했을 때 47개는 compound 교체에 따라 출력이 변했지만, 두 fold 모두에서 실제 target-loss 개선이 유의하게 확인된 것은 20개뿐이었다. 근거 · 원문
가장 중요한 신규성은 falsification 결과를 다시 agent search의
feedback으로 돌린다는 점이다. BBBC047에서 falsification-guided
revision을 적용하면 compound contribution이 양수로 회복되면서
control-only baseline 대비 성능 향상도 유지됐고, sci-Plex에서도
audit-enriched feedback을 준 search trajectory가 compound·dose
contribution을 더 크게 사용하는 방향으로 이동했다. 연구진이 이를 기존
generate → score → revise에서
discover → falsify → revise로의 전환이라고
명시한다. 근거 · 원문
이는 기존 HypoEvolve·ScienceBuddy와 근본적으로 다릅니다. 그 시스템들이 hypothesis/model을 생성하고 평가점수를 기반으로 개선했다면, CELLAUDIT은 “모델이 주장하는 기전적 입력의존성이 실제로 존재하는가?”를 반증 실험으로 공격한다. 신약개발에서는 drug perturbation prediction, mechanism-of-action inference, combination response, virtual cell 기반 candidate prioritization에 직접 중요하다. 단순 test accuracy가 높다는 이유로 “이 compound가 이 cellular response를 일으킨다”고 causal하게 해석하는 오류를 막기 때문이다.
향후 가장 강한 확장은 CELLAUDIT의 falsification result를 Epistemic HRKG의 belief-revision operator로 만드는 것이다. 예를 들어
Compound → causes → GeneProgramChange
이라는 edge에 대해 compound replacement test가 실패하면 edge를 즉시
삭제하지 않고 supported → weakened → falsified로 상태
전환하고, cell type, dose, batch,
assay, model, counter-evidence를
qualifier로 유지하는 것이다. 그러면 모델 audit가 곧 scientific
belief revision으로 이어지는 구조가 된다.
결과 해석 · sci-Plex의 audit-enriched feedback은 평균 기여도가 커지는 방향을 보였으나 논문 초록은 대응 비교의 신뢰구간이 0을 가로지른다고 명시한다. 외부 코호트에서는 dose 사용의 증거는 유지됐지만 compound identity 사용의 증거는 유지되지 않았다. 이는 “조건부 예측에 성공했다”와 “그 조건을 실제로 사용했다”를 나누어 확인해야 함을 보여준다.
T-REX: 설계 캠페인의 선택과 통제
전략 선택과 실행 제약을 분리한 캠페인 제어가 이 연구의 구조적 핵심이다.
발표일: 2026년 9월 23일, bioRxiv 2026.09.22.753604. T-REX(Target-adaptive Rescue–Explore–eXploit)는 개별 protein-design 모델 자체를 새로 만드는 연구가 아니라, 여러 generative protein models와 structure evaluators를 하나의 장기 설계 campaign에서 어떻게 사용할지를 LLM agent가 동적으로 결정한다. 근거 · 원문
핵심은 세 가지 행동이다. 현재 후보가 거의 성공권에 들어오면
Rescue, 특정 generator/configuration에서 좋은 결과가
누적되면 Exploit, 현재 경로가 막히면 다른
model·parameter region을 Explore한다. 중요한 점은 LLM이
마음대로 GPU 작업을 실행하는 것이 아니라, 별도의 deterministic
controller가 agent가 제안한 action을 검증하고 실제 job을
scheduling한다는 것이다. 즉 구조적으로
LLM scientific judgment + machine-checkable execution control이다.
근거
· 원문
이 점이 AnewDDE나 일반 binder-generation pipeline과 다릅니다. 기존 접근은 보통 RFdiffusion·BindCraft·BoltzGen류 중 하나를 미리 정하거나 고정된 ensemble을 사용한다. T-REX는 어떤 모델을 얼마나 오래 사용할 것인지 자체를 누적 evidence에 따라 바꾸는 meta-level scientific decision problem으로 만듭니다. 공개 campaign benchmark에서는 동일한 compute budget에서 여러 generator family와 rescue operation 사이의 자원을 재배분하며, 고정 single-model arm보다 훨씬 많은 구조적으로 유효한 후보를 확보하는 방향을 보여줍니다. 근거 · 원문
신약개발에서는 de novo antibody/miniprotein binder discovery, biologics hit generation, epitope-specific therapeutic design에 직접적이다. 특히 agentic Co-Scientist의 중요한 설계원칙을 하나 제공한다. “LLM은 strategy를 제안하되, 실행가능성과 자원·물리적 조건은 deterministic controller가 보증한다.”
향후 연구기회는 T-REX를 단순 성능·compute 기반 scheduler가 아니라
Epistemic Campaign Manager로 확장하는 것이다. 예를 들어
이 epitope는 flat해서 실패한다,
이 generator는 β-rich interface에서 실패한다 같은 campaign
belief를 HRKG에 명시하고, 실험 SPR/BLI 결과가 들어올 때 generator
preference뿐 아니라 epitope/binding-mode hypothesis 자체를
수정하도록 만드는 것이다.
T-REX는 최초 v1을 기준으로 소개한다. bioRxiv 페이지는 이후 데이터 가용성 정보와 경미한 본문 수정을 담은 v2도 표시한다.
Speciesformer: 개입 이후 세포상태를 그리다
종을 넘는 공통 세포상태와 개입 후 상태 생성을 하나의 모델에 결합한다.
발표일: 2026년 9월 23일, bioRxiv 2026.09.22.752128 · KAUST. Speciesformer는 이번 업데이트에서 과학특화 multimodal/generative foundation model 축으로 가장 중요한 신규 연구이다. 11개 species, 154 tissues, 923개 이상의 cell type, 총 1억 3,100만 cell을 이용해 species-specific gene들을 evolution-informed 공통 표현공간으로 매핑한다. 근거 · 원문
특히 일반 single-cell encoder와 달리 두 방향의 생성을 하나의 architecture에 넣는다. transcriptomic state → biological text description, 그리고 biological semantics/intervention description → post-perturbation transcriptomic state가 모두 가능하다. 초기 cellular state와 intervention description을 주면 기존에 보지 못한 cellular context에서도 post-perturbation transcriptome을 생성하도록 설계됐다. 근거 · 원문
기존 scGPT류와의 차이는 cross-species transfer와 generative intervention modeling의 결합이다. PHAROS가 pretrained perturbation model을 이용해 drug combination을 역탐색했다면, Speciesformer는 그보다 아래 계층에서 “intervention을 가했을 때 cell state가 어떻게 전이되는가”를 공통 evolutionary state space에서 생성적으로 표현한다.
신약개발에서는 preclinical-to-human translation, target validation, perturbation prediction, drug response, toxicity transfer에 잠재력이 큽니다. 예컨대 mouse perturbation data와 human cellular context가 완전히 분리된 공간에 있지 않고 conserved state representation으로 연결된다면, animal-to-human translational reasoning의 foundation layer가 될 수 있다.
그러나 아직 causal model은 아닙니다.
drug X → pathway Y → phenotype Z라는 명시적 SCM도 없고,
generated response가 어떤 mechanism을 통해 만들어졌는지를 formal하게
보증하지도 않는다. 따라서 후속 연구에서는 Speciesformer latent
transition + Causal HRKG를 연결해, 생성된 expression change를
target/pathway/cell-state causal chain으로 분해하고
CELLAUDIT 같은 falsification test를 통과한 transition만 belief graph에
반영하는 것이 매우 유망하다.
PROXINAUT: hit에서 degrader까지
hit 검증에서 SAR와 degrader 제작까지 실험 실행의 병목을 줄인다.
발표일: 2026년 9월 23일, bioRxiv 2026.09.22.753586. 이것은 AI agent 논문이라기보다 신약 Co-Scientist가 실제로 연결될 수 있는 물리적 실험 자동화 계층으로 중요하다. PROXINAUT은 self-encoded library screening과 automated parallel solid-phase synthesis를 연결하여 hit discovery → resynthesis/validation → SAR optimization → bifunctional degrader 제작까지 하나의 자동화 workflow로 만듭니다. 근거 · 원문
BRD4를 대상으로 176,000-member benzimidazole library를 screening해 6개 hit candidate를 얻고, 자동 합성 후 모두 submicromolar binder로 검증했다. 이후 SAR 탐색을 통해 affinity를 약 6배 개선했으며, 전체적으로 70개 이상의 variant를 합성·평가했다. 일부 automated procedure는 16개 합성 단계를 사람의 수동 개입 없이 수행했다. 최종적으로 FBXO31·CRBN을 이용하는 degrader modality까지 확장했다. 근거 · 원문
Andromeda 2와의 차이는 modality에 있다. Andromeda 2가 formulation design을 autonomous lab으로 닫았다면 PROXINAUT은 encoded-library hit를 실제 medicinal-chemistry optimization 및 targeted protein degradation(TPD) molecule로 변환하는 downstream chemistry automation을 닫는다.
현재 PROXINAUT 자체에는 LLM agent, causal reasoning, KG belief
state가 없다. 따라서 가장 흥미로운 연구기회는 이것을 T-REX류 agent의
physical execution backend로 사용하는 것이다.
Co-Scientist가
warhead → linker → E3 ligand → degradation hypothesis를
HRKG로 유지하고, 합성·cell assay 결과가 예상과 어긋나면
binding, ternary-complex,
permeability, E3 recruitment 가설 중 무엇이
실패했는지를 구분해 다음 compound를 설계하게 만드는 방식이다.
수치의 범위 · 첨부는 “70개 이상의 variant”를 총괄 집계한다. 원문이 명시한 단계별 수치는 초기 hit 6개, SAR analogue 26개, CIP 33개다. 정의와 중복 여부가 다른 집계를 단순 합산해 별도의 독립 검증 수치로 해석하지 않는다.
반증에서 믿음 수정으로 이어지는 제안
이번 업데이트에서 가장 중요한 변화는 CELLAUDIT이다.
지금까지 많은 AI Co-Scientist는 “좋은 가설/모델을 생성하고 점수가 낮으면
수정한다”는 구조였지만, CELLAUDIT은 모델이 주장하는 과학적
dependency 자체를 공격하는 반증 절차를 agent loop 안에 넣었다.
이는 사용자가 추적하는
falsifiability → counter-evidence → belief revision에 매우
직접적인 진전이다. 근거 ·
원문
동시에 T-REX는 agent가 전략을 결정하고 deterministic controller가 실행을 제한하는 neuro-symbolic형 orchestration, Speciesformer는 interventional virtual-cell foundation layer, PROXINAUT은 실제 compound synthesis/validation execution layer를 제공한다. 이들을 연결하면 현재 가장 강한 연구구조는 다음과 같다.
Scientific/Virtual-Cell FM → Epistemic HRKG → Competing Mechanistic Hypotheses → Agentic Rescue/Explore/Exploit → Deterministic Scientific Constraints → Computational/Wet-Lab Experiment → CELLAUDIT-style Falsification → Belief Revision → Next Experiment
다만 이번 최신 문헌에서도 HRKG를 명시적인 scientific belief state로 사용하고, 실험 counter-evidence가 들어올 때 AGM/causal-rule 수준의 formal operator로 graph 자체를 수정하는 end-to-end 신약개발 Co-Scientist는 아직 확인되지 않았다. 이제 이 공백은 단순한 개념적 제안이라기보다, CELLAUDIT·T-REX·Speciesformer·PROXINAUT처럼 필요한 개별 구성요소가 실제 시스템으로 등장하면서 구현 가능한 통합 연구문제로 빠르게 바뀌고 있다.
통합안의 지위 · 이 흐름은 네 시스템을 한 제품에서 검증한 결과가 아니라, 첨부 브리핑이 도출한 설계 가설이다. HRKG의 명시적 belief state와 AGM/causal-rule 수준의 수정 연산자가 연결된 end-to-end 실증은 이 네 원문에서 제시되지 않았다.
원문 자료
- Li et al., Discover, Falsify, Revise: Auditing Input-Use Claims from Source Code to Predictive Contribution in Agent-Discovered Cell ModelsarXiv:2609.27234 v1, 2026-09-23 · CELLAUDIT.
- Jeon et al., Agentic campaign control for high-throughput de novo binder designbioRxiv:2026.09.22.753604 · T-REX. 후속 v2는 데이터 가용성과 경미한 본문 수정.
- Speciesformer learns conserved cellular states for cross-species generative virtual cell modelingbioRxiv:2026.09.22.752128 · Speciesformer.
- PROXINAUT: An Automation Platform for Rapid Hit-to-Degrader DiscoverybioRxiv:2026.09.22.753586 · 합성·검증 자동화.