SUNGSOO'S AI BLOGNEUROSYMBOLIC AI · 2026.09.25
AI CO-SCIENTIST · FALSIFICATION · DRUG DISCOVERY

좋은 점수를 얻은 모델은
무엇을 실제로 배웠는가

Neurosymbolic AI Co-Scientists: Falsification, Campaigns, and Virtual Cells

세포 모델의 입력 의존성을 공격하는 반증 실험, 단백질 설계의 자원 배분, 종을 넘는 세포상태 생성, 실제 합성 자동화. 네 연구의 실증 결과와 연결 가능한 연구 가설을 구분해 읽는다.

BRIEFING UPDATE & PUBLICATION DATE · 2026-09-25

과학 모델, 반증, 제어, 물리 실험과 믿음 수정의 관계Virtual-cell 예측과 단백질 설계에서 반증 및 결정론적 제어를 거쳐 합성·검증하고, 반대증거로 근거 그래프를 수정하는 제안적 폐루프이다. 각 논문의 통합 실증 결과를 뜻하지 않는다.01 / PREDICT02 / FALSIFY03 / CONTROL04 / EXECUTEVirtual cellCELLAUDITT-REXPROXINAUTSpeciesformer입력 의존성 검사선택 · 실행 제약합성 · 검증반대증거 → Epistemic HRKG 믿음 수정 → 다음 실험From score feedback to falsifiable science
네 논문에서 얻은 요소를 연결한 연구 제안 개념도. 통합 구현의 실험 결과는 아니다.
EDITORIAL ABSTRACT

이번 업데이트에서 CELLAUDIT은 예측 성능과 기전적 입력 사용이 다를 수 있음을 보인다. T-REX, Speciesformer, PROXINAUT은 각각 전략 제어, virtual cell, 실험 실행의 구성요소다. 반대증거를 근거 그래프의 믿음 수정으로 연결하는 부분은 향후 통합 연구의 제안이다.

원자료 Neurosymbolic-AI-Trends-0925.md의 네 연구, 비교관계, 정량결과, 적용과 한계를 반영했다.

전체 목차
  1. 네 연구가 채우는 서로 다른 빈칸
  2. CELLAUDIT: 주장한 입력을 정말 쓰는가
  3. T-REX: 설계 캠페인의 선택과 통제
  4. Speciesformer: 개입 이후 세포상태를 그리다
  5. PROXINAUT: hit에서 degrader까지
  6. 반증에서 믿음 수정으로 이어지는 제안
PART 01 / RESEARCH MAP

네 연구가 채우는 서로 다른 빈칸

반증CELLAUDIT
캠페인T-REX
세포상태Speciesformer
합성PROXINAUT

2026년 9월 25일 기준 arXiv·bioRxiv의 최신 공개분을 다시 확인한 결과, 앞선 추적에서 검토한 HypoKG, AssayLoop, HypoEvolve, ScienceBuddy, Andromeda 2, Virtual Biotech, GALILEO, AnewDDE, SpecOpt, ArticleMiner 등과 중복되지 않으면서 추가할 가치가 큰 신규 연구는 4건이다. 이번 업데이트에서는 특히 “generate → score → revise”를 넘어 실제 falsification을 agent loop 안에 넣는 연구, 여러 protein-design 모델을 상황에 맞게 동적으로 선택하는 campaign-level agent, 그리고 virtual-cell 기반 intervention prediction 및 실제 합성 자동화가 동시에 진전했다.

신규 연구 공개일 핵심 연결축 중요도
CELLAUDIT — Discover, Falsify, Revise 2026-09-23 falsification · agentic model discovery · perturbation reasoning 최상
T-REX — Agentic campaign control for de novo binder design 2026-09-23 LLM agent · protein design · deterministic constraint/controller 매우 높음
Speciesformer 2026-09-23 generative virtual cell · text↔︎transcriptome · intervention FM 높음
PROXINAUT 2026-09-23 automated synthesis · hit-to-degrader closed workflow 높음/실험자동화

게시 기준일은 첨부 파일의 업데이트 날짜인 2026년 9월 25일이다. 네 연구의 최초 공개일은 9월 23일이며, 모두 사전공개 연구로 읽는다.

PART 02 / DISCOVER → FALSIFY → REVISE

CELLAUDIT: 주장한 입력을 정말 쓰는가

예측 성능과 입력 사용의 괴리를 검증 대상으로 삼는다.

발표일: 2026년 9월 23일, arXiv:2609.27234. 이번 추적에서 Neuro-Symbolic AI Co-Scientist 관점으로 가장 중요한 신규 연구이다. 문제의식이 매우 선명하다. Virtual-cell 모델이 drug/compound perturbation을 입력받고 좋은 test score를 내더라도, 실제로 모델이 그 compound 정보를 사용해서 예측했는지는 별개의 문제이다. CELLAUDIT은 이를 입력이 계산 경로에 실제 진입 가능한가 → 예측값이 그 입력 변화에 반응하는가 → 그 의존성이 실제 observed response를 더 잘 설명하는가의 3단계로 감사한다. 근거 · 원문

실제 BBBC047 morphology–transcriptomics perturbation benchmark에서 agent가 선택한 모델은 held-out Global PCC 0.3153을 얻었지만, compound를 다른 것으로 바꿔도 예측이 사실상 변하지 않았다. compound를 전혀 쓰지 않는 control-profile-only 모델도 0.3142였다. 즉 성능만 보면 “drug-conditioned virtual cell”처럼 보였지만, 사실상 drug identity를 쓰지 않은 모델이었던 셈이다. 48개 후보를 추가 감사했을 때 47개는 compound 교체에 따라 출력이 변했지만, 두 fold 모두에서 실제 target-loss 개선이 유의하게 확인된 것은 20개뿐이었다. 근거 · 원문

가장 중요한 신규성은 falsification 결과를 다시 agent search의 feedback으로 돌린다는 점이다. BBBC047에서 falsification-guided revision을 적용하면 compound contribution이 양수로 회복되면서 control-only baseline 대비 성능 향상도 유지됐고, sci-Plex에서도 audit-enriched feedback을 준 search trajectory가 compound·dose contribution을 더 크게 사용하는 방향으로 이동했다. 연구진이 이를 기존 generate → score → revise에서 discover → falsify → revise로의 전환이라고 명시한다. 근거 · 원문

이는 기존 HypoEvolve·ScienceBuddy와 근본적으로 다릅니다. 그 시스템들이 hypothesis/model을 생성하고 평가점수를 기반으로 개선했다면, CELLAUDIT은 “모델이 주장하는 기전적 입력의존성이 실제로 존재하는가?”를 반증 실험으로 공격한다. 신약개발에서는 drug perturbation prediction, mechanism-of-action inference, combination response, virtual cell 기반 candidate prioritization에 직접 중요하다. 단순 test accuracy가 높다는 이유로 “이 compound가 이 cellular response를 일으킨다”고 causal하게 해석하는 오류를 막기 때문이다.

향후 가장 강한 확장은 CELLAUDIT의 falsification result를 Epistemic HRKG의 belief-revision operator로 만드는 것이다. 예를 들어

Compound → causes → GeneProgramChange

이라는 edge에 대해 compound replacement test가 실패하면 edge를 즉시 삭제하지 않고 supported → weakened → falsified로 상태 전환하고, cell type, dose, batch, assay, model, counter-evidence를 qualifier로 유지하는 것이다. 그러면 모델 audit가 곧 scientific belief revision으로 이어지는 구조가 된다.

CELLAUDIT arXiv 원문

결과 해석 · sci-Plex의 audit-enriched feedback은 평균 기여도가 커지는 방향을 보였으나 논문 초록은 대응 비교의 신뢰구간이 0을 가로지른다고 명시한다. 외부 코호트에서는 dose 사용의 증거는 유지됐지만 compound identity 사용의 증거는 유지되지 않았다. 이는 “조건부 예측에 성공했다”와 “그 조건을 실제로 사용했다”를 나누어 확인해야 함을 보여준다.

PART 03 / RESCUE · EXPLORE · EXPLOIT

T-REX: 설계 캠페인의 선택과 통제

전략 선택과 실행 제약을 분리한 캠페인 제어가 이 연구의 구조적 핵심이다.

발표일: 2026년 9월 23일, bioRxiv 2026.09.22.753604. T-REX(Target-adaptive Rescue–Explore–eXploit)는 개별 protein-design 모델 자체를 새로 만드는 연구가 아니라, 여러 generative protein models와 structure evaluators를 하나의 장기 설계 campaign에서 어떻게 사용할지를 LLM agent가 동적으로 결정한다. 근거 · 원문

핵심은 세 가지 행동이다. 현재 후보가 거의 성공권에 들어오면 Rescue, 특정 generator/configuration에서 좋은 결과가 누적되면 Exploit, 현재 경로가 막히면 다른 model·parameter region을 Explore한다. 중요한 점은 LLM이 마음대로 GPU 작업을 실행하는 것이 아니라, 별도의 deterministic controller가 agent가 제안한 action을 검증하고 실제 job을 scheduling한다는 것이다. 즉 구조적으로 LLM scientific judgment + machine-checkable execution control이다. 근거 · 원문

이 점이 AnewDDE나 일반 binder-generation pipeline과 다릅니다. 기존 접근은 보통 RFdiffusion·BindCraft·BoltzGen류 중 하나를 미리 정하거나 고정된 ensemble을 사용한다. T-REX는 어떤 모델을 얼마나 오래 사용할 것인지 자체를 누적 evidence에 따라 바꾸는 meta-level scientific decision problem으로 만듭니다. 공개 campaign benchmark에서는 동일한 compute budget에서 여러 generator family와 rescue operation 사이의 자원을 재배분하며, 고정 single-model arm보다 훨씬 많은 구조적으로 유효한 후보를 확보하는 방향을 보여줍니다. 근거 · 원문

신약개발에서는 de novo antibody/miniprotein binder discovery, biologics hit generation, epitope-specific therapeutic design에 직접적이다. 특히 agentic Co-Scientist의 중요한 설계원칙을 하나 제공한다. “LLM은 strategy를 제안하되, 실행가능성과 자원·물리적 조건은 deterministic controller가 보증한다.”

향후 연구기회는 T-REX를 단순 성능·compute 기반 scheduler가 아니라 Epistemic Campaign Manager로 확장하는 것이다. 예를 들어 이 epitope는 flat해서 실패한다, 이 generator는 β-rich interface에서 실패한다 같은 campaign belief를 HRKG에 명시하고, 실험 SPR/BLI 결과가 들어올 때 generator preference뿐 아니라 epitope/binding-mode hypothesis 자체를 수정하도록 만드는 것이다.

T-REX bioRxiv 원문

T-REX는 최초 v1을 기준으로 소개한다. bioRxiv 페이지는 이후 데이터 가용성 정보와 경미한 본문 수정을 담은 v2도 표시한다.

PART 04 / CROSS-SPECIES VIRTUAL CELL

Speciesformer: 개입 이후 세포상태를 그리다

종을 넘는 공통 세포상태와 개입 후 상태 생성을 하나의 모델에 결합한다.

발표일: 2026년 9월 23일, bioRxiv 2026.09.22.752128 · KAUST. Speciesformer는 이번 업데이트에서 과학특화 multimodal/generative foundation model 축으로 가장 중요한 신규 연구이다. 11개 species, 154 tissues, 923개 이상의 cell type, 총 1억 3,100만 cell을 이용해 species-specific gene들을 evolution-informed 공통 표현공간으로 매핑한다. 근거 · 원문

특히 일반 single-cell encoder와 달리 두 방향의 생성을 하나의 architecture에 넣는다. transcriptomic state → biological text description, 그리고 biological semantics/intervention description → post-perturbation transcriptomic state가 모두 가능하다. 초기 cellular state와 intervention description을 주면 기존에 보지 못한 cellular context에서도 post-perturbation transcriptome을 생성하도록 설계됐다. 근거 · 원문

기존 scGPT류와의 차이는 cross-species transfer와 generative intervention modeling의 결합이다. PHAROS가 pretrained perturbation model을 이용해 drug combination을 역탐색했다면, Speciesformer는 그보다 아래 계층에서 “intervention을 가했을 때 cell state가 어떻게 전이되는가”를 공통 evolutionary state space에서 생성적으로 표현한다.

신약개발에서는 preclinical-to-human translation, target validation, perturbation prediction, drug response, toxicity transfer에 잠재력이 큽니다. 예컨대 mouse perturbation data와 human cellular context가 완전히 분리된 공간에 있지 않고 conserved state representation으로 연결된다면, animal-to-human translational reasoning의 foundation layer가 될 수 있다.

그러나 아직 causal model은 아닙니다. drug X → pathway Y → phenotype Z라는 명시적 SCM도 없고, generated response가 어떤 mechanism을 통해 만들어졌는지를 formal하게 보증하지도 않는다. 따라서 후속 연구에서는 Speciesformer latent transition + Causal HRKG를 연결해, 생성된 expression change를 target/pathway/cell-state causal chain으로 분해하고 CELLAUDIT 같은 falsification test를 통과한 transition만 belief graph에 반영하는 것이 매우 유망하다.

Speciesformer bioRxiv 원문

PART 05 / AUTOMATED MEDICINAL CHEMISTRY

PROXINAUT: hit에서 degrader까지

hit 검증에서 SAR와 degrader 제작까지 실험 실행의 병목을 줄인다.

발표일: 2026년 9월 23일, bioRxiv 2026.09.22.753586. 이것은 AI agent 논문이라기보다 신약 Co-Scientist가 실제로 연결될 수 있는 물리적 실험 자동화 계층으로 중요하다. PROXINAUT은 self-encoded library screening과 automated parallel solid-phase synthesis를 연결하여 hit discovery → resynthesis/validation → SAR optimization → bifunctional degrader 제작까지 하나의 자동화 workflow로 만듭니다. 근거 · 원문

BRD4를 대상으로 176,000-member benzimidazole library를 screening해 6개 hit candidate를 얻고, 자동 합성 후 모두 submicromolar binder로 검증했다. 이후 SAR 탐색을 통해 affinity를 약 6배 개선했으며, 전체적으로 70개 이상의 variant를 합성·평가했다. 일부 automated procedure는 16개 합성 단계를 사람의 수동 개입 없이 수행했다. 최종적으로 FBXO31·CRBN을 이용하는 degrader modality까지 확장했다. 근거 · 원문

Andromeda 2와의 차이는 modality에 있다. Andromeda 2가 formulation design을 autonomous lab으로 닫았다면 PROXINAUT은 encoded-library hit를 실제 medicinal-chemistry optimization 및 targeted protein degradation(TPD) molecule로 변환하는 downstream chemistry automation을 닫는다.

현재 PROXINAUT 자체에는 LLM agent, causal reasoning, KG belief state가 없다. 따라서 가장 흥미로운 연구기회는 이것을 T-REX류 agent의 physical execution backend로 사용하는 것이다. Co-Scientist가 warhead → linker → E3 ligand → degradation hypothesis를 HRKG로 유지하고, 합성·cell assay 결과가 예상과 어긋나면 binding, ternary-complex, permeability, E3 recruitment 가설 중 무엇이 실패했는지를 구분해 다음 compound를 설계하게 만드는 방식이다.

PROXINAUT bioRxiv 원문

수치의 범위 · 첨부는 “70개 이상의 variant”를 총괄 집계한다. 원문이 명시한 단계별 수치는 초기 hit 6개, SAR analogue 26개, CIP 33개다. 정의와 중복 여부가 다른 집계를 단순 합산해 별도의 독립 검증 수치로 해석하지 않는다.

PART 06 / EPISTEMIC HRKG · SYNTHESIS

반증에서 믿음 수정으로 이어지는 제안

이번 업데이트에서 가장 중요한 변화는 CELLAUDIT이다. 지금까지 많은 AI Co-Scientist는 “좋은 가설/모델을 생성하고 점수가 낮으면 수정한다”는 구조였지만, CELLAUDIT은 모델이 주장하는 과학적 dependency 자체를 공격하는 반증 절차를 agent loop 안에 넣었다. 이는 사용자가 추적하는 falsifiability → counter-evidence → belief revision에 매우 직접적인 진전이다. 근거 · 원문

동시에 T-REX는 agent가 전략을 결정하고 deterministic controller가 실행을 제한하는 neuro-symbolic형 orchestration, Speciesformer는 interventional virtual-cell foundation layer, PROXINAUT은 실제 compound synthesis/validation execution layer를 제공한다. 이들을 연결하면 현재 가장 강한 연구구조는 다음과 같다.

Scientific/Virtual-Cell FM → Epistemic HRKG → Competing Mechanistic Hypotheses → Agentic Rescue/Explore/Exploit → Deterministic Scientific Constraints → Computational/Wet-Lab Experiment → CELLAUDIT-style Falsification → Belief Revision → Next Experiment

다만 이번 최신 문헌에서도 HRKG를 명시적인 scientific belief state로 사용하고, 실험 counter-evidence가 들어올 때 AGM/causal-rule 수준의 formal operator로 graph 자체를 수정하는 end-to-end 신약개발 Co-Scientist는 아직 확인되지 않았다. 이제 이 공백은 단순한 개념적 제안이라기보다, CELLAUDIT·T-REX·Speciesformer·PROXINAUT처럼 필요한 개별 구성요소가 실제 시스템으로 등장하면서 구현 가능한 통합 연구문제로 빠르게 바뀌고 있다.

통합안의 지위 · 이 흐름은 네 시스템을 한 제품에서 검증한 결과가 아니라, 첨부 브리핑이 도출한 설계 가설이다. HRKG의 명시적 belief state와 AGM/causal-rule 수준의 수정 연산자가 연결된 end-to-end 실증은 이 네 원문에서 제시되지 않았다.

REFERENCES

원문 자료

  1. Li et al., Discover, Falsify, Revise: Auditing Input-Use Claims from Source Code to Predictive Contribution in Agent-Discovered Cell ModelsarXiv:2609.27234 v1, 2026-09-23 · CELLAUDIT.
  2. Jeon et al., Agentic campaign control for high-throughput de novo binder designbioRxiv:2026.09.22.753604 · T-REX. 후속 v2는 데이터 가용성과 경미한 본문 수정.
  3. Speciesformer learns conserved cellular states for cross-species generative virtual cell modelingbioRxiv:2026.09.22.752128 · Speciesformer.
  4. PROXINAUT: An Automation Platform for Rapid Hit-to-Degrader DiscoverybioRxiv:2026.09.22.753586 · 합성·검증 자동화.