가설생성 에이전트 연구개발 설계 · TxGemma × Agentic-Tx

헐릴 것을
전제로 세운다

가설(假設)이라는 말은 임시로 세운다는 뜻이다. 집을 올리기 전에 세우는 비계(飛階)가 그렇다. 비계는 완성되면 반드시 헐린다. 헐릴 것을 전제로 세우기에 오히려 튼튼해야 한다.

신약개발에 필요한 것은 “유망한 표적은 A다”라고 답하는 챗봇이 아니다. 제대로 된 가설생성 에이전트는 주장과 기전, 지지 근거와 반대 근거, 불확실성, 반증할 계산·실험, 그리고 결과에 따른 다음 행동을 함께 내놓아야 한다. 이 여섯 가지가 갖춰지지 않은 문장은 가설이 아니라 감상이다.

Hypothesis Card 도면 가설 카드의 열두 개 필드를 위에서 아래로 배치한 제도 도면. 오른쪽에 반증 시험과 다음 행동으로 이어지는 지시선이 붙어 있고, 아래에 도면 표제란이 있다. Hypothesis Card H = (C, I, M, O, E, T) 반증 시험 설계 FALSIFICATION 다음 행동 DOCKING · MD · ASSAY 12 FIELDS 도면명 · SHEET 가설 카드 표준 서식 상태 · STATUS proposed → rejected

여섯 가지를 함께 내놓아야 한다 Key Findings

가설생성 에이전트가 갖추어야 할 것은 유창함이 아니다. 검증하려는 주장, 예상 작동기전, 지지 근거와 반대 근거, 불확실성, 가설을 반증할 계산·실험, 결과에 따른 다음 행동. 이 여섯을 함께 내놓지 못하면 아무리 그럴듯해도 검증할 수 없는 아이디어에 지나지 않는다.

그러므로 역할 배치가 먼저다. TxGemma는 치료제 특성 예측기이자 과학 설명기로, Agentic-Tx는 근거 검색과 전문도구 실행을 계획하는 오케스트레이터로 세운다.

다만 원래 Agentic-Tx가 가진 18개 도구만으로는 이 일을 감당하지 못한다. 바이오메디컬 KG와 Graph RAG, docking과 MD와 FEP, 합성경로, PBPK, assay 설계 도구까지 넓혀야 한다. 이 글은 그 확장을 단계별로 적은 설계 도면이다.

이 문서의 범위 단계 0의 Target Product Profile 정의부터 단계 11의 실험 결과 환류까지 열두 단계를 다룬다. 각 단계마다 생성해야 할 가설, 필요한 에이전트와 도구, 새로 연구해야 할 항목, 그리고 통과 기준 또는 산출물을 적었다. 마지막에 전 단계에 공통으로 필요한 기반과 현실적인 개발 순서를 붙였다.

가설은 문장이 아니라 서식이다 Hypothesis Card

에이전트가 만들어내는 가설은 자연어 한 문장이어서는 안 된다. 구조화된 Hypothesis Card여야 한다.

H = ( Context, Intervention, Mechanism, Outcome, Evidence, Test )
EGFR C797S 변이를 가진 비소세포폐암에서 단백질 X와 EGFR 사이의 보상적 신호가 약물저항성을 유지한다. 따라서 X와 mutant EGFR을 동시에 억제하면 단독 EGFR 억제보다 종양세포 생존율을 낮출 것이다. 이 가설은 CRISPR perturbation, phosphoproteomics, combination assay로 반증할 수 있다.
필드내용
Claim검증하려는 핵심 주장
Disease context질환·아형·환자군
Target · Intervention표적과 조절 방향
Mechanism path약물–표적–경로–표현형의 연결
Expected outcome예상 효능·독성·바이오마커
Supporting evidence논문, KG, omics, 계산·실험 결과
Contradictory evidence가설에 반대되는 근거
Uncertainty데이터·모델·기전의 불확실성
Falsification test가설이 틀렸음을 보일 수 있는 검사
Next actiondocking, MD, assay 등 다음 행동
Provenance출처, 도구, 버전, 파라미터
Statusproposed · testing · supported · rejected
가설을 구조화하지 않으면 에이전트는 유창하지만 검증할 수 없는 아이디어를 만들어낸다. 서식이 곧 규율이다.

한 사람이 다 맡지 않는다 System Architecture

연구목표 · TPPINPUT
Agentic PlannerPLAN & BUDGET
Graph RAG · 문헌 근거EVIDENCE
TxGemma · 전문 예측모델PREDICTION
Docking · MD · FEP · 합성 · PBPKCOMPUTATION
Hypothesis CardARTIFACT
비판 · 검증 · 실험 설계CRITIQUE
Provenance KG · 장기기억MEMORY
다시 Planner로FEEDBACK

↺ 기억은 다음 계획으로 되돌아간다. 이 고리가 끊기면 시스템은 매번 처음부터 시작한다.

Orchestrator AgentPLAN · BUDGET

전체 계획과 예산을 관리한다.

Evidence AgentLITERATURE

논문·특허·임상시험을 검색한다.

Graph Reasoning AgentKG PATH

KG 경로를 탐색하고 기전을 추론한다.

TxGemma AgentPREDICT · EXPLAIN

치료제 특성을 예측하고 설명한다.

Structure AgentSTRUCTURE

AlphaFold 3, pocket, docking, MD, FEP를 맡는다.

Chemistry AgentCHEMISTRY

생성, QSAR, GNN, 합성경로를 담당한다.

ADMET AgentPK · TOX

약동학과 독성, off-target을 분석한다.

Experimental Design AgentASSAY

가설을 검증할 실험을 설계한다.

Skeptic AgentCOUNTER-EVIDENCE

반례와 실패 가능성을 찾는다.

Provenance AgentRECORD

모든 근거와 실행 이력을 기록한다.

Human GatekeeperAPPROVAL

고위험 의사결정을 승인한다.

역할 분리의 이유WHY SPLIT

MADD 연구는 Orchestrator가 너무 많은 역할을 떠안을수록 성능이 떨어질 수 있음을 보였다. 역할을 나누고 검증 가능한 데이터로 통신하게 해야 한다.

열두 단계의 도면 Stage 00 – 11

이제 단계를 따라간다. 각 단계는 저마다 다른 종류의 가설을 만들어낸다. 첫 단계의 가설은 화합물에 관한 것이 아니라 어떤 치료제가 필요한가에 관한 문제정의다.

00

연구목표와 Target Product Profile 정의

TPP DEFINITION

생성해야 할 가설

중추신경계 침투가 가능하고 1일 1회 경구투여가 가능한 선택적 kinase inhibitor라면 기존 치료제의 순응도와 안전성 문제를 개선할 수 있다.

역할 분담

TxGemma — 질환·약물 특성의 초기 설명, BBB·독성·임상 성공 가능성과 관련된 요구조건 초안, 기존 치료제의 한계 요약.

Agentic-Tx — 질환과 표준치료와 미충족 수요 검색, 목표 환자군과 비교약물 정의, 요구 효능·투여경로·안전성·비용 조건 수집, 그리고 서로 충돌하는 요구조건의 발견.

필요한 연구개발

  1. TPP ontologyindication, patient population, route of administration, dosing frequency, efficacy threshold, exposure, safety margin, contraindication, formulation, manufacturing constraint를 기계가 읽을 수 있게 표준화한다.
  2. 대화형 요구조건 명확화“좋은 CNS 약물”처럼 모호한 입력이 들어오면 에이전트가 되물어야 한다. 어느 질환인가, BBB 통과가 필요한가, 경구제인가, 대상 연령은, 기존 약물 대비 무엇을 개선하는가.
  3. 제약조건 검증기동시에 만족하기 어려운 조건을 찾아낸다. 높은 lipophilicity는 BBB 통과에 유리하지만 용해도·비특이 결합·대사 안정성에는 불리하다.

단계 산출물

  • 구조화된 TPP
  • 필수조건과 선호조건
  • 허용 불가능 조건
  • 이후 모든 가설의 공통 평가 기준
01

질환 이해와 기전 가설 생성

MECHANISM HYPOTHESIS

생성해야 할 가설

질환 D에서 pathway P의 지속적 활성은 phenotype Y를 유발하며, upstream regulator X를 억제하면 Y를 역전시킬 수 있다.

필요한 입력

  • 질환 유전체·전사체·단백체
  • single-cell · spatial omics
  • GWAS · rare variant
  • 환자 아형
  • 병리·조직 정보
  • 약물반응 데이터
  • 문헌과 특허
  • disease–gene–pathway KG

에이전트 구성

Evidence Agent는 질환 기전과 선행 치료법과 실패한 임상시험을 찾고, Graph Reasoning Agent는 질환→유전자→단백질→경로→표현형의 경로를 탐색한다. Omics Agent는 환자군별 발현 차이와 pathway activity와 세포유형 특이성을 분석한다.

Skeptic Agent는 반대편에 선다. 그 유전자가 원인이 아니라 결과일 가능성, 특정 세포유형에서만 나타나는 현상일 가능성, 동물모델과 인간 질환의 차이, 이미 실패한 동일 기전의 임상시험을 들추어낸다.

필요한 연구개발

  1. 근거 수준 분류모든 관계를 같은 강도로 다루어서는 안 된다. 인간 유전학, 환자 조직, 임상시험, 동물모델, 세포주, in-silico 예측, 단순 문헌 언급의 층위를 나눈다.
  2. 시간과 조건이 담긴 KGGene–associated_with–Disease만으로는 부족하다. 어느 세포유형인지, 어떤 질환 단계인지, 활성인지 억제인지, 치료 전인지 후인지, 어느 환자 아형인지를 함께 담아야 한다.
  3. 인과성과 연관성의 분리높은 상관관계를 치료 표적으로 오해하지 않도록, Mendelian randomization과 perturbation, CRISPR knockout, rescue experiment, 종단 근거를 앞세운다.

단계 통과 기준

  • 기전 경로가 명확한가
  • 인간 근거가 있는가
  • 반대 근거가 검토되었는가
  • 반증할 실험이 가능한가
02

표적 발굴

TARGET IDENTIFICATION

생성해야 할 가설

Target T를 특정 방향으로 조절하면 질환 phenotype이 개선되며, 정상조직에서의 안전성 위험은 관리 가능하다.

여기서 중요한 것은 표적의 이름만이 아니라 조절의 방향이다. 억제인가 활성화인가, 분해인가 안정화인가, 대체인가 침묵인가 편집인가.

  • inhibit
  • activate
  • degrade
  • stabilize
  • replace
  • silence
  • edit

TxGemma의 몫

disease–gene 연관, protein–compound 친화도, 질환·세포주 문맥의 약물반응, 서열과 자연어 조건을 결합한 관계를 1차로 예측한다. 그러나 이 결과는 표적 확정이 아니라 후보 신호다.

추가할 도구

  • Open Targets
  • GWAS Catalog
  • ClinVar
  • DepMap
  • CRISPR screen
  • GTEx
  • Human Protein Atlas
  • STRING · PPI
  • Reactome · KEGG
  • single-cell atlas
  • 특허·임상시험 검색

필요한 연구개발

  1. 다중 근거 표적점수단일 TxGemma 점수 대신 여러 근거를 통합한다.
    ST = wgG + woO + wpP + wcC + wdD − wsS − wuU G 인간 유전학, O omics, P 경로·기전, C chemical tractability, D druggability, S 안전성 위험, U 불확실성.
  2. KG link prediction알려진 직접 관계뿐 아니라 잠재적인 질환–표적 관계를 예측한다. 다만 embedding 결과에는 관련 경로와 provenance를 반드시 붙인다.
  3. 표적 중복성과 보상경로 분석하나를 억제해도 paralog나 우회 경로가 보상할 수 있다. PPI와 신호전달망에 기반한 robustness 분석이 필요하다.
  4. 신규성과 실패 이력의 구분신규이면서 근거가 있는 표적, 이미 반복 실패한 표적, 약리학적으로 접근하기 어려운 표적, 선택성 확보가 어려운 단백질군을 갈라 보아야 한다.

단계 산출물 — 표적마다

  • 작동 가설
  • 예상 효능
  • 안전성 위험
  • tractability
  • 근거 경로
  • 반대 근거
  • 검증 실험
  • 표적 우선순위
03

표적 검증과 바이오마커 가설

TARGET VALIDATION

생성해야 할 가설

Target T 억제 효과는 biomarker B가 높은 환자군에서 강하며, pathway marker M의 감소가 약효를 반영한다.

표적이 질환과 연관되어 있어도 실제 조절이 치료효과를 만들어내지는 않을 수 있다. 이 단계는 표적 연관성을 개입 가능한 치료 가설로 바꾸는 자리다.

필요한 에이전트

  • Genetic Validation
  • Perturbation Analysis
  • Biomarker
  • Model-System Selection
  • Experimental Design
  • Skeptic

필요한 연구개발

  1. perturbation 방향 예측knockout, knockdown, inhibition, degradation이 같은 결과를 만들지 않는다. 용량과 시간에 따른 효과를 표현해야 한다.
  2. 모델 시스템 선택불멸화 세포주, 환자 유래 세포, 오가노이드, iPSC, xenograft, 유전자 조작 동물모델 가운데 무엇을 쓸지 추천하되 왜 그 모델이 인간 질환을 대표하는지까지 설명해야 한다.
  3. 바이오마커 동시 발굴환자선별, target engagement, pharmacodynamic, resistance, toxicity 바이오마커가 표적 가설에 함께 붙어야 한다.
  4. 반증 가능한 실험 설계틀렸다고 판단할 기준을 미리 정한다. knockdown 후 표현형 개선이 없음, rescue construct가 효과를 복구하지 못함, off-target 대조에서도 같은 효과, 바이오마커와 약효의 무상관.

단계 통과 기준

  • 인과적 perturbation 근거
  • 환자군 정의
  • target engagement 측정법
  • 적절한 모델 시스템
  • 명확한 실패 기준
04

치료 modality와 구조 가설

MODALITY & STRUCTURE

생성해야 할 가설

이 표적은 catalytic pocket이 명확하고 세포 내에 존재하므로 저분자 inhibitor가 적합하다. 또는 — 표면 결합부위는 넓지만 저분자 pocket이 불충분하므로 antibody, peptide, degrader가 적합하다.

검토할 modality

  • small molecule
  • antibody
  • peptide
  • protein therapeutic
  • oligonucleotide
  • siRNA · ASO
  • PROTAC · molecular glue
  • gene therapy
  • cell therapy

Structure Agent의 일

PDB 구조 검색과 품질·결손 잔기 평가, AlphaFold 구조 검색과 AlphaFold 3 co-folding 실행, 변이·isoform·PTM 반영, 결합 부위와 cryptic pocket 탐색, 구조 ensemble 생성.

TxGemma는 AlphaFold 3도, pocket detection도, docking도 직접 수행하는 모델이 아니다. Agentic-Tx가 그 전문도구를 불러야 한다.

필요한 연구개발

  1. 구조 불확실성의 표현AlphaFold 3의 co-folding 결과를 정답 구조처럼 써서는 안 된다. 구조 신뢰도, 계면 신뢰도, disordered region, template 존재 여부, ligand chemistry 적합성, 다른 구조 모델과의 일치도를 함께 저장한다.
  2. receptor-state KG단백질 하나를 노드 하나로 두지 않는다. wild type, mutant, apo, holo, active, inactive, protonation state, cofactor·금속 포함 상태를 따로 관리한다.
  3. modality selection policy위치, pocket, turnover, 세포 접근성, 면역원성, 조직분포를 근거로 modality를 견주게 한다.

단계 산출물

  • 선택 modality
  • 표적 구조 ensemble
  • pocket 가설
  • 핵심 잔기
  • 구조적 위험
  • 구조 가설 검증 방법
05

Hit discovery

HIT DISCOVERY

생성해야 할 가설

Chemical series S는 pocket P의 residue R1·R2와 핵심 상호작용을 형성하므로 Target T를 선택적으로 억제할 가능성이 있다.

검색 전략

  • 기존 약물 재창출
  • ligand-based screening
  • structure-based VS
  • fragment screening
  • pharmacophore search
  • de novo generation
  • similarity search
  • scaffold hopping

TxGemma의 몫과 전문 도구

TxGemma는 초고속 drug–target 친화도 예측, 독성·BBB·mutagenicity 사전 필터, 후보별 구조적 설명, 자연어 조건의 정형화를 맡는다. 그 곁에 ChEMBL·BindingDB·ZINC, molecular fingerprint, GNN·QSAR, docking, AlphaFold 3 co-folding, pharmacophore, 생성모델, RDKit, PLIP·ProLIF를 세운다.

필요한 연구개발

  1. 다중 정밀도 스크리닝 플래너모든 후보에 docking을 걸지 않는다. KG·문헌 사전 필터 → TxGemma·QSAR·GNN → 구조 다양성 선택 → docking → 상위 후보만 pose 분석 → 필요한 후보만 MD·FEP. 후보 수와 예산과 불확실성을 보고 다음 단계를 정한다.
  2. docking 프로토콜 자동 설계Vina를 부르는 것만으로는 부족하다. receptor 구조 선택, protonation, tautomer, ligand conformer, grid box, 금속·물 처리, exhaustiveness, 엔진 선택, consensus docking까지 계획해야 한다.
  3. docking 이력 KGDockingRun, ReceptorState, LigandState, Protocol, Pose, Score, ResidueInteraction, FailureEvent, ValidationResult를 남긴다. 그러면 “이 pocket에서는 Vina 점수가 실험 활성과 잘 맞지 않았으니 다른 엔진과 interaction constraint를 쓰라”는 판단이 가능해진다.
  4. 생성모델 검증TxGemma-Chat에 자유로운 SMILES 생성을 맡기기보다 생성 전용 모델, graph grammar, 유전알고리즘, reaction-based generation, RDKit sanitization, retrosynthesis validation을 도구로 잇는다.

단계 통과 기준

  • 화학적 유효성
  • 구조적 다양성
  • 그럴듯한 결합 포즈
  • 핵심 상호작용
  • 낮은 artifact 위험
  • 기본 drug-likeness
  • 합성 또는 조달 가능성
06

Hit selection

HIT SELECTION

생성해야 할 가설

Hit A는 단순 docking 점수가 가장 높지는 않지만, pose 안정성·핵심 잔기 상호작용·chemical tractability·초기 ADMET를 종합할 때 가장 재현성 높은 hit다.

이 단계에서 가장 위험한 잘못은 docking 점수 순서대로 후보를 고르는 것이다.

평가 축

  • 활성
  • ligand efficiency
  • LLE
  • pose plausibility
  • interaction pattern
  • selectivity
  • chemical novelty
  • synthetic accessibility
  • PAINS·aggregator 위험
  • solubility
  • permeability
  • metabolic stability
  • toxicity
  • uncertainty

필요한 에이전트

  • Consensus Scoring
  • Pose Critic
  • ADMET
  • Chemical Diversity
  • Synthesis Feasibility
  • Evidence Conflict

필요한 연구개발

  1. Pareto 기반 후보 선택하나의 합산점수보다 Pareto frontier가 옳다. 강한 결합에 높은 독성인 후보, 중간 결합에 낮은 독성인 후보, 신규성은 높지만 합성이 어려운 후보를 서로 다른 선택지로 남겨둔다.
  2. 모델 간 불일치의 활용TxGemma와 GNN과 QSAR와 docking이 모두 일치하는 후보만 고르면 기존 화학공간에 갇힌다. 불일치가 큰 후보는 제거 대상이 아니라 추가 정보가 필요한 후보다.
  3. 불확실성 기반 추가 계산pose 불확실성이 크면 ensemble docking, 구조 유연성이 크면 MD, 유사 화합물 간 순위가 중요하면 FEP, 대사 위험이 불확실하면 metabolite prediction.
  4. 다양성을 고려한 선택상위 점수가 같은 scaffold에 몰리는 것을 막는다. 실험 batch에는 여러 scaffold와 여러 가설이 함께 들어가야 한다.

단계 산출물

  • 우선순위 hit panel
  • 각 후보의 선택 이유
  • 모델 간 합의와 불일치
  • 예상 실패 원인
  • 다음 계산·실험 계획
07

Hit-to-Lead와 SAR 가설

SAR HYPOTHESIS

생성해야 할 가설

Phenyl ring의 para 위치에 소형 electron-withdrawing group을 도입하면 hydrophobic pocket 점유율을 높이면서 대사 취약성을 줄일 것이다.

이 단계부터 물음이 바뀐다. “어떤 분자가 좋은가”가 아니라 “어떤 구조 변경이 어떤 특성을 개선하는가”이다.

필요한 데이터

  • matched molecular pair
  • assay 결과
  • inactive compound
  • stereoisomer
  • pose·residue interaction
  • microsomal stability
  • permeability
  • solubility
  • selectivity panel
  • synthesis yield

전문 도구

  • QSAR
  • GNN
  • MMP analysis
  • FEP
  • MD
  • conformational analysis
  • metabolite prediction
  • reaction-aware generation
  • retrosynthesis

필요한 연구개발

  1. 제약된 molecular editingLLM이 분자 전체를 새로 짓게 하지 않는다. 치환기 추가·삭제, bioisostere 치환, 고리 축소·확장, 입체화학 변경, linker 변경, rigidification, 대사 취약점 차단 가운데 하나를 고르게 하고, 정확한 변환은 RDKit과 reaction template이 실행한다.
  2. SAR KGCompound_A ─MODIFIED_TO→ Compound_B, Modification ─IMPROVED→ Potency, ─WORSENED→ Solubility, ─REMOVED→ hERG_Risk. 과거의 최적화 경험이 다시 쓰이려면 이렇게 적어야 한다.
  3. 반사실적 설명“왜 B가 A보다 나은가”에 더해 “이 methyl을 없애면 potency가 떨어질 것이며 같은 scaffold의 matched-pair assay로 확인할 수 있다”까지 말해야 한다.
  4. 능동학습다음 합성 후보에는 예측값이 가장 높은 분자만이 아니라 모델을 가장 많이 학습시키는 분자도 들어가야 한다.

단계 통과 기준

  • 재현성 있는 SAR
  • 두 개 이상의 chemical series
  • 활성·선택성·ADMET 균형
  • 구조적 설명
  • 합성 가능한 다음 analog
  • 불확실성 감소
08

Lead optimization

LEAD OPTIMIZATION

생성해야 할 가설

Lead L의 특정 amide를 heterocycle로 치환하면 결합 친화도를 유지하면서 microsomal clearance와 용해도를 개선할 수 있다.

최적화 목표

  • potency
  • selectivity
  • solubility
  • permeability
  • metabolic stability
  • CYP inhibition
  • hERG
  • plasma protein binding
  • clearance
  • oral bioavailability
  • tissue exposure
  • synthetic accessibility
  • formulation feasibility

필요한 에이전트

  • Multi-objective Optimization
  • MD/FEP
  • ADMET
  • Off-target
  • Retrosynthesis
  • Portfolio

필요한 연구개발

  1. MD 실행 정책모든 후보에 장시간 MD를 돌리지 않는다. docking pose가 불안정할 때, flexible loop가 결합에 관여할 때, 물 매개 상호작용이 중요할 때, 변이에 따른 pocket 변화가 클 때, 여러 pose의 우선순위가 불분명할 때만 쓴다.
  2. FEP 실행 정책같은 계열의 작은 구조변경 순위를 정할 때 우선 쓴다. 전혀 다른 scaffold를 무리하게 견주지 않도록 applicability domain을 건다.
  3. ADMET 앙상블TxGemma 하나에 기대지 않는다. graph model, descriptor QSAR, 상용·공개 예측기, 유사 실험 데이터, mechanistic alert를 함께 묶는다.
  4. off-target 가설표적 선택성만 보지 말고, 이 구조가 어떤 다른 단백질군에 붙을지를 거꾸로 추론해야 한다.
  5. 합성을 아는 최적화활성이 좋아져도 합성할 수 없으면 소용이 없다. retrosynthesis 신뢰도, 단계 수, 출발물질 조달성, 위험 반응, 예상 수율, 특허 공간을 생성–평가 단계에 함께 넣는다.

단계 산출물 — lead마다

  • 개선하려는 특성
  • 제안 구조변경
  • 예상 이익과 trade-off
  • 계산 근거
  • 합성경로
  • 실패 기준
  • 우선 합성 순서
09

후보물질 선정과 전임상 가설

CANDIDATE SELECTION

생성해야 할 가설

Candidate C는 예상 임상노출에서 표적 억제율을 유지하며, 안전역이 충분하고 biomarker B로 환자 반응을 추적할 수 있다.

필요한 분석

  • PK/PD
  • PBPK
  • dose–exposure–response
  • tissue distribution
  • metabolite
  • species translation
  • repeated-dose toxicity
  • genotoxicity
  • cardiac risk
  • DDI
  • formulation
  • manufacturability

TxGemma의 몫

Phase 1 성공 가능성 같은 초기 가설 생성, 독성·임상 문맥의 보조 예측, 결과의 자연어 설명. 다만 TxGemma의 임상 성공 예측은 후보 선정을 대신할 증거가 아니라 추가적인 약한 신호다. 공식 모델 카드도 용도에 맞는 downstream validation을 요구한다.

필요한 연구개발

  1. PBPK 도구 연결동물과 인간의 흡수·분포·대사·배설 차이를 모델링한다.
  2. species translation KGhuman target, mouse ortholog, 결합부위 보존도, 대사효소, transporter, 독성 조직을 연결한다.
  3. 안전성 veto agent효능 에이전트와 독립된 안전성 에이전트가 중단권을 가져야 한다. 심각한 genotoxicity와 hERG, reactive metabolite 신호가 평균 점수로 상쇄되어서는 안 된다.
  4. 후보 포트폴리오단일 후보만 고르지 않는다. primary candidate, backup candidate, alternative scaffold, alternative modality를 서로 다른 실패위험으로 함께 쥐고 간다.
10

임상 번역과 환자선별 가설

CLINICAL TRANSLATION

생성해야 할 가설

Biomarker B 양성 환자에서 Candidate C의 반응률이 높으며, 초기 pharmacodynamic marker M의 변화가 장기 임상반응을 예측한다.

필요한 에이전트

  • Clinical Evidence
  • Trial Design
  • Patient Stratification
  • Drug–Drug Interaction
  • Regulatory Evidence
  • Safety Reviewer

필요한 데이터

  • ClinicalTrials.gov
  • FDA·EMA 문서
  • 임상시험 protocol
  • real-world evidence
  • pharmacogenomics
  • 환자 아형
  • 약물 병용
  • adverse event
  • 선정·제외 기준

필요한 연구개발

  1. 임상시험 KG질환–약물 관계만이 아니라 phase, patient population, dose, biomarker, endpoint, comparator, 성공과 실패, 실패 사유, adverse event까지 표현한다.
  2. 환자 아형 인과 추론후향적 상관관계를 바이오마커 효과로 오인하지 않도록 교란을 분석한다.
  3. 실시간 근거 갱신새 임상 결과와 규제 정보는 학습 파라미터가 아니라 Agentic RAG로 검색해야 한다.
  4. 고위험 의사결정의 제한에이전트는 임상 가설과 시험설계 초안을 낼 수 있지만 환자 치료 결정을 자율로 수행해서는 안 된다. TxAgent 역시 별도의 정밀치료 연구 시스템이지 임상의의 대체물이 아니다.
11

실험 결과 환류와 가설 갱신

FEEDBACK LOOP

이 단계가 전부인 이유

가설생성 시스템의 성패는 최초 가설의 품질이 아니라 틀린 가설로부터 얼마나 잘 배우는가에 달려 있다. 비계는 헐리기 위해 세워진다. 헐린 자리에 무엇이 남는지가 다음 집의 높이를 정한다.

가설 생성HYPOTHESIS
계산 · 실험EXECUTE
결과 해석INTERPRET
지지 → 근거 강화SUPPORTED
반박 → 실패 원인 기록CONTRADICTED
불확실 → 추가 실험UNCERTAIN

↺ 세 갈래 모두 다시 가설로 돌아온다

필요한 연구개발

  1. 결과 자동 정규화단위, assay type, endpoint, 실험조건, replicate, 통계적 유의성을 통일한다.
  2. 가설 상태관리proposed, prioritized, under computation, under experiment, partially supported, contradicted, rejected, superseded의 상태를 관리한다.
  3. 부정적 결과 저장실패한 후보와 실패한 계산·실험 조건도 KG에 남긴다. 그러지 않으면 같은 잘못을 되풀이한다.
  4. 모델 보정 갱신실험 결과로 TxGemma를 보정하고, QSAR·GNN을 재학습하고, docking score를 calibration하고, 도구 선택 정책과 신뢰도 임계치를 고친다.

Robin은 문헌 기반 가설과 실험과 데이터 분석과 후속 가설을 하나의 연속된 흐름으로 이은 대표 사례다.

모든 단계가 함께 딛는 바닥 Common Foundations

바이오메디컬 지식그래프

열두 단계 전부가 하나의 그래프 위에 선다. 최소한의 노드와 관계를 정해두지 않으면 단계마다 다른 언어를 쓰게 된다.

  • Disease
  • PatientSubtype
  • Gene
  • Protein
  • Pathway
  • Phenotype
  • Compound
  • Target
  • Structure
  • Pocket
  • Pose
  • Assay
  • Trial
  • Publication
  • Hypothesis
  • Evidence
  • AgentAction
  • associated_with
  • causally_affects
  • expressed_in
  • binds_to
  • inhibits
  • activates
  • participates_in
  • causes_resistance
  • supported_by
  • contradicted_by
  • generated_by
  • validated_by
  • failed_in
Graph RAG와 Agentic RAG 벡터 검색만으로는 기전 경로를 안정적으로 따라가지 못한다. 여섯 겹의 복합 검색이 필요하다.
  1. entity resolution
  2. 관련 subgraph 검색
  3. 경로별 근거 검색
  4. 논문 원문 검증
  5. 반대 근거 검색
  6. 답변과 가설 생성

CLADD가 PrimeKG와 molecular annotation을 다중 에이전트로 결합한 참고 사례다.

타입이 있는 도구 인터페이스TYPED TOOL INTERFACE

도구는 자연어 문자열이 아니라 정해진 형식으로 결과를 돌려주어야 한다.

{ "value": -9.1, "unit": "kcal/mol", "confidence": 0.68, "method": "AutoDock Vina", "software_version": "versioned", "input_ids": ["protein_state_id","ligand_state_id"], "parameters": {}, "applicability_domain": "structure-based screening", "warnings": [], "provenance": [] }

불확실성 통합UNCERTAINTY

가설의 최종 신뢰도는 단순 평균이 아니다. 근거의 강도와 독립성을 함께 따져야 한다.

C(H) = f( Cgenetic, Comics, Cstructure, CADMET, Cexperiment )

같은 원천에서 파생된 모델 결과들을 독립된 증거처럼 거듭 세어서는 안 된다.

반대가설 생성ALTERNATIVE HYPOTHESIS

모든 가설에 최소한 하나의 대안 설명을 붙인다. “Target T 억제가 세포 생존을 감소시킨다”는 주가설 곁에는 이런 대안들이 서야 한다.

  • 실제 효과는 off-target 때문이다
  • 특정 세포주에만 해당한다
  • T 억제가 아니라 stress response 때문이다
  • 병용약물과의 상호작용 때문이다

재현성과 provenanceREPRODUCIBILITY

모든 실행에서 남겨야 할 것들이다. 하나라도 빠지면 그 실행은 되살릴 수 없다.

  • model·tool version
  • prompt
  • 입력 데이터 snapshot
  • parameter
  • random seed
  • 실행환경
  • 비용
  • 결과
  • 오류
  • 전문가 수정

평가체계

가설생성 에이전트를 답변 정확도만으로 평가해서는 안 된다. 열 개의 축을 함께 재야 한다.

평가축대표 지표
과학적 정확성전문가 평가, 알려진 정답 회수율
근거성인용 정확도, evidence coverage
신규성기존 문헌과의 거리, novel mechanism
반증 가능성실행 가능한 test의 비율
재현성반복 실행 일치도
도구 정확성tool·argument 성공률
불확실성calibration error
비용 효율유효 가설당 계산비용
실험 유용성assay hit enrichment
학습성다음 라운드의 성능 개선량

한꺼번에 짓지 않는다 Development Roadmap

열두 단계를 동시에 세울 수는 없다. 터를 다지고, 기둥을 세우고, 그 다음에 지붕을 얹는다. 현실적인 순서는 다섯이다.

PHASE 1

근거에 발 디딘 가설 MVP

  • 질환–표적 가설
  • 바이오메디컬 KG
  • PubMed·Open Targets RAG
  • TxGemma 예측
  • Hypothesis Card
  • 지지·반대 근거
  • human review

목표는 자율 실행이 아니라 근거 있고 반증 가능한 표적 가설이다.

PHASE 2

In-silico 실행형 에이전트

  • compound retrieval
  • GNN·QSAR
  • docking
  • pose interaction
  • docking 이력 KG
  • 초기 ADMET
  • Pareto hit selection
PHASE 3

Lead optimization 에이전트

  • 제약된 분자 생성
  • MD·FEP
  • 다목적 최적화
  • retrosynthesis
  • SAR KG
  • active learning
PHASE 4

실험 폐루프

  • assay 설계
  • 실험 결과 수집
  • negative-result KG
  • 모델 calibration
  • 가설 갱신
  • 다음 batch 자동 제안
PHASE 5

전임상·임상 번역

  • PBPK
  • species translation
  • biomarker
  • trial KG
  • patient stratification
  • 규제·안전 검토

연구개발의 본질 Essence

TxGemma가 후보의 치료제 특성을 예측하고 설명하며, Graph RAG가 질환–표적–경로의 근거를 대고, Agentic-Tx가 docking·MD·FEP·ADMET·합성·실험 도구를 계획적으로 실행하며, Skeptic Agent가 반대가설을 세우고, 모든 결과를 provenance KG에 쌓아 다음 가설을 고쳐 나가는 구조.

가장 중요한 연구개발 대상은 더 유창한 문장 생성이 아니다. 핵심은 다섯이다.

인과적이고 반증 가능한 가설 표현01 · FALSIFIABLE

서식이 곧 규율이다. 반증할 수 없는 문장은 가설이 아니다.

출처와 반대 근거가 담긴 Graph RAG02 · GROUNDED

지지 근거만 모으는 검색은 확증편향의 자동화다.

전문 계산도구의 안전하고 재현 가능한 실행03 · REPRODUCIBLE

같은 입력에 같은 결과가 나오지 않으면 그것은 실험이 아니다.

불확실성과 비용을 고려한 다음 행동 선택04 · DECISION

가장 좋아 보이는 것이 아니라 가장 많이 배우게 하는 것을 고른다.

성공과 실패를 모두 학습하는 폐루프 기억05 · MEMORY

버려진 가설의 기록이 다음 가설의 출발점이 된다.

그리하여AI CO-SCIENTIST

이 다섯이 갖춰져야 에이전트가 단순한 정보검색 도구에서 연구자의 가설 형성과 검증을 돕는 AI 공동연구자로 나아간다.

비계를 잘 세우는 목수는 헐어낼 때를 미리 계산한다. 어디를 먼저 풀고 어떤 순서로 내릴지를 세우는 순간부터 알고 있다. 가설도 그와 같아서, 어떻게 무너뜨릴지를 함께 적어둔 것만이 쓸모를 갖는다.

HYPOTHESIS-GENERATING AGENT · R&D DESIGN TXGEMMA × AGENTIC-TX STAGE 00 – 11 인용 정보는 원문에서 확인할 것