일러두기
답사를 다니다 보면 절터에 초석만 남은 곳을 자주 만난다. 기둥은 없고 주춧돌만 있는데, 그 배치를 읽을 줄 아는 사람에게는 사라진 금당의 규모와 향(向)과 시대가 모두 보인다. 아는 만큼 보인다는 말은 그런 자리에서 나온 말이다. 신약개발의 계산 결과도 마찬가지다. docking score 한 줄, RMSD 한 그래프는 그 자체로는 초석에 지나지 않는다. 그것이 어떤 가설의 어느 대목을 지지하고 어느 대목을 무너뜨리는지 읽어내지 못하면 숫자는 끝내 숫자로 남는다.
이 글은 그 읽는 법에 관한 설계도다. 여기서 제안하는 개념을 Evidence-to-Experiment Agentic-Tx, 줄여서 E2E-Tx라 부른다. 기존 연구를 토대로 확장한 연구 설계이며, 실제 학술·특허 신규성은 별도의 선행기술 조사로 확인해야 한다. 이 점을 먼저 못 박아 둔다.
토대가 된 연구 — Agentic-Tx (arXiv:2504.06196), MADD (Findings of EMNLP 2025), ToolMol (arXiv:2605.12784), Robin (Nature).
First principles
전체 설계 원칙 — 순서가 아니라 판단이다
에이전트는 세 가지를 되풀이한다. 이 셋이 한 바퀴 도는 것이 곧 한 수(手)다.
- 현재 가설에서 무엇이 불확실한지 판단한다.
- 그 불확실성을 가장 경제적으로 줄일 계산이나 실험을 선택한다.
- 결과가 나오면 가설의 신뢰도를 갱신하고 다음 행동을 다시 선택한다.
따라서 고정된 다음 순서만 실행해서는 안 된다. 바둑에서 정석을 외운 사람이 그 정석대로만 두어 지는 것과 같은 이치다.
두어서는 안 될 수 — 고정 파이프라인
Docking → MD → FEP → ADMET → 합성 → 실험
두어야 할 수 — 후보별 적응 경로
후보 A: Docking → 짧은 MD → 제거 후보 B: ADMET → 독성 위험으로 제거 후보 C: Docking → MD → FEP → 합성 후보 D: 기존 실험근거 충분 → 바로 assay 후보 E: 구조 불확실 → AlphaFold 3 co-folding부터
Hypothesis Compiler
자연어 가설을 실행 가능한 계획으로 옮긴다
사용자가 다음과 같이 입력했다고 하자.
“질환 D에서 X를 억제하면 pathway P의 과도한 활성이 줄고 phenotype Y가 개선될 것이다.”
한 문장이지만 그 안에는 서로 다른 층위의 주장이 아홉 겹으로 포개져 있다. Hypothesis Compiler가 하는 일은 이 포개진 겹을 낱장으로 떼어내는 것이다. 떼어내야 각각을 따로 검증할 수 있고, 따로 무너뜨릴 수 있다.
| 하위 가설 | 검증 질문 | 적합한 도구 |
|---|---|---|
| 질환기전 가설 | P가 실제로 Y의 원인인가? | Graph RAG, omics, 문헌 |
| 표적 가설 | X가 P의 상위 조절자인가? | KG, PPI, CRISPR |
| 구조 가설 | X에 약물 결합 가능한 pocket이 있는가? | PDB, AlphaFold 3, pocket 탐색 |
| 결합 가설 | 후보물질이 X에 결합하는가? | docking, co-folding |
| 안정성 가설 | 결합 pose가 동적 환경에서도 유지되는가? | MD |
| 상대효능 가설 | 어떤 analog가 더 강하게 결합하는가? | FEP |
| 개발 가능성 가설 | 흡수·대사·독성이 허용 가능한가? | ADMET |
| 제조 가능성 가설 | 실제로 합성 가능한가? | retrosynthesis |
| 생물학적 가설 | X 결합이 Y 개선으로 이어지는가? | biochemical·cellular assay |
이 분해 결과는 자유로운 문장이 아니라 기계가 처리할 수 있는 Research Intent Specification으로 만들어야 한다.
{
"disease": "D",
"target": "X",
"target_action": "inhibition",
"pathway": "P",
"desired_phenotype": "reverse Y",
"required_evidence": [
"causal_target_evidence",
"binding_evidence",
"dynamic_stability",
"admet",
"synthetic_feasibility",
"experimental_validation"
],
"budget": {},
"safety_constraints": {},
"human_approval_points": []
}
이것이 전체 agent workflow의 계약서 역할을 한다. 계약서 없이 시작한 공사가 어떻게 끝나는지는 굳이 말할 필요가 없다.
Graph-Native Planner
지식 그래프를 검색기가 아니라 계획의 기억으로 쓴다
기존 RAG는 검색한 문서를 현재 대화에 넣고 끝난다. 한 번 쓰고 버리는 기억이다. 제안하는 방식에서는 지식 그래프에 세 종류의 지식을 함께 저장한다. 사실만 남기고 과정을 버리는 기록은 기록이 아니라 목록에 지나지 않는다.
3.1 사실 그래프
- 질환–유전자
- 단백질–pathway
- 약물–표적
- mutation–resistance
- assay–activity
- 임상시험–결과
3.2 실행 그래프
- 어떤 구조를 사용했는가
- 어떤 docking engine을 사용했는가
- 어떤 파라미터였는가
- 어떤 pose가 생성되었는가
- MD에서 pose가 유지되었는가
- 어떤 FEP network가 실패했는가
3.3 판단 그래프
- 왜 이 후보를 선택했는가
- 어떤 근거가 가설을 지지했는가
- 무엇이 반박했는가
- 어떤 전문가가 결정을 수정했는가
- 어떤 결과 때문에 다음 계획이 변경되었는가
Hypothesis_H1 ─REQUIRES_TEST→ BindingHypothesis DockingRun_23 ─TESTED→ BindingHypothesis DockingRun_23 ─GENERATED→ Pose_7 Pose_7 ─INTERACTS_WITH→ Residue_MET793 MDRun_11 ─DESTABILIZED→ Pose_7 BindingHypothesis ─STATUS→ Contradicted PlannerDecision_8 ─TRIGGERED_BY→ MDRun_11 PlannerDecision_8 ─SELECTED→ Alternative_Receptor_State
이렇게 해야 에이전트가 단순히 결과를 읽는 것을 넘어 과거의 실패로부터 계획을 개선할 수 있다. 기보를 남기지 않은 대국은 복기할 수 없다.
Value of Information
고정 순서 대신 ‘정보가치’로 다음 도구를 고른다
바둑에 “큰 곳보다 급한 곳”이라는 격언이 있다. 반상에서 가장 큰 자리가 지금 두어야 할 자리는 아니라는 뜻이다. 에이전트도 가장 정확한 도구부터 무조건 실행해서는 안 된다. 비용이 큰 FEP를 모든 후보에 수행하면 비효율적이다. 다음 행동은 정보가치, 비용, 시간, 위험을 함께 고려해 선택한다.
- ΔU(H) — 행동 a가 가설의 불확실성을 얼마나 줄이는가
- C(a) — 계산·실험 비용
- T(a) — 소요시간
- R(a) — 안전·실패 위험
“가장 정교한 계산”이 아니라 “현재 결정을 가장 많이 명확하게 만드는 계산”을 먼저 선택한다.
실제로는 이런 판단이 된다
- 후보가 10만 개라면 FEP보다 TxGemma·GNN screening이 적합하다.
- docking pose가 명백히 불합리하다면 MD를 실행할 필요가 없다.
- 두 analog 사이의 미세한 차이가 중요하면 FEP가 적합하다.
- 결합력은 좋지만 hERG 위험이 매우 높다면 구조계산보다 ADMET 개선이 우선이다.
- 합성경로가 없으면 더 정밀한 affinity 계산보다 구조 재설계가 우선이다.
이러한 방식을 Value-of-Information 기반 Adaptive Escalation이라고 정의할 수 있다.
Docking Agent
도킹 — 점수를 믿기 전에 조건을 의심한다
5.1 단순 구현의 위험
일반적인 agent는 이 정도만 수행한다.
“Vina를 실행하고 점수가 가장 낮은 화합물을 선택한다.”
이는 위험하다. docking score는 receptor 구조, protonation, grid, ligand state와 엔진에 크게 의존하기 때문이다. 같은 유물을 두고 조명을 바꿔가며 사진을 찍은 뒤 가장 잘 나온 한 장으로 연대를 판정하는 것과 다르지 않다.
5.2 제안하는 구현
Docking Agent는 먼저 실행 조건에 대한 가설을 생성한다.
“이 표적은 flexible loop를 가지므로 하나의 정적 구조보다 receptor ensemble을 사용하는 것이 적절하다.”
그런 다음 세 갈래로 계획을 세운다.
구조 선택
- crystal structure
- AlphaFold 구조
- AlphaFold 3 co-folding 구조
- wild type · mutant
- active · inactive state
- apo · holo structure
- receptor ensemble
구조 전처리
- 결손 잔기
- protonation
- tautomer
- metal
- cofactor
- 구조수
- 결합부위 water
- ligand stereochemistry
실행 전략
- Vina, smina, Glide, DiffDock 등 엔진 선택
- blind docking 또는 pocket docking
- constraint docking
- consensus docking
- ensemble docking
- decoy 및 known ligand를 이용한 protocol 검증
5.3 과거 이력에 기대어 엔진을 고른다
실행 KG에서 표적군·pocket 특성이 비슷한 과거 작업을 검색한다.
“과거 kinase hinge pocket에서는 엔진 A의 score가 assay와 낮은 상관을 보였지만, 엔진 B의 MET793 hydrogen-bond pose는 MD와 실험에서 더 잘 유지되었다.”
Agent는 이 정보를 이용해 엔진과 제약조건을 선택한다. 경험이 쌓인 답사자가 어느 각도에서 봐야 명문이 읽히는지 아는 것과 같다.
5.4 도킹 통과 조건
단순 score 대신 다음 여덟 항목을 함께 본다.
- 여러 엔진의 pose 일치
- 알려진 핵심 잔기와의 상호작용
- ligand strain
- pocket 충돌
- decoy 대비 enrichment
- receptor state 간 일관성
- score uncertainty
- 과거 assay와의 calibration
통과하지 못한 후보는 제거하거나 대체 receptor state에서 다시 평가한다.
MD Agent
분자동역학 — 모든 후보에 같은 시간을 쓰지 않는다
6.1 MD를 실행하는 조건
MD Agent는 다음 질문에 답할 필요가 있을 때만 실행한다. 질문 없는 시뮬레이션은 전기요금일 뿐이다.
- docking pose가 실제 동적 환경에서도 유지되는가
- flexible loop가 결합에 영향을 주는가
- 핵심 hydrogen bond가 안정적인가
- 물 분자가 결합을 매개하는가
- mutation이 pocket 구조를 바꾸는가
- 서로 다른 pose 중 어느 것이 더 안정적인가
6.2 적응형 MD
1단계 · 짧은 sentinel MD
상위 후보들에 짧은 독립 replica를 수행한다.
- pose가 즉시 붕괴하는 후보 제거
- 심각한 steric clash 발견
- 불안정한 protonation 확인
2단계 · 불확실 후보 선택
짧은 MD 결과가 애매한 후보만 추가 simulation으로 보낸다. 명확한 것은 더 볼 필요가 없다.
3단계 · 집중 샘플링
- 여러 replica
- metadynamics
- umbrella sampling
- enhanced sampling
- mutation 비교
6.3 MD 결과의 해석
Agent는 ligand RMSD 하나만 보지 않고 아홉 가지를 종합한다.
- 핵심 contact occupancy
- pocket RMSF
- ligand RMSD
- hydrogen-bond lifetime
- water bridge
- solvent exposure
- protein conformational change
- replicate 간 일치도
- trajectory clustering
6.4 Cross-Fidelity Consistency Check
다음과 같은 충돌을 자동으로 감지한다.
TxGemma affinity : 높음 Docking score : 높음 MD pose stability : 낮음 ← 모순
이 경우 Agent는 “강한 결합 후보”라고 결론내리지 않고 다음 가설을 생성한다. 평균을 내는 것은 판단이 아니라 회피다.
“TxGemma와 docking은 정적 구조에서는 결합 가능성을 높게 평가하지만, MD에서 pose가 붕괴하므로 receptor state 또는 protonation이 잘못되었을 가능성이 있다.”
다음 행동은 다른 구조 상태에서의 재-docking이나 ligand state 재생성이다.
FEP Agent
자유에너지 섭동 — 비교할 수 있는 것만 비교한다
7.1 FEP를 사용할 조건
- 동일 scaffold의 유사 analog 비교
- 작은 치환기의 potency 영향 비교
- 합성 우선순위 결정
- mutation에 따른 affinity 변화
- 실험값 일부가 있는 chemical series 보정
전혀 다른 scaffold들을 FEP로 직접 비교하는 것은 피해야 한다. 청자와 백자를 같은 자로 재려는 것과 같다.
7.2 섭동 네트워크의 자동 설계
FEP Agent는 후보쌍을 임의로 연결하지 않고 일곱 가지를 고려해 신뢰도 높은 perturbation network를 구성한다.
- 최대 공통부분
- 원자 매핑의 안정성
- 전하 변화
- ring 변화
- stereochemistry
- 예상 계산 난이도
- cycle closure 가능성
Compound A ↔ Compound B ↔ Compound C ↕ ↕ Compound D ↔ Compound E ↔ Compound F
7.3 품질 게이트
- replica 간 분산
- cycle-closure error
- hysteresis
- phase-space overlap
- experimental anchor와의 차이
- force-field applicability
임계치를 넘으면 결과를 확정값으로 사용하지 않고 재계산하거나 다른 방법으로 보낸다.
7.4 FEP 결과의 활용
에이전트는 “B가 A보다 1 kcal/mol 좋다”에서 끝내지 않고 다음 SAR 가설로 옮긴다. 숫자를 가설로 바꾸는 이 대목이 이 설계의 백미다.
“B의 para 치환기가 pocket의 소수성 공간을 더 안정적으로 점유하는 것으로 보인다. 동일 위치에 크기가 다른 치환기를 도입하면 이 가설을 검증할 수 있다.”
ADMET Agent
흡수·대사·독성 — 평균으로 상쇄해서는 안 되는 위험이 있다
8.1 단일 모델 대신 다중 근거
TxGemma는 독성, BBB, lipophilicity 등 여러 태스크를 예측할 수 있지만, 최종 판단을 TxGemma 하나에 맡겨서는 안 된다. (공식 모델 카드)
다음 예측을 결합한다.
- TxGemma
- descriptor QSAR
- molecular GNN
- 유사화합물 실험값
- toxicophore alert
- metabolite predictor
- 외부 ADMET predictor
8.2 적용영역 판정 에이전트
예측값과 함께 “이 모델이 이 화합물을 얼마나 잘 아는가”를 평가한다.
- training set과 구조적으로 가까운가
- 새로운 scaffold인가
- unusual element가 있는가
- zwitterion·macrocycle인가
- 전하 상태가 복잡한가
- 모델 간 예측이 일치하는가
모델 적용영역 밖의 후보에는 낮은 신뢰도를 부여한다.
8.3 Safety Veto — 상쇄 불가 항목
일부 위험은 평균점수로 상쇄하면 안 된다.
- genotoxicity
- 심각한 hERG risk
- reactive metabolite
- 강한 CYP inhibition
- 구조적 폭발성·반응성
- 치명적 off-target
이러한 신호가 일정 수준을 넘으면 독립된 Safety Agent가 후보를 중단시키거나 필수 검증을 요구한다.
8.4 ADMET 기반 역방향 구조설계
ADMET Agent는 위험을 보고하는 데 그치지 않고 원인이 되는 부분구조를 Chemistry Agent에 전달한다.
문제 : 높은 microsomal clearance 가능 원인 : benzylic oxidation 제안 : fluorination, bioisostere, steric shielding 보존 조건 : hinge-binding pharmacophore 유지
이를 Risk-to-Edit Feedback이라고 정의할 수 있다.
Chemistry & Synthesis Agent
합성 — 만들 수 없는 분자는 설계가 아니다
9.1 합성 가능성을 마지막에 확인하지 않는다
기존 방식은 최적화가 끝난 후에야 합성경로를 찾는다. 설계도를 다 그린 뒤에 그 목재를 구할 수 없다는 사실을 아는 목수와 같다. 제안 방식에서는 생성·최적화 단계부터 합성 가능성을 고려한다.
9.2 합성경로 평가
- retrosynthesis confidence
- reaction step 수
- starting material 재고
- 가격
- 예상 수율
- 정제 난이도
- stereochemistry
- 보호기 사용
- 위험 시약
- 특수장비
- 특허 충돌
9.3 경로를 아는 분자 재설계
좋은 활성을 가진 후보가 합성하기 어렵다면 단순 폐기하지 않는다. 합성 Agent가 어려운 결합과 부분구조를 식별하고 Chemistry Agent에 조건을 보낸다.
“이 활성을 유지하면서 반응 단계가 8단계에서 4단계 이하가 되도록 linker와 ring system을 변경하라.”
Chemistry Agent는 다음을 수행한다.
- 합성 병목 구조 식별
- 기능적으로 유사한 bioisostere 검색
- reaction template 기반 구조 수정
- potency·ADMET 재평가
- 새로운 합성경로 생성
이를 Synthesis-aware Backpropagation이라고 부를 수 있다. 최종 결과에서 발생한 합성 문제를 분자 생성 단계까지 역으로 전달한다는 뜻이다.
Experiment Design Agent
실험설계 — 가장 좋은 후보만 실험하지 않는다
10.1 배치는 세 종류를 포함한다
최고점 후보만 실험하면 비슷한 scaffold와 비슷한 가설만 검증하게 된다. 잘 나온 자리만 골라 파는 발굴은 결국 자기가 기대한 것만 찾아낸다.
- 성능이 가장 좋을 것으로 예상되는 후보
- 모델 불확실성을 가장 많이 줄이는 후보
- 현재 가설을 반박할 수 있는 후보
10.2 실험 선택 기준
예를 들어 후보 A와 B가 모두 유망하지만 A에 대한 예측모델 간 합의가 높고 B는 불일치가 크다면, B의 실험이 더 많은 정보를 준다.
10.3 필수 실험 구성
- positive control
- negative control
- vehicle control
- concentration range
- replicate
- orthogonal assay
- target-engagement assay
- counterscreen
- cytotoxicity assay
- assay interference 검사
10.4 가설 반증 조건
실험 전에 실패 기준을 정의한다. 이것이 없으면 결과는 언제나 성공으로 해석된다.
“결합 assay에서 활성이 나타나더라도 target-engagement assay가 음성이면, 직접 결합 가설은 지지되지 않은 것으로 판단한다.”
이렇게 해야 에이전트가 사후적으로 어떤 결과든 성공처럼 해석하는 것을 방지할 수 있다.
Dissenting Scientist Agent
반대하는 에이전트 — 의도적으로 딴지를 거는 자리
창의적이면서 중요한 기법은 별도의 Dissenting Scientist Agent를 두는 것이다. 이 Agent는 가설을 지지하는 근거를 찾지 않는다. 오직 무너뜨릴 방법만 찾는다.
- 반대 논문 검색
- 실패한 임상시험 검색
- off-target 가능성 제안
- docking artifact 탐색
- assay interference 경고
- 모델 시스템의 한계 제시
- 대안 기전 생성
주가설
“후보 A는 X를 억제해 Y를 개선한다.”
반대가설
“후보 A의 효과는 X 억제가 아니라 세포독성 때문에 나타났을 수 있다.”
필요한 반증 실험
- X knockout cell에서 후보 효과 비교
- target engagement 측정
- 세포독성과 phenotype 분리
- 구조적으로 다른 X inhibitor 비교
최종 가설은 주가설과 반대가설을 모두 통과해야 다음 단계로 이동한다.
Scientific Tool Contract
도구 계약 — LLM의 자유로운 실행을 제한한다
Agentic-Tx의 LLM이 shell 명령이나 전문도구를 자유롭게 작성해 실행하도록 두면 재현성과 안전성이 낮아진다. 모든 도구는 형식이 정해진 API로 제공해야 한다.
| 등록 항목 | 의미 |
|---|---|
| Tool name · version | 프로그램과 버전 |
| Input schema | 허용 입력과 타입 |
| Output schema | 반환 결과와 단위 |
| Applicability domain | 언제 사용 가능한가 |
| Cost · latency | 예상 계산비용과 시간 |
| Preconditions | 실행 전 필요한 조건 |
| Failure codes | 실패 유형 |
| Validator | 결과 검증법 |
| Safety level | 자동 실행 또는 승인 필요 |
| Provenance policy | 저장해야 할 실행 정보 |
LLM은 “MD를 수행하라”는 결정을 내릴 수 있지만 실제 파라미터는 schema validator와 domain rule engine을 통과해야 한다. 이를 통해 역할이 다섯으로 갈린다.
- LLM — 왜 실행할지 판단
- Policy engine — 실행 가능 여부 판단
- 전문도구 — 실제 계산 수행
- Validator — 결과가 유효한지 검사
- KG — 과정과 결과 저장
Shadow Planning
수읽기 — 비싼 실행 전에 여러 계획을 가상으로 겨룬다
Planner가 하나의 계획을 바로 실행하지 않고 세 개 정도의 대안 계획을 만든다. 기사(棋士)가 착수 전에 변화도를 여러 갈래 그려보는 것과 같다.
계획 A
TxGemma → Docking → MD → FEP
계획 B
GNN ensemble → ADMET → Docking → 합성
계획 C
AlphaFold 3 co-folding → pocket validation → Docking → MD
Shadow Planner는 각 계획의 예상 비용, 실패위험, 정보가치를 비교한다. 이후 저비용 sentinel calculation을 일부 실행해 가장 유망한 계획을 선택한다. 이는 복잡한 장기 workflow에서 초기에 잘못된 경로를 선택해 GPU 시간과 실험비를 낭비하는 문제를 줄인다.
Candidate Digital Twin
후보의 분신 — 같은 화합물도 단계마다 다른 것이다
같은 화합물이라도 계산 단계마다 상태가 달라진다.
- 원래 SMILES
- 표준화된 구조
- protonation state
- tautomer
- stereoisomer
- conformer
- docking pose
- solvated MD complex
- 합성된 실제 batch
- assay sample
이를 하나의 “Compound” 노드로 뭉치면 결과가 잘못 연결된다. 탁본과 원비(原碑)와 복제비를 한 항목에 밀어넣고 연대를 논하는 것과 같다. 따라서 각 후보에 Research Digital Twin을 생성한다.
Compound ├─ ChemicalState │ ├─ ProtonationState │ ├─ Tautomer │ └─ Stereoisomer ├─ StructuralState │ ├─ Conformer │ ├─ DockingPose │ └─ MDState ├─ MaterialState │ ├─ SynthesisBatch │ └─ Purity └─ EvidenceState ├─ Prediction ├─ Assay └─ Decision
이 구조는 docking 결과와 실제 assay 물질의 정체성이 어긋나는 문제를 막는다.
Replanning Policy
결과가 충돌할 때의 구체적인 재계획 규칙
| 관찰 결과 | 가능한 원인 | Agent의 다음 행동 |
|---|---|---|
| TxGemma는 강한 결합, docking은 약함 | OOD, 잘못된 구조 상태 | receptor·ligand 상태 검토 |
| Docking은 강함, MD에서 붕괴 | docking artifact | 재-docking 또는 제거 |
| MD는 안정적, FEP는 불리 | pose는 가능하지만 상대결합력 낮음 | analog 재설계 |
| FEP는 좋음, ADMET가 나쁨 | 효능–개발성 trade-off | Risk-to-Edit 수행 |
| ADMET는 좋음, 합성 불가능 | 구조적 제조 병목 | route-aware redesign |
| 계산은 모두 좋음, assay는 음성 | 기전·세포 접근성·모델 오류 | 반대가설 및 모델 보정 |
| biochemical assay 양성, cellular assay 음성 | permeability·efflux 문제 | 세포 노출 분석 |
| 세포효능 양성, target engagement 음성 | off-target 또는 assay artifact | counterscreen |
이 규칙은 LLM prompt에만 넣기보다 명시적인 decision policy와 학습 가능한 policy를 결합해야 한다.
Walkthrough
전체 실행 예시 — 백만 개에서 한 배치까지
초기 라이브러리가 100만 개라고 가정하자. 숫자는 설명을 위한 예시다.
1단계 · 저비용 사전선별
- KG 근거와 target relevance 검사
- TxGemma affinity·toxicity 예측
- GNN·QSAR ensemble
- chemical validity·PAINS 필터
100만 → 약 1만
2단계 · 구조 기반 선별
- receptor ensemble 구성
- 1만 개 후보 docking
- pose interaction 분석
- scaffold diversity 유지
1만 → 약 500
3단계 · 짧은 MD
- 즉시 붕괴하는 pose 제거
- 핵심 contact 유지 후보 선택
- 불확실한 후보는 추가 replica
상위 50~100 → 약 20~30
4단계 · FEP·고급 계산
- 동일 scaffold analog series 구성
- cycle closure 실패 후보 재계산
- uncertainty가 큰 edge 제거
- 실험값이 있으면 calibration
5단계 · ADMET·off-target
- TxGemma와 전문모델 ensemble
- applicability-domain 검사
- Safety Agent veto
- metabolite·CYP·hERG 분석
6단계 · 합성경로
- 공급 가능한 starting material
- 합성 단계와 예상 수율
- 위험반응·비용
- route-aware redesign
7단계 · 실험 batch 설계
- 최고성능 후보
- 다른 scaffold 대표
- 불확실성이 큰 후보
- 주가설을 반박할 negative control
- known positive control
8단계 · 결과 환류
- TxGemma·QSAR calibration
- docking score 보정
- 실패한 interaction 가설 기록
- 다음 analog batch 제안
실험 결과는 KG로 되돌아가 다음 판의 첫 수가 된다.
Novelty
잠재적 학술 신규성 — 무엇을 기여로 내세울 것인가
단순히 여러 도구를 연결했다는 사실만으로는 신규성이 약하다. 다음 여덟 요소를 연구기여로 명확히 정의하는 편이 좋다.
Graph-Native Scientific Planning
문헌 KG뿐 아니라 계산, 실패, 판단, 전문가 수정 이력까지 그래프에 저장하고 다음 계획에 이용한다.
Value-of-Information Adaptive Escalation
고정 파이프라인이 아니라 현재 불확실성·비용·위험을 기준으로 docking, MD, FEP, 실험 중 다음 행동을 선택한다.
Cross-Fidelity Contradiction Reasoning
TxGemma–GNN–docking–MD–FEP–assay 결과가 충돌할 때 이를 평균내지 않고 원인 가설과 추가 검증 계획을 생성한다.
Risk-to-Edit 및 Synthesis-aware Backpropagation
ADMET·합성 단계에서 발견된 문제를 분자 생성 단계의 구체적인 구조변경 명령으로 역전파한다.
Dissenting Scientist Agent
모든 가설에 대해 반대가설과 반증실험을 의무적으로 생성한다.
Negative-Result Memory
실패한 docking, 불안정한 MD, 합성 실패, assay 음성을 장기기억으로 사용해 같은 실패를 반복하지 않는다.
Hypothesis Portfolio Experiment Design
최고점 후보만 고르지 않고 성능, 화학적 다양성, 정보가치, 반증력을 함께 최대화하는 실험 batch를 설계한다.
Causal Credit Assignment
최종 assay 결과가 나왔을 때 어떤 데이터, 모델, tool call, agent 판단이 성공 또는 실패에 기여했는지 추적하고 각 구성요소의 신뢰도를 갱신한다.
Roadmap
구현 우선순위 — 순서를 지켜야 할 유일한 대목
앞에서 내내 고정 순서를 경계했지만, 시스템을 짓는 순서만큼은 지켜야 한다. 기초 없이 올린 누각은 단청이 아무리 화려해도 한 철을 못 넘긴다.
1단계 · 안전한 실행 기반
- typed tool registry
- hypothesis schema
- workflow state machine
- provenance 저장
- budget·permission gate
- deterministic validator
2단계 · Docking–MD 폐루프
- receptor·ligand state 관리
- docking history KG
- PLIP·ProLIF interaction
- sentinel MD
- 결과 충돌 감지
- 자동 재계획
3단계 · FEP–ADMET–합성
- FEP network planner
- ADMET ensemble
- applicability domain
- Risk-to-Edit
- retrosynthesis와 starting-material 검색
- Pareto optimization
4단계 · 실험 폐루프
- assay recommendation
- control·replicate 설계
- 실험결과 자동 수집
- negative-result KG
- 모델 calibration
- 다음 batch active learning