발견하는 AI,
검증하는 신약개발
AI Co-Scientist Research Watch: Discovery, Verification, and Private Experimental Evidence
ART, MolDesignBench, TopU-LBVS, AISB Bind를 통해 자율 발견과 현실적인 검증의 간격을 살핀다.
게시일: 2026-09-30 · 첨부 조사 기준: 2026-09-28. 원문에 명시된 개별 발표일과 검색 기간은 본문에 보존했다. 논문 결과, 기업 자체 발표, 아직 실행되지 않은 후속 연구 제안을 구분한다. 검색 범위에서 신규 결과가 확인되지 않았다는 판단은 관련 연구 전체의 부재를 의미하지 않는다.
연구 범위와 핵심 질문
AI Co-Scientist × 신약개발 최신 Research Watch — 2026년 9월 28일
지난 업데이트 이후인 9월 22–28일 공개 자료를 중심으로 다시 확인했다. 이번에는 의미 있는 변화가 4건 있다. 중요도는 ① AI agent swarm이 실제로 새 생물학적 시스템 후보를 발견한 Anthropic ART, ② 현실적인 molecular-design agent의 한계를 정량화한 MolDesignBench, ③ virtual-screening 성능 과대평가를 드러낸 TopU-LBVS, ④ 여러 제약사의 비공개 실험 데이터를 한 foundation model에 학습시키려는 AISB Bind 순으로 본다. 마지막 항목은 아직 결과 논문이 아니라 새로 시작된 대형 공동연구라는 점을 구분해서 볼 필요가 있다.
Autonomous AI Agents Discover Reverse Transcriptases with Tandem Repeat Arrays — “문헌에서 가설 생성”을 넘어 raw genome에서 발견
Peter H. Yoon et al., Anthropic technical preprint, 2026년 9월 23일.
Anthropic 공식 발표
Anthropic 공식 technical preprint PDF
핵심 기여. Claude agent 약 950개가 약 21시간 동안 2억1천만 토큰을 사용해 20만 개 이상의 reverse transcriptase(RT)를 조사하고, 약 3,500개의 후보 시스템을 추린 뒤 약 20개의 집중 검토 후보로 좁혔다. 그 과정에서 한 agent가 이미 알려져 있던 jumbo-phage RT 주변의 반복 DNA array와 별도의 partner gene을 발견했고, 연구진은 이를 array-associated reverse transcriptases, ART라는 새 시스템으로 정의했다. 초기 실험에서는 이 array가 서로 구별되는 짧은 RNA들로 발현되는 것도 확인됐다. 다만 ART의 실제 생물학적 기능과 RT 활성, RNA가 실제 substrate인지 여부는 아직 밝혀지지 않았다.
기존 연구 대비 차별점. Google Co-Scientist나 다수의 scientific-agent 시스템이 주로 literature/evidence → hypothesis를 수행했다면, 여기서는 agent가 대규모 raw DNA sequence를 직접 탐색하면서 사전에 지정되지 않은 이상 패턴을 발견했다. 특히 agent가 원래 partner-gene 탐색 문제를 수행하다가 직접 DNA flank를 읽고 tandem repeat를 포착했다는 점이 중요하다. 즉 scientific agent가 정해진 질문의 답을 찾는 도구에서 “무엇이 이상한지를 스스로 알아차리는 anomaly-driven scientist” 쪽으로 이동한 사례다.
그러나 이를 완전한 autonomous wet-lab Co-Scientist라고 부르면 과장이다. Anthropic은 모든 실제 실험을 사람이 수행했다고 명시한다. 현재 구조는 정확히는
Human research goal → Agent swarm genome mining → novel hypothesis → Human review → Human wet-lab test → Agent-assisted interpretation
이다.
신약개발 의미. 가장 직접적인 단계는 conventional small-molecule design 이전의 Target/Mechanism/Tool Discovery다. 동일한 방법을 metagenome, microbiome, resistance gene, orphan enzyme, novel protease, transporter, RNA-modifying enzyme 등에 적용하면 기존 annotation pipeline이 놓치는 새 therapeutic mechanism 또는 programmable biological machinery를 발굴할 가능성이 있다. ART 자체가 당장 신약표적이라는 의미는 아니지만, CRISPR·retron처럼 새로운 therapeutic modality로 발전할 수 있는 분자기계 탐색을 agent가 가속할 수 있다는 점이 중요하다.
주목할 연구 공백. 가장 중요한 것은 발견의 재현성이다. 동일 agent campaign을 반복했을 때 같은 이상을 얼마나 안정적으로 다시 찾는지, 놓친 유망 시스템은 몇 개인지, 그리고 agent의 “scientific taste”를 어떻게 calibration할지가 아직 명확하지 않다. 다음 단계는 agent swarm → uncertainty/diversity-aware candidate ranking → automated experiment selection → robotic validation → negative/positive-result memory → next search를 연결하는 prospective autonomous genome-mining laboratory다.
MolDesignBench — 현재 frontier LLM agent도 현실적인 분자설계에서는 성공률 약 43%
Yongjun Jeong et al., “MolDesignBench: Evaluating LLM-based Agent for Scenario-grounded Molecular Design,” arXiv:2609.27349, 2026년 9월 23일.
공식 arXiv 논문
이 연구는 새로운 molecule generator보다 현재 Agentic Drug Design의 실제 능력을 어디까지 믿어야 하는지 보여준다는 점에서 중요하다.
핵심 기여. MolDesignBench는 2,000개의 generation/optimization 문제와 17개의 chemistry tool을 제공한다. 기존 benchmark와 달리 네 가지를 동시에 평가한다. 즉 연구 문맥에서 숨어 있는 implicit constraint 해석, 여러 ADMET/물성 조건의 multi-constraint satisfaction, 애초에 풀 수 없는 요구를 알아채는 chemical infeasibility judgment, 그리고 중간 결과에 따라 도구 사용을 수정하는 adaptive multi-turn tool reasoning이다. 평가된 frontier/general/chemistry LLM 가운데 가장 좋은 agent도 성공률이 약 **43%**에 그쳤다.
Benchmark는 Fragment Screening, Hit Identification, Hit-to-Lead, Lead Optimization의 실제 discovery stage를 반영하며, feasible 문제뿐 아니라 약 10%의 의도적으로 불가능한 설계 조건을 포함한다. 이것이 특히 중요한데, 현실의 medicinal chemistry에서는 “무조건 molecule 하나를 내놓는 agent”보다 요구조건 자체가 모순됐다고 판단하고 멈추는 agent가 훨씬 안전하기 때문이다.
기존 연구 대비 차별점. 종전 benchmark는 흔히 “logP를 X 이하로”, “QED를 Y 이상으로”처럼 수치가 명시된 조건에서 최적화한다. MolDesignBench는 이를
Design brief → implicit requirements inference → feasibility check → tool selection → molecule generation/optimization → constraint verification
으로 바꾼다. 즉 molecular generation 능력보다 scientific specification reasoning을 평가한다.
신약개발 의미. 현재 LLM agent를 Hit-to-Lead나 Lead Optimization에서 “medicinal chemist 대체자”처럼 사용하기에는 아직 큰 격차가 있음을 보여준다. 특히 실패의 주요 원인이 molecule syntax가 아니라 숨은 요구조건 이해, 상충 조건 조정, 불가능성 판단, 잘못된 tool trajectory라는 것은 중요하다. 앞으로 drug-discovery agent의 경쟁력은 더 큰 LLM보다 typed constraints + deterministic chemistry tools + verification + abstention에 의해 결정될 가능성이 높다.
주목할 연구 공백. 현재 benchmark의 constraint들은 여전히 계산 가능한 property 중심이다. 실제 drug discovery에는 assay condition, protein pocket, metabolic pathway, selectivity, synthesis route, experimental noise까지 들어간다. 다음 단계는 Target/Pocket + Molecular Design + ADMET + Synthesis + Assay를 하나의 scenario로 묶고, 최종 molecule을 실제 실험으로 평가하는 prospective MolDesignBench다.
TopU-LBVS — 기존 virtual-screening benchmark가 AI 성능을 과대평가하고 있을 수 있다는 새 경고
Surbhi Kumar et al., “TopU-LBVS: A Realistic Multi Target Benchmark for Ligand Based Virtual Screening,” arXiv:2609.29740, 2026년 9월 24일.
공식 arXiv 논문
공식 코드
핵심 기여. ChEMBL 35를 기반으로 93개 protein target, 7개 target class를 구성하고, 각 active에 대해 단순 random negative가 아니라 physicochemical property가 비슷하고 구조적으로도 유사한 hard negative/decoy를 1:40 비율로 배치했다. fingerprint, GNN, hybrid, 최신 molecular model을 포함한 10개 baseline을 비교한 결과, random-decoy 환경에서 좋아 보이던 성능이 hard-negative 조건으로 바꾸면 크게 떨어졌다.
기존 연구 대비 차별점. 기존 virtual-screening benchmark는 inactive가 active와 너무 다르면 모델이 실제 binding biology가 아니라 분자크기·lipophilicity·fingerprint similarity 같은 shortcut만 배워도 높은 score를 낼 수 있다. TopU-LBVS는 의도적으로 이런 쉬운 구별을 제거한다.
즉 평가 질문이
“active와 무관한 molecule을 구별할 수 있는가?”
에서
“active와 매우 비슷하지만 실제로는 inactive인 molecule을 구별할 수 있는가?”
로 바뀐다. 이것은 실제 medicinal-chemistry chemical series에 훨씬 가깝다.
신약개발 의미. AI Co-Scientist가 수십억 개 virtual library를 screening할수록 false positive의 경제적 비용이 커진다. 따라서 Hit Identification에서 중요한 것은 headline ROC-AUC보다 hard-negative enrichment, activity-cliff robustness, calibration, prospective hit rate다. 이 benchmark는 “Foundation Model을 붙였더니 성능이 올랐다”는 주장 자체를 더 엄격하게 검증하게 만든다.
주목할 연구 공백. 현재 TopU-LBVS는 ligand-based screening이다. 다음 단계는 3D pocket/co-folding model + ligand representation + assay context + hard negatives를 통합한 realistic multimodal screening benchmark다. 여기에 prospective assay 결과까지 연결하면 scientific FM의 실제 utility 평가에 훨씬 가까워진다.
AISB Bind — 제약사 비공개 affinity·HTS 데이터를 federated foundation model에 넣으려는 산업 연구가 시작
AI Structural Biology Network / Apheris, AISB Bind, 2026년 9월 22일 공식 발표. 이것은 아직 성능 결과가 나온 논문은 아니고 새롭게 시작된 공동연구 프로그램이다.
AISB Bind 공식 발표
핵심 변화. AbbVie, AstraZeneca, Bristol Myers Squibb, Johnson & Johnson이 각자의 데이터를 외부로 이동시키지 않은 채 하나의 binding model을 federated하게 학습한다. 데이터는 실험 구조, quantitative affinity/potency, high-throughput screening activity를 포함하고, 특히 대량의 experimentally confirmed non-binder가 들어간다는 점이 중요하다. 학습은 2026년 9월 시작됐으며 최종 모델은 2027년 초가 목표다.
이는 앞선 AISB Federated OpenFold3 프로젝트가 2만 개 이상의 proprietary structure를 이용해 protein–ligand 구조 예측을 개선한 다음 단계다. 이번에는
Where does it bind? → How strongly / whether does it bind?
로 넘어간다. 기존 initiative에서 high-quality interface prediction이 약 36%에서 52%로, correct ligand pose가 약 29%에서 47%로 상승한 결과가 후속 투자의 근거가 됐다.
기존 연구 대비 차별점. 지금까지 많은 공개 drug foundation model의 병목은 architecture보다 industrial negative data의 부재였다. 공개 PDB에는 성공적으로 구조가 잡힌 positive example이 과대표집되고, “수십만 개를 시험했지만 결합하지 않았던 molecule”은 거의 공개되지 않는다. AISB Bind는 이 negative evidence를 처음부터 주요 학습 신호로 취급한다.
신약개발 의미. 성공한다면 Virtual Screening과 Lead Optimization에서 가장 중요한 두 문제인 binder/non-binder discrimination과 동일 chemical series 내부 affinity ranking을 개선할 수 있다. 또한 여러 회사의 데이터는 공유하지 않으면서 model만 협업 학습하는 방식은 향후 ADMET, toxicity, antibody developability, clinical-response model에도 확장 가능하다.
주목할 연구 공백. 아직 결과가 없으므로 현재는 가능성에 불과하다. 2027년에 봐야 할 것은 단순 평균 성능이 아니라 새 target, 새 scaffold, assay shift에서의 calibration, 독립 blind benchmark, 회사별 data heterogeneity, membership/data leakage 위험, 그리고 federated model이 각 회사의 single-company model보다 실제 prospective DMTA 비용을 줄이는가이다.
이번 주 흐름을 한 문장으로 정리하면
이번 주의 변화는 “더 큰 scientific foundation model” 자체보다 Agent가 무엇을 발견할 수 있는가, 우리가 agent 성능을 제대로 측정하고 있는가, 공개 데이터만으로는 풀리지 않는 drug discovery 문제를 어떻게 학습시킬 것인가 쪽으로 중심축이 이동한 것이다.
특히 세 축이 선명해졌다.
Autonomous discovery — ART는 agent가 raw biological data에서 예상하지 못한 anomaly를 찾아낼 수 있음을 보여준다.Realistic verification — MolDesignBench와 TopU-LBVS는 기존 benchmark가 chemical agent와 screening model의 능력을 지나치게 낙관적으로 평가했을 가능성을 보여준다.Private experimental evidence — AISB Bind는 다음 세대 drug FM의 성능 병목이 parameter 수가 아니라 실제 제약 R&D에서 축적된 positive + negative evidence에 대한 접근일 수 있음을 보여준다.
반면 이번 9월 22–28일 검색 범위에서는, 이전에 추적한 것들을 넘어서는 새로운 대형 과학특화 multimodal biomolecular foundation model이나, AI hypothesis → autonomous wet-lab execution → result interpretation → belief revision → next experiment를 사람 개입 없이 여러 cycle 반복한 완전한 drug-discovery closed-loop Co-Scientist의 신규 결과는 확인되지 않았다. Anthropic ART가 그 방향으로 상당히 진전했지만, 실험 단계는 아직 사람이 수행한다는 점이 현재의 명확한 경계다.
자료와 출처
구성 자료: AI Co-Scientis-Trends-0930.md. 첨부의 모든 연구 항목, 비교, 수치, 표, 수식, 한계와 후속 연구 제안을 수록했다. 대화 시스템의 인용 표시와 알림 문구는 편집 과정에서 제거했다. 본문 링크는 해당 자료로 연결된다.