AI Research · Robin · Lab-in-the-loop Discovery26 Aug 2026 · Seoul
Nature · 2026/Multi-Agent Scientific Discovery/Drug Repurposing/Lab-in-the-loop

가설에서 실험으로, 실험에서 다시 가설로

A Multi-Agent System for Automating Scientific Discovery

AuthorsAli E. Ghareeb · Benjamin Chang · Ludovico Mitchener · et al.
JournalNature 655, 497–505
Published19 May 2026
DOI10.1038/s41586-026-10652-y
Central thesis

과학을 자동화한다는 말은 논문 요약을 빠르게 만든다는 뜻과 다르다. 과학은 가설을 세우고, 실험을 선택하고, 데이터가 예상과 다르면 생각을 고치는 일이다. Robin은 이 순환을 하나의 multi-agent workflow로 연결해 실제 생물학 실험과 맞물리게 한 시스템이다.

논문의 사례는 dry age-related macular degeneration(dAMD)이다. Robin은 문헌에서 RPE(retinal pigment epithelium) phagocytosis를 치료전략으로 골랐고, 인간 연구팀이 수행할 assay를 제안했으며, 실험데이터를 Finch가 분석했다. 그 결과는 다음 후보생성에 다시 들어갔다. 이 반복에서 ripasudil과 KL001이 hit로 확인되고, RNA-seq 후속실험에서는 ABCA1 upregulation이라는 새로운 mechanistic clue가 드러났다.

Epistemic boundary

Robin은 완전 자율 실험실이 아니다. 실험 자체는 인간이 수행했고, 초기 assay에서는 시스템의 제안을 연구자가 현실적 조건에 맞게 수정했다. 따라서 이 논문의 중요한 성취는 “사람 없는 과학”이 아니라, 문헌 기반 가설생성·실험방향·데이터분석·가설갱신의 지적 루프를 실제 wet-lab 증거와 연속적으로 연결했다는 데 있다.

Part I · Why This Matters

지식은 쌓였지만, 연결은 늦다

Drug discovery의 병목 중 하나는 데이터가 없어서가 아니라, 흩어진 사실을 제때 연결해 검증 가능한 가설로 바꾸는 인지적 노동이다.

§1 · The synthesis gap

과학적 발견은 정보량보다 연결 속도에 막힐 수 있다

생물학은 측정하고 교란하고 모델링하는 능력을 빠르게 늘려왔다. 그러나 그 지식을 해석하고, 서로 다른 분야의 문헌을 합성하고, 새로운 가설로 전환하는 기술은 같은 속도로 커지지 않았다. 신약개발은 특히 생물학·임상·약리학의 지식을 동시에 엮어야 하므로, 문헌을 읽는 사람의 시간과 전문영역의 경계가 실질적인 병목이 된다.

논문은 drug repurposing의 지연을 이 문제의 좋은 사례로 든다. dabrafenib의 BRAF 억제기전은 일찍 알려졌지만 hearing-loss protection은 10년 뒤 high-throughput screening을 통해 발견됐다. ketamine, leucovorin, KarXT에서도 핵심 insight가 문헌에 존재한 뒤 새로운 치료용도로 연결되기까지 수년에서 수십 년의 지연이 있었다.

Robin의 기본 가정은 단순하다. 세상에 없는 사실을 마법처럼 만들어내기보다, 이미 흩어져 있는 사실 사이의 비자명한 연결을 더 빠르게 찾아 실험으로 넘기자는 것이다.
§2 · Prior gap

기존 AI는 과학의 한 조각을 자동화했다

이전의 LLM 기반 과학시스템은 hypothesis generation, retrieval, property prediction, coding, 또는 특정 drug-discovery task를 자동화했다. multi-agent decomposition, domain-specific fine-tuning, external tools, human feedback도 이미 사용되고 있었다. 그러나 논문이 문제로 삼는 것은 이 구성요소들이 한 번의 실제 실험을 사이에 두고 다시 연결되는가였다.

Robin은 literature-grounded hypothesis generation과 biological laboratory data analysis를 같은 feedback system에 넣는다. target disease 하나가 입력되면 assay를 고르고 candidate를 제안하며, 실험 후에는 raw 또는 semi-processed data를 분석하고, 그 결과로 다음 hypothesis cycle을 시작한다.

Part II · Robin Architecture

세 에이전트가 읽고, 평가하고, 데이터를 해석한다

Robin은 하나의 만능 LLM보다 역할이 분리된 literature agents와 data-analysis agent를 orchestrate한다. 중요한 것은 agent 수가 아니라 각 단계의 evidence interface다.

§3 · Crow, Falcon, Finch

간결한 검색, 깊은 검토, 실행 가능한 분석

Crow

PaperQA2 기반 concise literature search agent다. 질병기전, in vitro model, assay와 candidate 탐색에 필요한 빠른 문헌리뷰를 수행한다.

Falcon

각 therapeutic candidate를 더 깊게 검토한다. 과학적 근거, pharmacological profile, supporting literature의 방법론, 잠재적 한계를 종합한 report를 만든다.

Finch

Jupyter-native data-analysis agent다. flow cytometry와 RNA-seq 같은 실험데이터에 대해 Python/R 코드를 생성·실행하고 해석 가능한 분석결과를 만든다.

Crow와 Falcon은 scientific literature, clinical-trial reports, Open Targets Platform을 활용하는 PaperQA2 계열의 검색능력을 바탕으로 한다. Finch는 Aviary execution environment 안에서 직접 코드를 작성한다. 즉 한쪽은 evidence retrieval과 synthesis, 다른 한쪽은 empirical data에 대한 computation을 맡는다.

§4 · From disease to testable hypothesis

질병명 하나가 바로 약물목록으로 변하지 않는다

InputTarget disease: dAMD
Mechanism explorationRobin이 pathology 질문을 만들고 Crow reports를 이용해 10개의 잠재적 causal mechanism을 제안한다.
Assay selection각 mechanism을 시험할 in vitro model을 조사하고 pairwise tournament로 ranking한다.
Candidate generation선택된 assay를 기준으로 30 therapeutic candidates를 제안한다.
Deep evaluationFalcon이 candidate별 supporting evidence와 limitation report를 만들고 LLM-judged tournament가 ranking한다.
Human review + lab연구자가 ranked list를 검토하고 실제 실험 protocol을 수행한다.
§5 · LLM judge

점수 하나보다 pairwise comparison을 쓴다

Robin의 ranking은 Claude 3.7 Sonnet judge가 hypothesis pair를 비교하고, 그 결과를 Bradley–Terry–Luce(BTL) model로 집계하는 방식이다. 후보가 25개 이하이면 가능한 pair를 모두 비교하고, 더 많으면 300개의 pair를 무작위로 선택한다. 저자들은 pointwise grading보다 pairwise comparison이 미묘한 차이를 구분하는 데 더 robust할 수 있다는 기존 연구를 근거로 든다.

judge prompt는 domain experts의 실제 pairwise judgments를 Gemini 2.5 Pro Preview에 입력해 생성했다. expert top-10과 LLM judge top-10은 평균 7.25개가 겹쳤고, 동일한 pair를 반복 제시했을 때 judge의 선택일치율은 88%, human experts는 61%였다.

Implementation nuance

Robin은 실험 당시 agentic하게 구현됐지만 실제로는 거의 항상 같은 순서로 tools를 호출했다. 연구팀은 안정성과 사용성을 높이기 위해 이를 streamlined Jupyter notebook으로 옮겼다. “agentic”이라는 말이 반드시 매번 자유로운 planning을 뜻하지 않는다는 중요한 설계사례다.

Part III · The dAMD Discovery Loop

문헌 속 연결을 실험으로 밀어 넣다

Robin의 진짜 시험은 “좋은 문장을 쓰는가”가 아니라, 제안한 가설이 wet-lab measurement를 통과하고 그 결과가 다음 가설을 바꾸는가였다.

§6 · Choosing the mechanism

RPE phagocytosis를 치료전략으로 선택하다

Robin은 dAMD 관련 151편의 논문을 검토해 10개의 biologically relevant mechanisms와 assay 전략을 제안했다. ranking 결과, retinal pigment epithelium(RPE)의 phagocytic capacity를 높이는 전략을 선택했다. 이후 Crow가 RPE phagocytosis와 dAMD therapeutic landscape에 관한 약 400편의 문헌을 추가로 검토했고, Robin은 30개의 기존 약물을 후보로 제안했다.

첫 실험에는 top five인 exendin-4, fingolimod, MFGE8, Y-27632, AICAR+TUDCA가 들어갔다. MFGE8은 RPE phagocytosis 증가가 이미 알려진 positive control이었다.

Human intervention

Robin은 fluorescently labelled photoreceptor outer segments와 primary 또는 stem-cell-derived RPE 사용을 제안했다. 그러나 연구팀은 초기 screen을 빠르게 수행하기 위해 available한 pHrodo beads와 ARPE-19 cell line을 사용했다. 이 선택은 Robin이 lab-in-the-loop이지 robot lab이 아님을 보여준다.

§7 · Round 1

Y-27632에서 기전 질문이 생긴다

drug-treated RPE cells의 phagocytosis는 flow cytometry로 측정됐다. 실험 후 raw data와 metadata가 Robin에 들어갔고, Finch가 gating, statistical test, visualization을 포함한 Jupyter notebook 분석을 만들었다. human scientist의 독립 분석도 같은 결과를 확인했다.

Y-27632는 알려진 ROCK inhibitor이며 preclinical work에서도 RPE phagocytic efficiency를 회복시킬 수 있다는 근거가 있었다. 여기서 Robin은 한 단계 더 나아가 “왜 ROCK inhibition이 phagocytosis를 높이는가”를 묻고 follow-up RNA-seq를 제안했다.

§8 · RNA-seq

후보약물에서 새로운 target clue로

Y-27632-treated ARPE-19 cells의 bulk RNA-seq를 Finch가 differential gene expression과 Gene Ontology 관점에서 분석했다. eight-trajectory consensus에서 반복적으로 나타난 pathway는 actin filament organization, small GTPase-mediated signalling, autophagy 관련 과정이었다.

가장 눈에 띄는 결과 중 하나는 ABCA1의 약 3배 upregulation이다(adjusted P = 2.13 × 10−83). ABCA1은 cholesterol·phospholipid efflux에 관여하고, 그 lipid acceptor인 APOE는 macular degeneration susceptibility와 연관돼 있다. 저자들은 이를 dAMD에서 추가 탐색할 수 있는 mechanistic clue로 해석한다.

Caution

논문도 autophagy에 대한 효과는 추가 검증이 필요하다고 명시한다. DGE와 enrichment가 기전을 확정하는 것은 아니다. 이 단계의 가치는 “분자기전이 증명됐다”기보다 다음 실험에서 확인할 수 있는 구체적 target과 pathway가 생겼다는 데 있다.

§9 · Round 2

ripasudil과 KL001이 나온다

첫 실험의 결과를 다시 literature context에 넣은 Robin은 두 번째 candidate cycle을 수행했다. 연구팀은 이 중 10개를 다시 실험했다. Finch 분석에서 glaucoma 치료에 승인된 ROCK inhibitor인 ripasudil이 ARPE-19에서 DMSO 대비 RPE phagocytosis를 1.89배 증가시켰고, human analysis는 1.75배 증가를 보였다.

dose–response에서 ripasudil은 Y-27632보다 더 높은 potency를 보였다. ARPE-19에서는 fitted EC50 기준 약 2.5배, primary RPE-SC에서는 그림에 보고된 fit 기준 약 713배의 차이가 제시된다. 다만 표본은 ARPE-19 n=3 wells, RPE-SC n=4 wells로 작고, 이 수치는 in vitro assay에서의 potency 비교다.

또 다른 hit는 circadian clock modulator인 KL001이었다. 저자들에 따르면 KL001을 RPE phagocytosis enhancer로 제안한 선행연구는 없었다. Robin은 RPE phagocytosis가 circadian control을 받는다는 문헌을 연결해 이 후보를 제안했다.

§10 · Primary-cell validation

cell line에서 aged human RPE로 한 단계 이동하다

연구팀은 60세 이상 donor에서 얻은 primary RPE stem cells(RPE-SCs)를 성숙 monolayer로 배양하고 canonical RPE markers와 phagocytosis machinery를 immunocytochemistry로 확인했다. transwell에서 basolateral VEGF secretion을 보이는 기능적 phenotype도 확인했다.

초기 screen의 beads 대신 fluorescently labelled bovine rod outer segments(ROSs)를 사용해 후보들을 다시 시험했을 때, ripasudil과 Y-27632가 다시 hit였고 ripasudil의 더 높은 potency가 재현됐다. KL001도 RPE-SC에서 hit로 확인됐다. ripasudil 또는 vehicle-treated RPE-SC RNA-seq에서도 ABCA1 upregulation이 다시 나타났다.

cytotoxicity 측정에서는 Y-27632 dose와 LDH release의 관계가 없었고(ANOVA P=0.12), ripasudil은 dose가 증가할수록 LDH release가 감소하는 negative association이 보고됐다(ANOVA P=0.038; Spearman ρ=−0.73, P=0.0002).

Part IV · Finch and Data Analysis

하나의 분석답이 아니라 여러 분석경로의 합의를 만든다

Biological data analysis는 parameter와 analyst choice에 민감하다. Robin은 agent stochasticity를 제거하려 하지 않고, 여러 trajectory로 펼친 뒤 consensus를 만든다.

§11 · Eight trajectories

stochasticity를 오류가 아니라 탐색다양성으로 쓴다

flow-cytometry gating이나 RNA-seq filtering은 분석자마다 다를 수 있고, language agent도 같은 prompt와 data에서 run-to-run variation을 낸다. Robin은 Finch trajectory를 8개 병렬로 실행해 각각 독립적으로 데이터를 분석하게 한다. 각 trajectory는 Jupyter notebook에서 실행코드를 남기고, 마지막에 meta-analysis가 outputs를 consensus conclusion으로 합친다.

\[\text{Data}\rightarrow\{\text{Finch}_1,\ldots,\text{Finch}_8\}\rightarrow\text{Consensus}\rightarrow\text{Scientific Insight}\]

이 구조의 장점은 single stochastic path의 우연한 decision을 바로 science claim으로 올리지 않는다는 데 있다. 논문 Figure 3은 RNA-seq에서 특정 gene을 여러 trajectory가 얼마나 일관되게 up/downregulated로 찾았는지를 별도로 보여준다.

§12 · How Finch works

template retrieval보다 실행가능한 분석코드를 직접 쓴다

Finch는 Aviary framework 위의 Jupyter-native agent다. static analysis template을 꺼내 쓰는 방식이 아니라 데이터와 질문에 맞춰 Python 또는 R code를 한 줄씩 생성하고 실행한다. prompting은 ReAct style을 사용하며, BixBench-env:v1.0 Docker container 안의 bioinformatics-oriented Python/R/Bash libraries를 활용한다.

agent가 직접 사용하는 tool은 edit_cellsubmit_answer 두 가지다. 첫째는 notebook cell을 수정하고 실행하는 도구, 둘째는 최종 분석결론을 제출하는 도구다. 표준화된 container는 dependency 설치나 OS 차이보다 analytical reasoning 자체를 평가하기 위한 장치다.

§13 · Benchmarking Finch

workflow-specific prompt에서는 강하지만, 일반 bioinformatics는 아직 어렵다

RNA-seq rubric
86 ± 0%

Robin-specific prompt, n=3 runs.

Flow cytometry
100 ± 0%

expert rubric adherence, n=3.

BixBench overall
22.8 ± 1.7%

170 drug-discovery-relevant questions.

Base LLM
1.6 ± 1.2%

Claude Sonnet 3.7 without harness.

BixBench subset에서 Finch는 biostatistics 47.9 ± 1.5%, bioinformatics 15.3 ± 2.0%였다. 후자의 task는 multi-step pipeline과 parameterization을 더 많이 요구했다. agent harness가 tools와 data access를 제공하면 base LLM보다 크게 좋아지지만, multi-step biological analysis에는 여전히 큰 개선공간이 남는다.

Important boundary

RNA-seq에서 모든 단계가 Finch가 한 것은 아니다. raw read demultiplexing·alignment와 gene-count processing은 human-generated pipeline이 수행했고, subsequent differential gene expression analysis를 Finch가 맡았다. “autonomous analysis”를 해석할 때 이 분업을 놓치면 안 된다.

Part V · Validation

에이전트는 많다고 좋은 것이 아니다. 역할이 실제로 필요한지 검증해야 한다

논문은 Crow·Falcon ablation, Finch benchmark, general-purpose Deep Research 비교를 통해 specialized harness가 어떤 가치를 더하는지 시험한다.

§14 · Literature-agent ablation

Falcon의 깊은 검토는 hallucinated references를 거르는 역할도 한다

연구팀은 Crow 또는 Falcon을 제거하고 같은 자리에서 o4-mini를 호출하는 ablation을 만들었다. 50개의 drug candidate proposals를 생성하고 human reference check와 LLM tournament를 수행했다.

Falcon을 제거하거나 Crow와 Falcon을 모두 제거하면 hallucinated references가 크게 늘었다. 특히 assay proposals에서 Crow를 o4-mini로 대체한 조건은 44.5 ± 6.37%(n=15)의 references가 hallucinated로 판정됐지만, Crow가 만든 assay reports에서는 human check상 hallucinated reference가 없었다. drug proposal quality도 Crow, Falcon, 둘 모두를 ablate한 세 조건에서 모두 악화됐다.

이 결과는 retrieval agent를 붙이는 이유가 “더 많은 논문을 읽기 위해서”만은 아님을 보여준다. evidence provenance와 citation fidelity 자체가 agent architecture의 기능이다.

§15 · Deep Research comparison

범용 research agent가 같은 후보발견을 재현하지 못했다

연구팀은 OpenAI Deep Research에 Robin과 같은 candidate-generation prompt를 주고, 19개의 novel candidates를 요청했다. Deep Research는 중복 2개를 포함해 17 unique candidates를 제안했다. 이들을 같은 RPE-SC phagocytosis assay에서 screening했지만 hit는 없었고, ROCK inhibition도 phagocytosis enhancement strategy로 제안하지 않았다.

Interpretation caution

이 비교는 한 질병·한 assay·한 시점의 system configuration에 대한 결과다. 따라서 “specialized agent가 항상 general-purpose agent보다 낫다”는 보편명제를 증명하지 않는다. 다만 이 setting에서는 literature-agent specialization과 structured iteration이 실제 candidate quality에 연결됐다는 증거다.

§16 · Time and cost

가장 큰 단축은 wet-lab이 아니라 cognitive labour에서 나온다

Papers synthesized
≈551

typical run의 unique-paper 규모.

Literature time
≈30 min

human estimate는 약 294 h.

Cognitive workflow
< 2 h

human estimate 359–424 h.

LLM-call cost
$10.76

45 Crow + 30 Falcon calls 기준.

저자들은 전체 intellectual workflow에서 약 200배 time reduction을 추정한다. 그러나 이는 wet-lab incubation, cell culture, sequencing time을 없앴다는 뜻이 아니다. Table 1은 literature synthesis, ideation, experimental planning, bioinformatics setup, exploratory analysis, interpretation 같은 cognitive time을 비교한 것이다. 실험설계의 실제 lab protocol은 인간이 담당했다.

Part VI · Methods & Reproducibility

“AI가 발견했다”는 주장 뒤에는 실험설계와 재현성의 세부가 있다

Nature의 main text와 reporting summary는 model name보다 sample, cell line, sequencing, blinding, code/data availability를 더 구체적으로 기록한다.

§17 · Model stack

Robin은 frontier models를 한 역할로 쓰지 않는다

ComponentModel / frameworkRole
Robin orchestrationAviary + Jupyter notebookworkflow control, synthesis, hypothesis generation
Core LLMOpenAI o4-miniliterature synthesis and hypothesis generation
Ranking judgeAnthropic Claude 3.7 Sonnetpairwise comparison of hypotheses
Judge-prompt designGoogle Gemini 2.5 Pro Previewdomain-expert preference examples에서 judge prompt 생성
Literature agentsCrow / Falcon, PaperQA2 familyconcise and deep evidence retrieval
Data analysisFinch + Aviary + DockerJupyter code generation/execution and result synthesis
§18 · Biological experiments

ARPE-19 screen에서 primary RPE-SC validation으로

ARPE-19 cells는 ATCC에서 공급받았고, initial phagocytosis screen은 96-well plate에서 수행됐다. pHrodo-labelled particles는 lysosome의 low-pH environment에서 fluorescence가 활성화되어 phagocytosis readout으로 사용됐다. drug treatment 1시간 뒤 particles를 넣고 3시간 배양한 후 flow cytometry로 측정했다.

primary RPE-SC는 Eye-Bank for Sight Restoration에서 제공된 60세 이상 단일 donor tissue에서 얻었다. 이 세포는 immunocytochemistry로 MiTF, OTX2, RPE65, BEST1, integrin αvβ5, MERTK 등을 확인했고, transwell culture에서 basolateral VEGF secretion을 보이는 RPE phenotype을 검증했다.

RPE-SC validation에서는 pHrodo beads 대신 pHrodo-labelled bovine ROS를 사용했다. initial ARPE-19 screen은 n=3 wells, RPE-SC screen은 donor-cell availability 때문에 n=4 technical replicates를 사용했다.

§19 · RNA-seq and statistics

분석 pipeline의 사람과 agent 경계를 기록한다

ARPE-19 RNA-seq는 polyA mRNA library를 만들고 Illumina NextSeq 2000으로 sequencing했다. raw paired-end reads의 alignment에는 HISAT2, BAM processing에는 samtools, gene-level quantification에는 featureCounts가 사용됐다. DGE는 DESeq2로 수행했고, volcano plot threshold는 |log2FC| > 1 및 adjusted P < 0.05였다.

RPE-SC에서 ABCA1 finding을 재검증한 RNA-seq는 3′-end counting 방식으로 약 1천만 deduplicated reads(약 2천만 raw reads) per sample을 생성했다. UMI clustering을 통해 PCR duplicates를 제거한 gene counts를 사용했다.

reporting summary에 따르면 initial sample size는 pilot study에서 MFGE8 positive control과 vehicle control을 안정적으로 구분할 수 있었던 3 replicates를 기준으로 정했고, RPE-SC에서는 available clinical material을 최대한 활용하기 위해 4 replicates를 썼다. data exclusion은 없었고, randomization은 N/A로 보고됐다. wild-type vs ablated Robin reference check에서는 proposal source를 scientist에게 blind 처리했다.

§20 · Open science

code와 raw RNA-seq를 공개한다

raw RNA-seq data는 NCBI Sequence Read Archive의 BioProject PRJNA1464762에 deposited됐다. Robin sample trajectories와 code는 FutureHouse의 Robin repository, Finch는 별도 Finch repository에서 공개됐다.

논문은 또한 저자 일부가 FutureHouse의 spin-out인 Edison Scientific 지분을 보유한다고 competing interests에 공개한다. 이 연구는 Eric and Wendy Schmidt의 지원을 받았다.

Part VII · Limits, Guardrails & Meaning

자동화된 과학에서 가장 중요한 단어는 “자동화”가 아니라 “수정 가능성”이다

Robin은 성공사례를 보여주지만, 동시에 executable protocol, expert prompting, in vivo validation, biological generalization이라는 선명한 경계를 남긴다.

§21 · What remains human

실험은 아직 인간의 손과 판단을 통과한다

  • 정밀한 lab protocol: Robin은 experimental outline을 만들지만 현재 implementation은 바로 실행 가능한 상세 protocol을 생성하지 않는다.
  • wet-lab execution: 연구자들이 candidate를 검토하고 cell culture, drug treatment, flow cytometry, sequencing을 수행한다.
  • assay adaptation: 초기 실험에서는 Robin이 추천한 primary/stem-derived RPE와 outer segments 대신 ARPE-19와 pHrodo beads를 현실적 이유로 선택했다.
  • Finch prompting: reliable analysis를 위해 domain-expert prompt engineering에 의존한다.
  • clinical validity: ripasudil과 KL001의 dAMD 치료효과는 적절한 disease model, in vivo validation, 궁극적으로 randomized placebo-controlled trial을 거쳐야 한다.
§22 · Biological limitations

강한 narrative와 작은 wet-lab sample을 구분해야 한다

주요 phagocytosis experiments는 n=3 또는 n=4 wells로 수행됐다. primary RPE-SC는 60세 이상 single donor에서 유래했다. 결과는 ARPE-19에서 primary human RPE로 한 단계 확장됐지만, donor diversity나 patient heterogeneity를 대표하는 규모는 아니다.

ripasudil의 safety profile과 ocular clinical approval은 repurposing의 장점이지만, 이 논문이 dAMD에서 clinical efficacy를 입증한 것은 아니다. KL001도 phagocytosis enhancer로서 흥미로운 hit이지만 clinical candidate라는 뜻은 아니다. 논문 자체도 in vivo와 clinical validation을 명시적으로 요구한다.

§23 · Safety and dual use

후보를 찾는 능력은 안전장치와 함께 설계된다

Robin은 established safety profile이 있는 candidates를 우선하고 known toxicity와 off-target interactions를 검색한다. 모든 output은 therapeutic hypothesis로 취급되어 traditional in vitro/in vivo preclinical safety filter를 거치게 된다. underlying LLM은 기존 safety alignment가 적용된 모델을 사용하며, platform queries에는 unsafe topics를 검사하는 LLM classifier가 추가된다.

이 guardrail은 자동화된 discovery에서 “모델이 말한 것”과 “실험해도 되는 것” 사이에 별도의 governance layer가 필요하다는 사실을 보여준다.

§24 · Scientific significance

Robin이 증명한 것은 ‘AI가 과학자가 됐다’가 아니다

이 논문에서 더 흥미로운 점은 agent가 551편을 빨리 읽었다는 사실보다, 새로운 실험결과가 다음 literature search와 candidate generation의 context가 되었다는 데 있다. 검색, 생성, 분석이 서로 독립된 도구가 아니라 하나의 belief-update loop를 형성한다.

연구팀은 이를 ‘combinatorial synthesis’라고 설명한다. 각 분야에 이미 있는 사실을 연결해 human specialization이 놓치기 쉬운 low-hanging fruit를 찾는 접근이다. 이는 drug repurposing뿐 아니라 materials science 같은 다른 분야로도 확장할 수 있다는 것이 저자들의 전망이다.

\[\text{Literature}\rightarrow\text{Hypothesis}\rightarrow\text{Experiment}\rightarrow\text{Evidence}\rightarrow\text{Revised Hypothesis}\]
Final synthesis

AI Co-Scientist의 핵심은 “그럴듯한 가설을 많이 내는 능력”이 아니다. 증거를 찾고, 실험으로 외부 세계에 질문하고, 돌아온 데이터가 처음 생각을 지지하지 않아도 다음 가설을 바꿀 수 있어야 한다. Robin은 그 루프의 상당 부분을 실제 생물학 안에서 작동시켰다. 이제 남은 문제는 이 루프를 더 정확하고, 더 자율적이고, 더 안전하며, 더 반증 가능하게 만드는 일이다.

Selected References & Resources

01
Ghareeb et al. · Nature 655, 497–505 · 2026
이 글의 1차 자료. Robin의 architecture, dAMD lab-in-the-loop discovery, validation, Methods와 Extended Data를 보고한다.
02
Code repository
Robin sample trajectories와 system code.
03
Code repository
Jupyter-native scientific data-analysis agent implementation.
04
FutureHouse · literature-agent infrastructure
Crow와 Falcon의 literature retrieval/synthesis 기반이 되는 공개 프로젝트.
05
Mitchener et al. · 2025
Finch의 일반적인 bioinformatics·biostatistics 분석능력을 평가하는 benchmark.
06
Narayanan et al. · 2024
Robin과 Finch의 agent execution environment에 사용된 framework.
07
Gottweis et al. · 2025
multi-agent hypothesis generation과 scientific reasoning을 다루는 인접 AI Co-Scientist 연구.
08
Wang et al. · 2025
therapeutics-specific language models와 agentic tool use의 인접 연구.
09
Automated Hypothesis Validation with Agentic Sequential Falsifications
Huang et al. · ICML · 2025
가설을 sequential falsification으로 검증하는 agentic scientific reasoning의 관련 연구.
10
ReAct: Synergizing Reasoning and Acting in Language Models
Yao et al. · ICLR · 2023
Finch의 reasoning-and-execution prompting strategy 배경.
11
Therapeutic evidence platform
Robin literature agents가 활용하는 therapeutic evidence source 중 하나.
12
Raw RNA-seq data
논문에서 생성한 RNA-seq data의 공개 accession.