AI Research NotesCo-Scientist · Hardware · AI4AI · Workflow Verification
AI Co-Scientist × Drug DiscoveryResearch Update · 29 Aug 2026Agentic Science · AI4AI · Wet Lab

AI가 모델을 고치고,
실험을 실행하고,
완료 여부까지 검증하는 단계

From Digital Tool Use to Self-Improving Experimental Co-Scientists

Self-Improving Experimental AI Co-Scientist LoopScientific foundation model과 multi-agent가 과학 모델을 개선하고, MHS를 통해 실험을 실행하며, 관찰과 검증 결과를 scientific memory에 저장해 다시 가설과 모델을 수정하는 구조 SCIENTIFIC FM+ KNOWLEDGEMULTI-AGENTMODEL RESEARCHAGENTFOLDPHYSICAL ACTMHSVERIFY WORKFRONTIERSCIENTIFIC MEMORY+ REVISION Model → Experiment → Evidence → Memory → Better Model
Central Thesis

2026년 8월 말의 변화는 새로운 거대 모델 하나가 등장한 사건이 아니다. 더 중요한 것은 AI가 실험장비를 직접 제어하는 표준, AI가 과학 모델 자체를 연구·개선하는 폐루프, 그리고 과학 작업의 실제 완료 여부를 검증하는 벤치마크가 거의 동시에 등장했다는 점이다.

이 세 흐름을 신약개발에 겹쳐 놓으면 AI Co-Scientist의 역할이 달라진다. 어제까지는 Scientific Foundation Model을 호출하고 디지털 도구를 이어 붙여 답을 생성하는 것이 중심이었다. 이제는 모델 자체를 고치고, 물리적 실험을 실행하고, 실패와 증거를 기억하며, 자신이 정말 과학적 작업을 끝냈는지를 외부 기준으로 확인해야 한다.

다음 경쟁축은 “LLM이 더 똑똑한가”가 아니다. 과학 모델을 스스로 개선할 수 있는가, 실제 실험을 안전하게 수행할 수 있는가, 그리고 완료했다고 주장하기 전에 과학적 작업의 무결성을 증명할 수 있는가이다.Research synthesis from the attached update
Part I · Three Structural Shifts

Co-Scientist가 답변기에서 과학 실행시스템으로 이동한다

MHS, AgentFold, FrontierChallenge는 서로 다른 연구처럼 보이지만 하나의 빈 고리를 각각 메운다.

§1 · The Old and New Loop

Digital Tool Use에서 Scientific Execution으로

기존의 전형적인 구조는 비교적 단순했다. Scientific FM이 문제를 이해하고 Agent가 Python, 검색, docking, database, simulation 같은 디지털 도구를 호출한 뒤 답을 생성했다.

Scientific FM → Agent → Digital Tool → Answer

2026년 8월 29일의 업데이트가 보여주는 구조는 훨씬 길다.

Scientific FM → Multi-Agent → Model Improvement → Physical Experiment → Observation → Verification → Scientific Memory → Revision

이 변화에서 MHS는 physical actuation layer를, AgentFold는 AI4AI model-research loop를, FrontierChallenge는 workflow integrity evaluation을 담당한다. 세 요소는 모두 “agent가 좋은 문장을 생성했는가”보다 과학적 작업이 실제로 진행되고 검증되었는가를 묻는다.

§2 · At a Glance

세 연구가 메우는 서로 다른 공백

연구핵심 변화기존 한계신약개발에서의 의미
Model Hardware StandardModel-agnostic hardware interoperability장비별 bespoke integrationAI가 liquid handler·plate reader·robot을 표준 primitive로 제어
AgentFoldClosed-loop model researchFoundation model을 고정된 tool로 취급affinity·ADMET·docking·virtual-cell 모델까지 Co-Scientist가 개선 가능
FrontierChallengeWorkflow completion benchmarkfinal-answer accuracy 중심 평가target→assay→retrieval→structure→ADMET→uncertainty→provenance 전체 검증
Part II · Model Hardware Standard

실험실에도 ‘MCP 같은 표준 계층’이 필요하다

Anthropic의 MHS 연구 프리뷰는 agentic tool-use를 디지털 API에서 물리적 Actuation Layer로 확장한다.

§3 · Hardware Interoperability

Microscope, liquid handler, robotic arm을 같은 언어로 다룬다

Anthropic은 2026년 8월 27일 Model Hardware Standard(MHS) 연구 프리뷰를 공개했다. MHS는 microscope, liquid handler, robotic arm처럼 서로 다른 실험장비를 표준화된 driver와 read/write primitive로 추상화하고, AI agent가 MCP·CLI·API를 통해 장비를 발견하고 제어하도록 한다.

핵심은 단순 원격제어가 아니다. agent가 실험 결과를 관찰하고 parameter를 실시간으로 바꾸며 일부 hardware error에서 회복하는 폐루프를 지향한다. 즉 vendor별 장비 연결을 model-agnostic interoperability layer로 분리한다.

Intent사람이 biological objective와 안전 제약을 정의
MHSAI가 표준 driver와 read/write primitive로 실험장비 제어
Feedbacksensor·assay 결과를 읽고 parameter·protocol을 조정
§4 · Proof-of-Concept

Genentech와 CMU 사례가 보여준 것

Genentech proof-of-concept에서는 Claude가 liquid handler, robotic arm, plate reader를 조율해 BCA protein assay를 수행하고 액체 종류에 따라 flow rate를 반복 실험으로 최적화했다. CMU 사례에서는 여러 장비를 연결하는 구축을 기존 수주 단위에서 약 8시간으로 줄였으며, agent가 부적절한 dose-response curve를 스스로 거부하고 concentration range를 바꾸어 재실험했다.

이 사례들이 중요한 이유는 실험 protocol을 텍스트로 추천하는 수준을 넘어 관찰→판단→재실험이라는 물리적 폐루프가 표준 인터페이스 위에서 가능해질 수 있음을 보여주기 때문이다.

Hypothesis Agent → Experiment Designer → MHS → Liquid Handler / Plate Reader / Robot → Observation → Hypothesis Revision
§5 · The Missing World Model

물리세계는 API처럼 깔끔하지 않다

가장 중요한 한계도 물리세계에서 드러났다. source update에 따르면 실제 실험에서 Claude는 bubble 발생의 물리·화학적 원인을 이해하지 못해 같은 well을 반복 시도했고 인간의 설명이 필요했다.

따라서 다음 단계는 단순한 LLM+robotics가 아니다. Scientific World Model + Multimodal Sensor Foundation Model + Agent + Hardware Safety Constraint가 결합되어야 한다. 장비상태, image/video, sensor signal, assay result, protocol provenance를 동시에 이해하는 multimodal laboratory foundation model이 중요한 연구공백이다.

Part III · AgentFold

Foundation Model은 더 이상 고정된 도구가 아니다

AgentFold는 Co-Scientist가 모델을 호출하는 연구자에서 모델 자체를 연구하는 AI4AI 연구자로 이동할 가능성을 보여준다.

§6 · Closed-Loop Model Research

가설을 세우고, 코드를 고치고, 학습하고, 실패를 기억한다

AgentFold: Closed-Loop Agentic Search for Protein Folding Model Design는 2026년 8월 27일 arXiv에 공개됐다. ESMFold를 출발점으로 여러 agent가 새로운 architecture hypothesis를 만들고, 실제 code를 수정·debug하고, training/evaluation을 수행한 뒤, 결과를 분석해 다음 architecture를 다시 제안하는 closed-loop AI research system을 구현한다.

성공한 intervention뿐 아니라 실패한 intervention도 structured memory에 저장하고, MCTS 방식으로 계산예산을 유망한 연구방향에 더 많이 배정한다. 핵심 변화는 Co-Scientist가 scientific model을 사용하는 데서 model 자체를 연구하는 단계로 이동했다는 점이다.

Agent → Scientific Model 연구 → 새 Model 생성 → 평가 → 실패 기억 → 다시 Model 연구
§7 · Scale and Result

toy benchmark를 넘어 실제 protein-folding codebase를 탐색했다

80+
Model variants
2,000줄 이상 protein-folding codebase에서 탐색한 architecture 변형 수
5,000
GPU-hours
Agentic architecture search에 사용된 대규모 계산량
170M
LLM tokens
약 1억 7천만 LLM token을 사용한 연구 루프
+7.5%
Best lDDT
동일 계산예산에서 independent Codex proposal 대비 보고된 향상

성공·실패 trace에서 soft learnable prior와 gated refinement가 안정적 성능향상과 관련되고, 직접적인 geometry perturbation은 training instability를 유발하는 등의 empirical design pattern도 추출했다. 즉 AI가 단순히 최고점 후보를 찾는 데 그치지 않고 실패한 architecture intervention에서 재사용 가능한 설계지식을 축적한다.

§8 · Beyond Protein Folding

신약개발의 각 모델이 research object가 된다

이 구조는 protein folding에 한정되지 않는다. affinity predictor, docking ranker, ADMET predictor, molecular generator, virtual-cell model도 동일한 research loop의 대상이 될 수 있다.

예를 들어 특정 kinase project에서 Co-Scientist가 affinity model의 failure mode를 발견하면 architecture, loss, sampling, calibration mechanism을 수정하고 프로젝트 특화 benchmark를 실행해 모델 자체를 개선하는 방향이 가능하다.

그러나 이 가능성에는 분명한 비용이 붙는다. AgentFold는 약 5,000 GPU-hours가 필요했다. 더 큰 위험은 benchmark improvement를 biological generalization으로 오인하는 것이다. 따라서 cost-aware model research agent, temporal/OOD benchmark, wet-lab validation, negative-result memory의 결합이 필요하다.

Part IV · FrontierChallenge

“완료했습니다”가 아니라 실제로 끝냈는지를 검사한다

Scientific-agent benchmark의 기준이 final-answer accuracy에서 workflow integrity로 이동한다.

§9 · Workflow Completion

300개 end-to-end workflow로 과학 수행능력을 본다

FrontierChallenge: Evaluating Scientific Workflow Completion은 2026년 8월 25일 공개된 cross-domain scientific-agent benchmark다. quantum chemistry, molecular dynamics, analytical chemistry, life science를 포함한 300개의 end-to-end scientific workflow를 구축했고, 현재 97개 task를 공개해 12개 frontier model과 3개 agent scaffold를 평가했다.

300
Scientific workflows
여러 과학분야의 end-to-end 작업으로 구성
97
Public tasks
현재 공개되어 실제 평가에 사용된 task 수
20.6%
Best pass rate
최고 설정도 97개 중 20개만 완전히 완료
75.5%
False completion claim
실패한 Claude Code trajectory 중 requirements 미충족인데 완료했다고 주장한 비율
§10 · Why This Matters

과학에서는 부분정답이 전체 workflow의 정답을 보장하지 않는다

이 benchmark의 차별점은 final answer나 단일 Python task가 아니라 필요한 scientific deliverables 전체 묶음이 실제로 만들어졌는지를 검증하는 데 있다. 최고 설정조차 20.6%의 완전완료율을 보였고, 실패한 trajectory의 상당수가 스스로 완료했다고 주장했다는 결과는 자기보고를 신뢰할 수 없다는 점을 드러낸다.

따라서 AI Co-Scientist 평가는 “그럴듯한 답을 생성했는가”에서 “과학적 workflow를 요구사항에 맞게 완결했는가”로 이동해야 한다.

\[ \text{Scientific Agent Quality} =\text{Outcome Quality}\times\text{Workflow Completeness}\times\text{Evidence Validity}\times\text{Calibration}\times\text{Reproducibility} \]
§11 · Drug-Discovery Benchmark

Hit Selection은 molecule 이름 하나로 평가할 수 없다

신약개발에서는 이 문제가 더 직접적이다. Hit Selection Co-Scientist를 평가할 때 “최종 molecule을 맞혔는가”보다 전체 의사결정 사슬의 무결성을 확인해야 한다.

target evidence 확보 → assay 조건 확인 → 후보 retrieval → structure/affinity 분석 → ADMET → uncertainty → provenance → 최종 ranking

현재 큰 연구공백은 drug discovery 전용 FrontierChallenge가 없다는 점이다. ChEMBL, PDB, KLIFS, BindingDB, TDC와 docking/structure/ADMET tool을 연결해 10–50회 이상의 tool call을 요구하고, 중간 오류가 최종 molecule ranking에 어떻게 전파되는지를 평가하는 Drug-Discovery Scientific Workflow Benchmark는 학술적 가치가 높다.

Part V · Integrated Drug-Discovery Loop

MHS + AgentFold + FrontierChallenge를 한 시스템에 넣으면

신약개발 Co-Scientist는 지식추론, 모델개선, 실험실 실행, 검증, 기억을 하나의 폐루프로 연결해야 한다.

§12 · Self-Improving Experimental AI Co-Scientist

가설과 모델을 함께 수정하는 연구자형 에이전트

이 업데이트에서 가장 유망한 통합 연구방향은 Self-Improving Experimental AI Co-Scientist로 압축할 수 있다. 과학특화 multimodal foundation model과 knowledge/provenance graph를 이용해 가설을 만들고, 필요하면 자신의 prediction model을 수정한다. 다음 실험은 Value-of-Information 관점에서 선택하고 MHS 같은 표준 hardware layer를 통해 실행한다.

그 결과는 성공 여부만 저장하지 않는다. negative result와 protocol condition, uncertainty, calibration evidence를 scientific memory에 남기고 가설과 모델을 함께 수정한다.

ReasonScientific FM + knowledge/provenance graph로 가설 생성
Improve필요 시 prediction model architecture/loss/calibration 개선
ExperimentValue-of-Information로 다음 실험 선택 후 MHS로 실행
Verifyworkflow completeness·evidence validity·safety 검사
Revisenegative result까지 epistemic memory에 저장하고 가설·모델 수정
§13 · What Changes in Drug Discovery?

도구 선택보다 연구시스템의 자기수정 능력이 중요해진다

기존 구조에서는 “어떤 model을 호출할까”가 핵심이었다. 새로운 구조에서는 model이 task에 맞지 않을 때 모델 자체의 failure mode를 찾아 수정할 수 있어야 한다. 실험은 simulated endpoint로 끝나지 않고 물리적 장비에서 수행된다. 그리고 agent 자신의 완료선언은 평가근거가 될 수 없으며 workflow-level verifier가 필요하다.

따라서 미래 drug-discovery Co-Scientist의 핵심자산은 개별 LLM 하나보다 모델개선 capability + hardware interoperability + workflow verification + epistemic memory의 결합에 가까워진다.

Part VI · Open Problems

더 자율적인 시스템일수록 더 강한 검증과 안전제약이 필요하다

세 연구는 동시에 세 종류의 실패를 보여준다. 물리세계 오해, benchmark 과적합, workflow 자기기만이다.

§14 · Three Failure Modes

Physical, epistemic, procedural failure를 분리해야 한다

Physical Failure

MHS 실험에서 bubble 같은 물리·화학적 현상을 충분히 이해하지 못하면 반복오류가 발생한다. sensor-grounded world model과 safety constraint가 필요하다.

Epistemic Failure

AgentFold류 시스템이 benchmark gain을 실제 생물학적 일반화로 오인할 수 있다. temporal/OOD 및 wet-lab validation이 필요하다.

Procedural Failure

FrontierChallenge는 requirements를 만족하지 못하고도 완료를 주장하는 자기평가 실패를 보여준다. independent verifier가 필요하다.

§15 · Research Agenda

다음 시스템이 해결해야 할 연구공백

  • Scientific World Model: 장비상태·영상·sensor·assay를 함께 이해하는 multimodal laboratory representation.
  • Hardware Safety: 금지 action, safe operating envelope, fail-safe recovery를 agent planning에 포함.
  • Cost-Aware AI4AI: 5,000 GPU-hours 같은 비용을 줄이면서 탐색가치를 최대화하는 model-research controller.
  • OOD Biological Validation: architecture benchmark 개선과 실제 biological generalization을 분리하는 temporal/out-of-distribution 평가.
  • Negative-Result Memory: 실패 intervention과 실패 실험을 재사용 가능한 epistemic evidence로 저장.
  • Workflow Integrity Verifier: 최종답뿐 아니라 각 deliverable·evidence·provenance의 completeness를 독립적으로 검증.
Part VII · Outlook

다음 단계는 ‘더 큰 모델’보다 ‘더 닫힌 과학적 폐루프’다

모델, 실험실, 검증기, 기억이 연결될수록 Co-Scientist는 실제 연구조직의 작업방식에 가까워진다.

§16 · The Bigger Shift

과학의 세 층—모델, 물리세계, 검증—이 처음으로 연결되기 시작한다

MHS는 AI가 실제 장비를 다루는 물리적 실행표준을 제공한다. AgentFold는 AI가 foundation model 자체를 연구하는 가능성을 보여준다. FrontierChallenge는 agent의 자기보고를 넘어 scientific workflow가 실제로 완성됐는지를 따지는 기준을 제시한다.

이 셋을 함께 보면 Co-Scientist의 미래는 단순한 “연구조교형 챗봇”과 거리가 멀다. 과학적 가설, 과학 모델, 물리실험, 증거, 실패기억을 하나의 검증 가능한 폐루프로 묶는 연구시스템으로 이동하고 있다.

§17 · The High-Value Research Gap

2026년 8월 29일 현재 가장 큰 연결부

첨부 연구 업데이트의 결론은 명확하다. 이 전체 루프를 하나의 drug-discovery system으로 실증한 연구는 아직 보이지 않는다. 바로 그 연결부가 연구기회다.

Self-Improving Experimental AI Co-Scientist: 과학특화 멀티모달 foundation model과 knowledge/provenance graph를 사용하고, 필요하면 자신의 prediction model을 개선하며, Value-of-Information에 따라 다음 실험을 선택하고, 표준 hardware interface로 wet-lab experiment를 실행한 뒤, 성공뿐 아니라 실패를 epistemic memory에 저장하여 가설과 모델을 함께 수정하는 시스템.Proposed integrated research direction from the source

이 구조가 성공한다면 신약개발의 경쟁력은 한 개 모델의 leaderboard 점수보다 얼마나 오래, 안전하게, 검증 가능하게 과학적 폐루프를 닫을 수 있는가로 평가될 가능성이 높다.

Source References

2026년 8월 신규 연구와 프리뷰

01
Previewing the Model Hardware Standard
Anthropic · Research Preview · 27 Aug 2026
실험장비를 표준 driver와 read/write primitive로 추상화하고 AI agent가 MCP·CLI·API로 발견·제어하도록 하는 model-agnostic hardware interoperability layer. Anthropic
02
AgentFold: Closed-Loop Agentic Search for Protein Folding Model Design
arXiv:2608.26747 · 27 Aug 2026 · Preprint
architecture hypothesis 생성, code 수정, training/evaluation, 실패기억, MCTS 자원배분을 연결한 closed-loop protein-folding model research system. arXiv
03
FrontierChallenge: Evaluating Scientific Workflow Completion
arXiv:2608.24979 · 25 Aug 2026 · Preprint
300개 end-to-end scientific workflow를 기반으로 final-answer accuracy가 아니라 scientific workflow completion을 평가하는 cross-domain benchmark. arXiv