AI Research Blog·Autonomous Science Lab2026 · 09 · 14
AI for Science·Self-Driving Lab·Embodied AI Scientist

실험을 자동화하는 연구실에서
믿음을 수정하는 과학자로

Autonomous Science Lab: From Self-Driving Laboratories to Falsifiable Embodied AI Scientists

SCIENTIFICBELIEF STATEGOAL + LITERATUREclaim · prior · constraintHYPOTHESIStestable · falsifiableEXPERIMENT DESIGNinformation gain · safetyROBOTIC LABvalidated primitivesMEASUREMENTdata · uncertaintyANALYSISsupport · oppositionREVISIONreject · revise · retainEVIDENCE MEMORYprovenance · negatives
Core Thesis

Autonomous Science Lab은 단순히 로봇이 실험을 대신하는 자동화 연구실이 아니다. 인간이 정의한 과학적 목표를 받아 문헌과 데이터를 조사하고, 가설을 만들고, 실험을 설계·실행하며, 결과를 해석한 뒤 다음 실험을 스스로 결정하는 폐루프형 과학발견 시스템이다.

2025년 이후의 변화는 세 방향으로 요약된다. Bayesian optimization 중심 Self-Driving Lab에서 LLM·멀티에이전트 기반 Autonomous Science Lab으로 확장되고, 실험 최적화에서 가설 생성·인과적 해석·후속 실험 설계까지 자율성 범위가 넓어졌으며, 속도 경쟁에서 재현성·안전·출처 추적·반증·책임 있는 중단을 포함한 신뢰성 경쟁으로 이동하고 있다.

궁극적인 연구대상은 “무인 실험실”이 아니라, 물리적 실험을 통해 자신의 과학적 믿음을 수정할 수 있는 embodied AI scientist라고 보는 것이 정확하다.Source thesis · 2026-09-14 research note
Part I · §1-§3

Self-Driving Lab을 넘어 전체 과학주기로

좁은 의미의 SDL은 adaptive experimentation을 자동화한다. 넓은 의미의 Autonomous Science Lab은 문헌·가설·실험·해석·belief revision까지 하나의 폐루프로 묶는다.

§1 · Definition

Self-Driving Laboratory의 최소 정의

Self-Driving Laboratory(SDL)는 세 구성요소를 폐루프로 연결한다. AI 기반 실험 선택 및 최적화, 로봇·자동화 장비를 이용한 물리적 실험, 측정 결과에 따른 모델 갱신과 다음 실험 결정이다.

\[\text{Design}\rightarrow\text{Make}\rightarrow\text{Test}\rightarrow\text{Analyze}\rightarrow\text{Learn}\rightarrow\text{Redesign}\]

Source fact2026년 npj Robotics의 관점 논문은 SDL을 로봇공학과 알고리즘 의사결정을 결합해 실험을 설계·수행·분석하는 시스템으로 정의한다. 핵심은 높은 처리량 자체가 아니라 결과에 따라 다음 행동을 독립적으로 바꾸는 적응성이다.

§2 · Autonomous Science Lab

전체 과학주기 11단계를 연결한다

연구목표 해석사람이 정의한 목표·가치·제약을 기계가 다룰 수 있는 연구목표로 변환한다.
문헌·데이터·특허 검색현재 evidence와 prior art를 수집한다.
검증 가능한 가설 생성성공 조건뿐 아니라 기각 조건을 갖는 가설을 만든다.
실험계획 수립가설을 구분할 수 있는 측정과 개입을 설계한다.
위험·비용·정보가치 평가정보이득과 비용, 위험, 시간을 함께 고려한다.
장비 및 로봇 제어검증된 primitive를 통해 실제 실험을 수행한다.
실시간 이상 감지센서·장비·sample state의 비정상 상태를 감지한다.
데이터 분석과 불확실성 추정측정과 모델의 불확실성을 분리해 해석한다.
가설 지지·기각·수정positive와 negative evidence를 함께 반영한다.
후속 실험 선택현재 믿음 상태를 가장 잘 줄이는 다음 행동을 고른다.
연구기록 생성근거와 실패, 버전, 사람 개입까지 남긴다.
\[a_t^*=\arg\max_{a\in\mathcal A_{safe}}\frac{\mathbb E[\mathrm{Information\ Gain}(a)]}{\mathrm{Cost}(a)+\mathrm{Risk}(a)+\mathrm{Time}(a)}\]

중요한 것은 최고 성능 후보만 찾는 것이 아니다. 현재 가설들의 불확실성을 가장 많이 줄이면서 안전하고 재현 가능한 실험을 선택하는 것이 핵심이다.

§3 · Concept Boundary

자동화, SDL, AI Co-Scientist, Autonomous AI Scientist와의 차이

개념실험 수행다음 실험 자율 선택가설 생성·수정핵심 목적
Laboratory automationOXX반복작업 자동화
High-throughput experimentationO제한적X많은 실험 수행
Self-driving laboratoryOO제한적효율적 탐색·최적화
AI Co-Scientist대체로 X디지털 수준O추론·가설·분석 지원
Autonomous Science LabOOO폐루프 과학발견
Autonomous AI Scientist선택적OO연구주기 전반 자율화
§3.1 · 2025–2026 Landscape

연구지형은 실험 최적화에서 과학주기·장비·평가·공동 인프라로 넓어진다

원 자료는 “대략 다섯 축”이라고 서술하지만, 바로 이어지는 표에는 7개 대표 축을 제시한다. 여기서는 표의 7개 항목을 그대로 보존한다.

연구축대표 연구의미
접근성과 공동활용2025 Nature Communications Perspective중앙집중형·분산형 SDL 네트워크
과학주기 에이전트화Robin, 2025문헌–가설–실험–분석 연결
장비 수준 자율화AILA, 2025AFM의 설계·조정·분석 자동화
평가·벤치마킹Benchmarking SDLs, 2025가속효과를 공통 지표로 비교
자기교정형 멀티에이전트AutoLabs, 2026프로토콜 생성의 신뢰성 강화
로봇 일반화npj Robotics, 2026모듈·이동·조작·확장성 문제
생명공학 확장Self-driving labs for biotechnology, 2025바이오 실험의 적합성 조건

Source fact2025년 Nature Communications Perspective는 개별 연구실의 고가 설비만을 전제하지 않고 중앙집중형 시설과 분산된 전문 연구실을 네트워크로 연결하는 모델을 제시한다. 원 자료는 국가연구소 규모 조직이 provenance와 metadata 표준을 시험하기에 적합하다는 논의를 ETRI 관점에서 중요하게 본다.

Part II · §4-§6

문제는 속도가 아니라 탐색·grounding·발견이다

Autonomous Science Lab이 해결하려는 병목은 실험 횟수만이 아니다. 거대한 탐색공간, 디지털 추론과 물리 행동의 단절, 최적화와 발견 사이의 간극을 동시에 다뤄야 한다.

§4 · Problem Definition

고차원 탐색공간에서 정보가치가 큰 실험을 골라야 한다

화합물, 단백질, 공정조건, 촉매 조성, 온도, 압력, 용매, 측정조건의 조합은 사람이 체계적으로 탐색하기 어려울 정도로 크다. 제한된 실험예산에서는 단순히 “좋아 보이는 후보”가 아니라 가설을 가장 잘 구분하는 실험을 골라야 한다.

디지털 추론과 물리 실험의 단절

기존 AI는 논문과 데이터에서 잘 추론해도 실제 장비가 요구하는 단위·범위·순서 처리, 장비별 상태와 제약 이해, 실패 원인 진단, 중간결과에 따른 protocol 수정, 안전조건 위반 시 중단을 안정적으로 수행하지 못할 수 있다.

Source factAILA 연구에서는 재료과학 질의응답 성능이 좋은 모델도 실제 실험과 장비조정에서는 낮은 성능을 보였다. 원 자료가 강조하는 결론은 과학지식 점수와 실험 수행 능력은 동일하지 않다는 것이다.

§5 · Optimization vs Discovery

목적함수 최대화와 과학발견은 다른 문제다

현재 SDL의 상당수는 조건 \(x\)에서 목적함수 \(y\)를 최대화하는 문제를 푼다. 그러나 과학발견에는 경쟁 가설의 구분, 인과기전 설명, 반례와 대안 설명 탐색, 새로운 변수 도입, 가설을 기각할 수 있는 실험 설계가 필요하다.

불완전하고 잡음이 있으며 비용이 큰 실험환경에서, AI가 검증 가능한 가설을 생성하고 안전한 실험을 선택·실행하며, 긍정적·부정적 결과에 따라 자신의 지식상태를 추적 가능하게 수정할 수 있는가?
§6 · Motivation

과학적·경제적 동기는 결국 지식의 병목을 줄이는 데 모인다

Scientific Motivation

고차원 설계공간, 논문에 남지 않는 실패실험, 실험–분석 간 시간차, 연구실·장비·작업자에 따른 변이, 특정 연구자의 암묵지 의존이 핵심 병목이다.

Economic & Social Motivation

실험횟수, 시약·샘플 소비, 장비 유휴시간, 반복작업 시간, 오류로 인한 재실험 비용, 지역·기관별 인프라 격차를 줄일 가능성이 있다.

Source fact2025년 벤치마킹 연구가 검토한 문헌에서는 기존 기준전략 대비 실험 가속계수의 중앙값이 약 6으로 보고되었다.

Caution실험공간과 baseline 정의가 서로 달라 이 값을 모든 SDL에 일반화해서는 안 된다.

\[\text{Human Scientist}\rightarrow\text{Automation Tools}\]
\[\text{Human Goal}\rightarrow\text{AI Scientist}\leftrightarrow\text{Robotic Lab}\leftrightarrow\text{Evidence Memory}\]

이 구조에서는 인간의 역할이 피펫 조작에서 목표·가치·위험 한계 설정과 결과의 과학적 의미 판단으로 이동한다.

Part III · §7-§13

Autonomous Science Lab의 핵심 구성요소

closed loop, active learning, 역할분리형 multi-agent, scientific tool grounding, digital twin, independent verification, provenance memory가 결합되어야 한다.

§7 · Closed Loop

실험결과가 다음 실험을 바꾸는가

Closed-loop experimentation은 결과가 다음 실험 선택에 직접 반영되는 구조다. 미리 정한 목록을 순차 실행하는 자동화와 구분된다. Active learning과 Bayesian optimization은 불확실성이 높거나 개선 가능성이 큰 지점을 우선 선택하며, 원 자료는 Bayesian optimization, Gaussian process, Expected Improvement, Upper Confidence Bound, Entropy Search, Multi-objective optimization, Constrained safe optimization을 핵심 방법으로 열거한다.

§8 · Multi-Agent Orchestration

하나의 거대 모델에 모든 책임을 몰아주지 않는다

Knowledge

Literature/Retrieval Agent · Hypothesis Agent · Provenance Agent

Experiment

Experimental Design Agent · Protocol Agent · Instrument Agent

Verification

Data Analysis Agent · Safety Agent · Critic/Verifier Agent

Source fact2026년 AutoLabs는 목표 분해, 화학량 계산, protocol 검증, 장비용 XML 생성을 전문 agent로 분리했다. 원 자료에 따르면 복잡한 과제에서 추론능력이 높은 모델은 정량오류를 85% 이상 감소시켰고, multi-agent와 반복 자기교정을 결합했을 때 어려운 합성 protocol에서 F1-score 0.89 이상을 달성했다.

§9 · Scientific Tool Grounding

숫자와 명령을 자유 텍스트로 만들지 않게 한다

LLM은 화학량론 계산기, 단위·차원 검증기, 물질 및 장비 제약 데이터베이스, 분자·단백질 예측 모델, 실험 스케줄러, 장비 API, 통계검정·불확실성 계산기를 호출해야 한다. 이는 자연어 reasoning과 deterministic execution 사이에 검증 가능한 경계를 만든다.

§10 · Digital Twin

에이전트가 실제 연구실과 다른 세계를 상상하지 않게 한다

현재 시약량, 장비상태, 보정이력, 환경조건, 실험진행 상황을 digital laboratory state로 표현한다. world model과 digital twin은 실제 실행 전에 자원소모, 충돌·deadlock, 오염 가능성, 장비범위 위반, 예상 측정분포, 비정상 상태에서의 복구 경로를 점검하는 기반이 된다.

§11 · Independent Verification

Self-correction만으로는 충분하지 않다

동일 agent가 자신의 출력을 다시 읽는 것만으로는 오류가 독립적으로 검증되지 않는다. 별도의 verifier와 rule-based gate가 필요하다.

\[\mathrm{Execute}(a)=\begin{cases}1,&\mathrm{scientific\ validity}\land\mathrm{safety}\land\mathrm{resource\ validity}\\0,&\mathrm{otherwise}\end{cases}\]
§12 · Provenance & Epistemic Memory

성공뿐 아니라 실패와 수정 이유를 기억해야 한다

  • 가설의 출처
  • 사용한 논문과 데이터 버전
  • 실험조건과 장비 보정상태
  • 모델·프롬프트·코드 버전
  • 실패·무효·중단 실험
  • 가설 변경 전후와 변경 이유
  • 사람이 개입한 지점

원 자료는 이 요소를 SGI 연구의 D1–D7, 특히 provenance, counter-evidence, uncertainty, belief revision, external reproducibility와 직접 연결한다.

§13 · Provenance-Aware Agentic RAG

검색된 과학 주장을 조건이 붙은 evidence record로 만든다

\[(\mathrm{claim},\mathrm{source},\mathrm{assay},\mathrm{condition},\mathrm{time},\mathrm{uncertainty},\mathrm{support/opposition})\]

이 hyper-relational record는 assay, protocol, threshold, time, uncertainty, support/opposition을 함께 보존한다. 원 자료는 이를 AssayKG-RAG의 assay shift, claim gate, qualifier-aware HRKG를 물리적 실험 단계로 확장하는 자연스러운 방향으로 본다.

Part IV · §14-§20

자율성의 병목은 신뢰성과 예외처리다

실험실은 열린 세계다. 단위오류, sensor drift, grasp failure, contamination, closed API, 느린 biological feedback, human intervention accounting, dual-use risk를 다뤄야 한다.

§14 · Grounding

언어적으로 그럴듯한 명령이 물리적으로 가능한 명령은 아니다

LLM이 생성한 단위 오류, 농도 오류, 장비범위 초과, 누락된 세척 단계는 실제 사고로 이어질 수 있다. 따라서 언어 reasoning과 장비 실행 사이에는 capability schema, unit validation, interlock가 필요하다.

§15 · Sleepwalking

목표 이탈과 prompt sensitivity를 안전 문제로 다뤄야 한다

Source factAILA 연구는 agent가 명령에서 벗어나는 “sleepwalking” 현상을 보고했고, 사소한 prompt 표현 변화에도 결과가 민감했다. 원 자료는 이 근거를 바탕으로 현 시점의 LLM을 safety-critical 실험의 최종 실행권자로 두는 것은 위험하다고 판단한다.

§16 · Open-World Exceptions

미리 정의된 workflow 성공만으로 자율성을 입증할 수 없다

Physical Failures

팁 막힘·시약 침전 · sensor drift · robot grasp failure · 용기 위치 변경 · sample contamination · 예상하지 못한 상전이

Systems Failures

통신장애 · 장비 제조사별 API 차이 · 상태 불일치 · 복구경로 부재

§17 · Interoperability

폐쇄적 장비 API와 독점 형식은 cross-lab transfer를 막는다

2025년 SDL 접근성 연구는 API, metadata, digital twin, 장기 software maintenance, cybersecurity를 주요 장애물로 지적한다. workflow portability는 단순 code portability가 아니라 장비 capability와 state model의 표준화 문제다.

§18 · Biotechnology

느리고 변동성 높은 feedback은 SDL에 더 어려운 조건이다

생물학 실험은 긴 배양·반응 시간, batch effect, 세포·생물학적 변이, 파괴적 측정, 오염 위험, 윤리·생물안전 규제, 다수의 대리 지표와 장기 endpoint 때문에 화학·재료 실험보다 폐루프 구현이 어렵다.

따라서 모든 바이오 문제를 SDL에 넣기보다 자동화 가능성, cycle time, 측정가능성, 탐색공간을 기준으로 적합성을 먼저 평가해야 한다.

§19 · Autonomy Accounting

“autonomous discovery”라는 말에 인간 개입을 숨기면 안 된다

목표와 후보공간 설정, 도구 연결과 prompt 수정, 실패 실행 제거, 결과 해석, 최종 후보 선정에 사람이 얼마나 개입했는지 불명확한 연구가 있을 수 있다. 원 자료는 autonomy 수준, 인간 개입시간, 실패율, 재실행 횟수를 명시하는 표준이 필요하다고 본다.

§20 · Safety, Security, Dual Use

잘못된 추론이 곧 물리적 행동이 된다

화학·생물학에서는 독성물질, 병원체, 고압·고온 공정과 연결될 수 있다. 따라서 권한분리, command allowlist, 물리적 interlock, audit log, emergency stop이 필수다. 자기개선형 연구실도 허용된 실험공간, 재료·장비·비용 한도, 위험등급, model update 승인, 외부 network access, 신규 tool 설치, 자기 목적 변경의 경계를 넘어서는 안 된다.

Part V · §21-§26

무엇을 연구하고 어떻게 평가할 것인가

과학적 자율성, discovery, failure learning, evidence linkage, falsification, cross-lab transfer, abstention, multi-agent trade-off를 연구질문으로 명시하고 계층적 architecture와 단계적 검증으로 다룬다.

§21 · Research Questions

논문 수준에서 중요한 8개의 질문

RQ1 · Autonomy

단순 task success가 아니라 목표설정, 가설생성, 실험설계, 실행, 분석, 수정 단계별 autonomy를 어떻게 측정할 것인가?

RQ2 · Discovery

알려진 목적함수를 개선하는 최적화와 새로운 변수·기전·인과관계를 발견하는 시스템을 어떻게 구분할 것인가?

RQ3 · Failure Learning

같은 오류를 반복하지 않고 실패를 데이터로 저장하며 가설확률을 갱신하는가?

RQ4 · Evidence Linkage

모든 주장을 원시 데이터, 실험조건, 분석코드, 선행 근거로 역추적할 수 있는가?

RQ5 · Falsification

성능 최대화 후보가 아니라 경쟁 가설을 가장 잘 구분하는 실험을 선택할 수 있는가?

RQ6 · Cross-Lab Transfer

장비와 작업환경이 달라져도 성능·안전·재현성이 유지되는가?

RQ7 · Ask / Abstain / Stop

불확실성, 위험, 자원부족, 장비 이상을 근거로 clarification, abstention, safe shutdown을 고를 수 있는가?

RQ8 · Multi-Agent Value

검증과 모듈화의 이점이 오류전파, 책임분산, 통신비용을 넘어서는 조건은 무엇인가?

§22 · Hierarchical Architecture

상위 reasoning과 하위 execution을 분리한다

TOP      Scientific goals · hypotheses · priorities
          ↓
MIDDLE   Experiment planning · tool selection · resource allocation
          ↓
BOTTOM   Verified instrument-specific primitives
          ↓
INDEPENDENT SAFETY PLANE
         Safety · provenance · statistics · reproducibility verification

LLM이 “원심분리기를 8,000 rpm으로 실행하라”는 직접 명령을 내리기보다 검증 가능한 형식의 의도를 생성하고, deterministic controller가 이를 장비명령으로 변환하는 편이 안전하다.

§23 · Causal Experimental Design

Bayesian optimization을 넘어 competing hypothesis를 구분한다

원 자료는 구조적 인과모형, competing hypothesis graphs, optimal experimental design, expected information gain, intervention planning, counterfactual simulation을 결합해야 한다고 제안한다.

§24 · Staged Validation

Text benchmark에서 장기 무인운전까지 단계적으로 올린다

Text protocol benchmark언어 수준의 계획 타당성을 먼저 검증한다.
Instrument simulator장비 명령과 상태전이를 가상환경에서 시험한다.
Digital twin실험실 상태·자원·collision·오류를 더 현실적으로 재현한다.
Shadow execution무해한 sample로 실제 장비에서 비위험 rehearsal을 수행한다.
Human-approved experiments사람 승인을 거친 실제 실험으로 넘어간다.
Bounded closed loop범위가 제한된 자율실험을 허용한다.
Independent lab reproduction다른 연구실에서 같은 workflow를 재현한다.
Bounded long-run autonomy명시된 안전경계 안에서 장기 무인운전을 검증한다.
§25 · Common Evaluation

과학적 성과만으로는 부족한 공통 평가체계

범주권장 지표
과학적 성과유효 가설 수, 신규성, 재현 성공률
탐색 효율acceleration factor, information gain / experiment
실행 신뢰성protocol validity, 장비오류율, 복구율
인식 신뢰성calibration, abstention accuracy
안전성near-miss, constraint violation, unsafe-command rejection
재현성타 장비·타 연구실 이전 성공률
인간 부담개입 횟수, 개입시간, clarification quality
근거성provenance completeness, unsupported-claim rate
반증능력경쟁 가설 구분률, belief-revision correctness
§26 · Why This Matters

성공률보다 “좋은 과학적 행동”을 측정해야 한다

Analysis이 평가체계는 experiment success 하나로 자율과학을 평가하는 것을 피한다. 안전하게 중단한 실험, 반례를 발견해 가설을 버린 실험, 다른 연구실에서 재현된 실험은 모두 과학적으로 중요한 성공일 수 있다.

Part VI · §27-§33

응용, 미해결 문제, 그리고 다음 연구실

신약·화학·재료·에너지·과학장비 운영으로 확장되는 동시에 falsifiability, negative-result memory, cross-lab reproducibility, long-horizon reliability가 핵심 open problem으로 남는다.

§27 · Applications

신약발견과 생명공학

  • hit identification과 hit selection
  • 약물 재창출
  • 단백질·항체·효소 설계
  • 세포배양 조건 최적화
  • formulation과 drug delivery
  • ADMET 및 assay sequence 선택
  • organoid·phenotypic screening

Source factRobin은 문헌검색, 가설생성, 실험제안, RNA-seq 분석을 연결해 건성 연령관련 황반변성 후보로 ripasudil을 제안하고 실험적으로 검증했다. 원 자료는 이 논문이 arXiv preprint이고 실험 수행에 사람이 포함된 lab-in-the-loop 구조임을 구분해야 한다고 명시한다.

§28 · More Domains

화학·재료·에너지·과학장비 운영

Chemistry

반응조건 최적화 · 합성경로 탐색 · 촉매 발견 · 용매·농도·온도 최적화 · HPLC 방법개발 · 다단계 합성 스케줄링

Materials Science

배터리·전해질 · 광전·태양전지 재료 · 나노입자 합성 · 고분자·복합재료 · 상도표 탐색 · 현미경 기반 특성분석

Energy & Environment

CO₂ 포집재 · 수전해·연료전지 촉매 · 폐기물 전환 · 지속가능 합성 · 공정 에너지·물질사용 최적화

Scientific Instruments

현미경·분광기·가속기·망원경을 운용하는 scientific-instrument agent로 확장될 수 있다.

AILA는 AFM 보정, feature detection, 기계적 물성측정, graphene layer 판별, indenter detection까지 범위를 확장했다.

§29 · Open Problems

10개의 미해결 문제

  1. 가설의 falsifiability 자동검증: 생성된 가설이 실제로 반증 가능한지 판별하는 기술이 부족하다.
  2. Negative-result memory: 실패를 버리지 않고 조건·원인을 구조화해 다음 탐색을 제한해야 한다.
  3. Cross-lab reproducibility: 다른 장비·기관에서도 재현되는지 검증할 공통 testbed가 부족하다.
  4. Autonomy accounting: 연구 전 과정에서 인간과 AI가 각각 무엇을 했는지 정량화해야 한다.
  5. Mechanistic discovery benchmark: 새로운 기전을 발견하는 능력의 평가는 목적함수 최적화 benchmark보다 부족하다.
  6. Long-horizon reliability: 수백·수천 회 실험에서 누적오류가 어떻게 증가하는지가 중요하다.
  7. Semantic–physical alignment: 자연어 계획을 physical affordance, 장비상태, 안전조건에 맞게 변환해야 한다.
  8. Dual-use governance: 유용한 생물·화학 연구와 위험 실행을 구분하면서 과도한 제한을 피해야 한다.
  9. Scientific accountability: 오류가 발생했을 때 개발자, 장비 운영자, 연구책임자의 책임 경계가 불명확하다.
  10. 지속가능한 경제성: 구축비뿐 아니라 calibration, maintenance, data management, software update, 인력교육을 포함한 TCO가 필요하다.
§30 · Hypothesis-Driven SDL

최적화 루프에서 반증 루프로

\[\text{Competing Hypotheses}\rightarrow\text{Discriminative Experiment}\rightarrow\text{Evidence Update}\rightarrow\text{Revision or Rejection}\]
§31 · Falsifiable Autonomous Science Lab

다음 generation의 SDL에 필요한 epistemic 기능

  • 가설별 검증조건과 기각조건 명시
  • 지지증거와 반대증거 동시 검색
  • 조건부 주장과 적용범위 표현
  • 예측 신뢰도와 calibration
  • 불확실할 때 abstention
  • 부정적 결과의 장기기억
  • 독립 연구실 재현 protocol 생성

원 자료는 이를 SGI의 Epistemic Accountability Loop를 물리적 실험환경에 구현하는 연구로 발전시킬 수 있다고 본다.

§32 · Distributed Science & Laboratory OS

한 연구실의 로봇을 넘어 연구실 네트워크와 operating system으로

Distributed Autonomous Science Network에서는 여러 연구실이 전문 장비와 데이터를 공유하고, agent가 capability·cost·time·safety·regulation을 고려해 task를 routing한다. 이때 연구실과 실험을 연결하는 provenance-aware workflow graph가 핵심 데이터 인프라가 된다.

Laboratory Operating System은 장비 API 위에 표준 capability description, 상태·자원·오류 model, 안전정책, provenance schema, workflow language, simulator·digital twin, 권한·감사관리 기능을 제공한다.

§33 · Foundation Model × Instrument / Science-as-a-Service

Foundation model은 정밀제어기보다 상위 orchestration 계층이 될 가능성이 높다

멀티모달 과학모델은 현미경 이미지, 분광 데이터, chromatogram, 시계열 sensor, 분자·단백질 구조, 로봇 영상, 장비 log를 통합적으로 이해하게 될 수 있다. 그러나 범용 foundation model이 장비별 정밀제어를 직접 맡기보다는 전문 model·rule·physics model을 조정하는 상위 계층이 될 가능성이 높다.

Science-as-a-Service에서는 중앙집중형 robotic facility에 연구자가 자연어로 문제를 제출하고, agent가 비용·시간·불확실성을 제시한 뒤 실험을 수행할 수 있다. 동시에 공정한 자원배분, 지식재산권, 데이터 주권, 연구비 격차 문제가 생긴다.

Part VII · §34-§36

ETRI 관점의 전략적 목표형상

신규성은 LLM이 장비를 조작하는 데 있지 않다. 실험 선택의 근거, 지지·반대 evidence, 조건 변화에 따른 belief revision을 계산 가능하고 감사 가능한 형태로 만드는 데 있다.

§34 · Recommended Topic

Falsifiable and Provenance-Aware Autonomous Science Lab

Falsifiable and Provenance-Aware Autonomous Science Lab: Hyper-Relational Evidence Graphs and Multi-Agent Experimental Reasoning for Closed-Loop Drug Discovery

첨부 자료가 ETRI 관점에서 가장 전략적인 방향으로 제안하는 연구주제다.

TxAgentRAG

연구목표 분해와 전문 agent orchestration

AssayKG-RAG

assay·protocol·threshold·time을 포함하는 조건부 evidence retrieval

HRKG

claim–source–condition–support/opposition 관계 표현

SGI D1–D7

falsification, uncertainty, rejection, revision, reproducibility 평가

Robotic / Cloud Lab Adapter

검증된 experimental primitive 실행

STRATA

시간순 experiment·evidence path와 causal frontier 추적

Claim Gate

근거가 부족하거나 안전하지 않은 experiment 차단

Negative Evidence Memory

실패와 반증 결과를 장기 보존

§35 · Strategic Novelty

실험을 실행하는 AI보다 믿음을 수정하는 AI

신규성은 “LLM이 실험을 실행한다”는 데 있지 않다. 어떤 근거로 실험을 선택했고, 어떤 결과가 가설을 지지하거나 기각했으며, 조건이 달라질 때 믿음을 어떻게 수정했는지를 계산 가능하고 감사 가능한 형태로 만드는 것에 있다.

Analysis이 목표형상은 Agentic RAG, hyper-relational provenance, falsifiability, temporal evidence paths, laboratory execution을 하나의 closed loop로 묶는다. 핵심은 더 많은 automation이 아니라 evidence-grounded belief revision을 물리적 실험까지 확장하는 데 있다.

§36 · Tracking Configuration

원 자료에 기록된 추적 설정

아래는 첨부 source note에 포함된 “Autonomous Science Lab 추적” 설정을 그대로 웹용으로 정리한 것이다. 이 게시물 생성 자체가 별도의 monitoring task를 새로 생성한다는 의미는 아니다.

항목설정
실행매일 오전 9시, 한국시간
범위2025년 이후 논문·학회 발표·공식 연구기관 자료
검색대상Autonomous Science Lab, self-driving laboratory, autonomous experimentation, robotic laboratory, AI scientist
보고조건이전 확인 이후 의미 있는 신규 연구가 있을 때만 알림
검증동료심사 논문과 preprint 구분, 중복 제거, 수정·철회 여부 확인
보고내용핵심 방법, 실험성과, 한계, 신규성, 출처 URL 및 ETRI·TxAgentRAG·AssayKG-RAG·SGI 연계 가능성
Final · Takeaway

Autonomous Science Lab의 경쟁력은 자율성이 아니라 책임 있는 자율성이다

앞으로의 핵심 경쟁은 실험 throughput 자체가 아니다. scientific tool grounding, digital twin, independent verification, provenance-aware memory, falsification, cross-lab reproducibility를 통해 시스템이 자신의 한계를 알고, 반례를 수용하고, 필요할 때 중단하며, 다른 연구실에서도 검증 가능한 evidence trail을 남기는가가 중요하다.

References

첨부 연구노트가 직접 연결한 핵심 출처

2025년 이후 논문과 2026년 관점 논문을 중심으로 원문에서 제공된 URL을 정리했다.

[01]
The rise of robotics in self-driving labs
npj Robotics · 2026
SDL을 robotics와 algorithmic decision-making의 결합으로 정의하고, adaptability를 핵심으로 다룬다. Nature
[02]
Evaluating LLM agents for automation of atomic force microscopy
Nature Communications · 2025
AILA/AFMBench를 통해 scientific knowledge QA와 실제 instrument operation의 차이, sleepwalking과 prompt sensitivity를 논의한다. Nature
[03]
AutoLabs
Scientific Reports · 2026
goal decomposition, quantitative calculation, protocol verification, instrument XML generation을 multi-agent self-correction과 결합한다. Nature
[04]
Science acceleration and accessibility with self-driving labs
Nature Communications Perspective · 2025
중앙집중형·분산형 SDL network, API, metadata, digital twin, software maintenance, cybersecurity와 접근성을 논의한다. Nature
[05]
Benchmarking Self-Driving Labs
arXiv:2508.06642 · 2025
SDL acceleration factor와 benchmark 비교 문제를 다룬다. 원 자료는 검토문헌의 중앙값 약 6을 인용하되 일반화를 경고한다. arXiv
[06]
Self-driving labs for biotechnology
2025
느리고 변동성 높은 biological feedback, batch effect, destructive measurement, biosafety를 고려한 SDL 적합성 문제를 다룬다. Nature
[07]
Robin
arXiv:2505.13400 · 2025
literature search, hypothesis generation, experiment proposal, RNA-seq analysis을 연결한 lab-in-the-loop system. 원 자료는 preprint라는 점을 명시한다. arXiv