실험 코드를 넘어
실행과 복구를 통제하다
LabscriptAI v3: Execution-Aware and Safety-Gated Lab Automation
LabscriptAI v3는 실험 프로토콜 생성에서 실행상태 관찰과 제한된 오류복구까지 범위를 넓혔다. 시뮬레이션 성능, 물리 장비의 권한 경계, 과학적 판단의 미완성 과제를 구분한다.
사람이 확인한 SOP를 실행 패키지로 만들고, 시뮬레이션을 통과한 뒤 승인된 행동만 장비에 전달한다. 정량 결과가 의미하는 범위와 장비별 실시간 제어의 차이까지 살펴본다.
원자료 Autonomous Science Lab-0926.md의 v3 변경표, 두 수식, 모든 실증 수치, 한계, ETRI 실행·안전 계층과 SGI D1–D7 평가를 반영했다.
전체 목차
v3 개정의 범위와 근거
- 개정본 공개: 2026년 9월 24일
- 상태: bioRxiv v3 사전공개본, 동료심사 미완료
- 철회 여부: 철회 기록 없음
- 연구분야: 합성생물학, 액체처리 로봇, LLM 에이전트, 생물보안, 다기관 실험 자동화
- 원문: bioRxiv v3
- 코드: LabscriptAI GitHub
- DOI: 10.1101/2025.09.30.679666
이번 논문은 신규 논문이라기보다 2025년에 처음 공개된 LabscriptAI의 대폭 확장된 v3 개정본이다. 벤치마크·지원 장비·실제 활용 규모가 확대됐고, 기존의 “자연어→로봇 스크립트 생성”에서 실행상태 감시와 제한적 오류복구까지 담당하는 execution-aware agent harness로 연구범위가 확장됐다는 점에서 의미 있는 변화다. 근거 · bioRxiv v3
기준일 · 첨부의 연구동향 파일명 “0926”을 브리핑 업데이트 기준일(2026-09-26)로 적용한다. 논문은 2026년 9월 24일 v3 개정본이며, 2025년 첫 공개 연구의 확장판이다. 저자 Yuan Gao, Lihao Fu, Yujie Liu 등 공동연구진은 선전 첨단기술연구원·중국과학원, Shanghai AI Laboratory, IBBIS 등 여러 기관에 속한다. 동료심사 전 preprint이다.
Authoring과 Runtime의 두 폐루프
LabscriptAI는 실험 자동화를 두 폐루프로 구분한다.
Authoring loop
- 자연어 연구의도와 사람이 확인한 SOP를 입력
- 실험단계를 플랫폼별 로봇 명령으로 변환
- Python 스크립트, 단계별 manifest, 실행추적 기록 생성
- 시뮬레이터가 labware 불일치, 용량 초과, 이동경로·명령 오류 검출
- 오류가 있으면 에이전트가 코드를 수정하고 재검증
Runtime loop
- 검증된 protocol package만 실제 장비에서 실행
- 로봇 controller가 제공하는 command/run state를 권위 있는 상태정보로 사용
- 카메라 영상과 압력센서는 보조 증거로 사용하되 controller state를 임의로 덮어쓰지 않음
- 실패 명령에 대해 복구행동을 제안
- 결정론적 gatekeeper가 행동을
allow,ask,suspend로 분류 - 승인된 행동만 장비에 전달하고 불명확하거나 위험한 경우 인간에게 이관하거나 중단
이 구조는 LLM의 판단을 물리 장비에 직접 전달하지 않고, 실행 가능한 코드·시뮬레이션·권한정책·실시간 장비상태를 통과시킨다는 점이 핵심이다. 공식 저장소에서는 Opentrons Flex의 tip-pickup 실패를 감지하고, 승인된 복구행동 후 실행을 재개하는 사례도 제시한다. 근거 · 공개 코드
저장소 문서는 Flex와 OT-2의 실장비 제어 경로를 설명하며, Hamilton Vantage와 Tecan Fluent는 스크립트 작성 중심으로 표시한다. v3의 다중 플랫폼 코드 생성·검증을 모든 장비의 실시간 복구 시연으로 해석하지 않는다. 저장소는 실제 배포에서 sequence-level biosecurity screening이 운영자 책임이며 코드가 자동화하지 않는다고 별도 명시한다.
90개 과제와 확장된 장비·실증 범위
| 항목 | 이전 버전 | v3 |
|---|---|---|
| 액체처리 벤치마크 | 55개 작업 | 90개 작업 |
| 실제 장비 범위 | 주로 Opentrons 중심 | OT-2, Flex, Hamilton Vantage, Tecan Fluent |
| 제어 범위 | 프로토콜 코드 생성·검증 | 실행상태 감시와 제한적 복구 포함 |
| GFP 실험 규모 | 53개 팀, 약 298개 설계 | 171개 팀, 854개 설계 |
| 추가 실증 | 단백질공학 사례 | 531개 iGEM 유전부품 준비 추가 |
| 안전성 | 생물보안·사람 감독 | 결정론적 승인정책과 중단·이관 절차 강화 |
저자들은 v3에서 그림·확장 데이터·보충자료도 교체했다고 명시했다. 따라서 단순한 문구 수정이나 재게시가 아닌 실질적인 방법·실험 확장으로 판단된다. 근거 · bioRxiv v3 변경 설명
실험 성과를 어떻게 읽을 것인가
- 90개 액체처리 과제에서 시뮬레이션 통과율 96.7%를 기록해 비교된 직접 LLM 방식과 상용 기준선보다 높은 결과를 보고했다.
- Opentrons OT-2·Flex뿐 아니라 Hamilton Vantage와 Tecan Fluent용 스크립트를 생성·검증했다.
- 2025·2026 CAPE 프로그램에서 171개 학생팀이 설계한 854개 GFP 변이체의 cell-free 특성평가를 수행했다.
- 위험물질인 formaldehyde를 취급하는 containment-aware 단백질공학 workflow에서, 2단계 cascade의 ethylene glycol titer를 6.7배 높인 효소 후보를 얻었다.
- 2025 iGEM Distribution Kit용 531개 유전부품을 품질관리 절차와 함께 준비했다.
- 지정된 workflow checkpoint에서 sequence-level biosecurity screening을 적용했다. 근거 · bioRxiv v3
수치의 범위 · 96.7%는 90개 액체처리 과제의 시뮬레이션 통과율이다. 854 GFP 설계, 531 유전부품, 6.7배 titer는 서로 다른 실증 workflow에 해당한다. 동일한 단일 무인 캠페인의 종합 성공률이 아니다.
지능과 장비 권한을 분리하다
기존 LLM 실험 자동화는 주로 “프로토콜을 코드로 번역할 수 있는가”를 평가했다. LabscriptAI v3는 이를 다음 단계로 확장한다.
\[ \text{Intent} \rightarrow \text{Executable Protocol} \rightarrow \text{Simulation} \rightarrow \text{Authorization} \rightarrow \text{Physical Execution} \rightarrow \text{Failure Detection} \rightarrow \text{Bounded Recovery} \]
특히 가치 있는 부분은 모델의 지능과 장비의 권한을 분리했다는 점이다. 에이전트는 복구행동을 제안할 수 있지만, 실제 행동권한은 결정론적 안전정책이 갖는다. 이는 전주기 자율실험실에서 요구되는 “지능적 유연성”과 “물리적 통제 가능성”을 함께 구현하는 현실적인 설계다.
완성형 과학자에 이르기 전의 한계
- 96.7%는 주로 시뮬레이션 통과율이며, 90개 과제 모두에 대한 실제 장비 성공률을 의미하지 않는다.
- 실제 오류복구 성공률, 오탐·미탐률, 평균 복구시간 및 장시간 무인운전 결과는 충분히 제시되지 않았다.
- 생물보안 screening의 정밀도·재현율과 우회공격에 대한 강건성 평가가 불분명하다.
- 자연어 목표와 SOP는 사람이 제공한다. 과학적 연구질문이나 가설을 스스로 선택하지 않는다.
- 실험결과로부터 경쟁 가설을 평가하거나 후속실험을 자율 설계하는 epistemic loop는 입증되지 않았다.
- Hamilton·Tecan 같은 상용 플랫폼에서 생성된 스크립트의 완전한 재현 가능성은 라이선스·장비 접근성의 영향을 받는다.
- 여러 실제 성과가 하나의 통합된 완전자율 캠페인이라기보다 서로 다른 실증 workflow의 집합에 가깝다.
- 아직 bioRxiv 사전공개본이므로 동료심사와 독립기관 재현이 필요하다.
따라서 현재 자율성 수준은 “안전 제약을 갖춘 다중 플랫폼 실험 실행자”이며, 완성형 Autonomous AI Scientist는 아니다.
ETRI: 증거추적형 실험 운영체계
1. 전주기 자율 과학 실험실의 실행·안전 계층
ETRI 목표형상에서는 다음과 같은 계층구조로 수용하는 것이 적절하다.
\[ \text{Hypothesis Agent} \rightarrow \text{Experiment Compiler} \rightarrow \text{Capability Mapper} \rightarrow \text{Deterministic Safety Gate} \rightarrow \text{Distributed Instruments} \rightarrow \text{Evidence Graph} \rightarrow \text{Belief Revision} \]
LabscriptAI는 이 중 Experiment Compiler–Safety Gate–Physical Executor를 구체화한 사례다. MHS와 같은 장비 인터페이스 표준과 경쟁하는 개념이 아니라, 그 위에서 실행계획·검증·복구를 담당하는 상위 계층으로 볼 수 있다.
2. Physical AI 협업지능 패브릭 연계
다기관·다기종 장비를 하나의 실험 workflow로 묶으려면 다음 요소가 필요하다.
- 장비 capability와 제약조건의 기계판독 표현
- 실험단계의 동적 장비 배치
- 실행상태와 권한상태의 실시간 동기화
- 오류 발생 시 로컬 복구와 원격 인간이관
- 공급업체별 API를 가리는 공통 실험 중간표현
- 기관 간 시료·데이터·책임경계 관리
이는 ETRI가 네트워크·분산시스템·AI 에이전트 역량을 결합할 수 있는 지점이다.
3. TxAgentRAG 연계
LabscriptAI의 authoring–simulation–gatekeeper 구조를 다음과 같이 확장할 수 있다.
- Planner: 과학목표를 실험 workflow로 분해
- Retriever: SOP, 장비 매뉴얼, 과거 성공·실패 조건 검색
- Protocol Compiler: 플랫폼별 실행코드 생성
- Critic: assay 의미와 결과해석 검토
- Safety Checker: 생물보안·용량·충돌·권한 검증
- Runtime Monitor: 실제 명령상태와 센서증거 비교
- Recovery Agent: 허용된 범위 안에서 복구행동 제안
중요한 차별화는 검색근거가 단순 문헌이 아니라 현재 장비상태와 이전 실행실패 기록까지 포함하는 execution-grounded RAG가 되는 것이다.
4. AssayKG-RAG 연계
다음 정보를 hyper-relational evidence graph로 기록할 수 있다.
- 프로토콜 단계와 선행·후행 관계
- 시료, well, 농도, 부피, batch
- 장비·pipette·labware·소프트웨어 버전
- 생성코드와 시뮬레이션 결과
- 생물보안 screening 판정
- 실제 명령상태와 센서관측
- 실패원인, 복구제안, 승인·거부·인간개입
- 산출물과 품질검사 결과
이 구조는 동일 protocol이 다른 장비에서 실패하는 원인을 검색하고, 조건부 재현 가능성을 판단하는 데 유용하다.
5. SGI D1–D7 평가
- D1 Hypothesis: 낮음 — 과학가설은 외부에서 제공
- D2 Provenance: 높음 — 코드·manifest·실행추적을 구조적으로 생성
- D3 Counter-Evidence: 중간 — 시뮬레이션 오류와 실행실패는 처리하지만 과학적 반증은 제한적
- D4 Condition Awareness: 높음 — 장비상태·labware·volume·센서조건을 고려
- D5 Uncertainty/Abstention: 비교적 높음 —
ask와suspend를 명시적으로 지원 - D6 Revision: 실행계획 수정은 가능하지만 과학적 믿음수정은 미흡
- D7 External Reproducibility: 다중 플랫폼 검증으로 진전했지만 독립 연구실 재현은 필요
ETRI가 설정할 핵심 KPI는 단순 코드 생성률이 아니라 실장비 성공률, 무인 연속운전 시간, 오류검출·복구율, 위험행동 차단율, 인간이관 적절성, 플랫폼 간 결과 동등성 및 provenance 완전성이어야 한다.
최종적으로 LabscriptAI v3는 “자율 과학자” 자체보다, 그 과학자가 안전하게 물리 세계에 작용하기 위해 필요한 증거추적형·권한분리형 실험 실행 운영체계에 가까우며, ETRI 전주기 자율 과학 실험실의 유력한 비교 기준이다.
Hypothesis Agent부터 Belief Revision까지의 7단계, MHS와의 계층 관계, TxAgentRAG·AssayKG-RAG 및 SGI D1–D7 평가는 첨부의 설계·평가 제안이다. 논문이 전체 epistemic loop를 구현했다는 의미가 아니다.
참고자료
- Execution-aware agent harness for accessible and responsible synthetic biology automationYuan Gao et al. · bioRxiv v3 · 2026-09-24 · 동료심사 전 사전공개본
- LabscriptAI source repository공개 구현·README · 지원 장비와 게이트키퍼·복구 경로 확인
- DOI: 10.1101/2025.09.30.679666bioRxiv 논문의 영속 식별자
원자료: Autonomous Science Lab-0926.md. v3 논문 보고와 공개 구현의 지원 범위를 구분한다. SGI 평가 및 ETRI 설계는 첨부의 분석이다.