Formal Lab Semantics
State → Action실험기기를 단순 tool로 호출하는 것이 아니라 laboratory state와 operation semantics를 machine-checkable하게 표현한다.
Tri-State Neuro-Symbolic AI Co-Scientist for Drug Discovery
2026년 9월 5일 오전까지 새로 확인된 흐름은 하나의 문장으로 압축할 수 있다. Neuro-Symbolic AI Co-Scientist의 symbolic layer가 KG·ontology·logic을 넘어 “명시적으로 관리되는 세 가지 과학 상태”로 확장되고 있다.
첫째, 실험실 자체를 typed symbolic state space로 바꾸어 LLM의 계획을 실행 전에 검증한다. 둘째, persistent memory가 stale evidence를 과신할 수 있으므로 evidence precedence와 belief revision을 분리한다. 셋째, scientific RAG를 context retrieval에서 citation topology를 탐색하는 structural evidence navigation으로 확장한다.
이 글은 첨부된 2026년 9월 5일 Neuro-Symbolic AI Research Watch의 내용 전체를 재구성한다. 첨부 파일은 9월 4일 새로 공개된 drug-specific end-to-end Neuro-Symbolic Co-Scientist는 확인하지 못했다고 명시한다. 아래의 Tri-State architecture는 세 신규 연구와 이전 추적 흐름을 연결해 도출한 연구 방향이며, 단일 논문이 전체 시스템을 실증했다는 의미가 아니다.
이번 추적은 AdaptiveFlow, Epistemic Sybil Resistance, AgentScope, BCO, EvoSCM, ANCHOR-RE, Mol-JEPA와 중복되지 않는 세 연구를 추가하며, Neuro-Symbolic Co-Scientist의 중심축을 상태·검증·증거 구조로 이동시킨다.
실험기기를 단순 tool로 호출하는 것이 아니라 laboratory state와 operation semantics를 machine-checkable하게 표현한다.
Benefit suite에서 모든 모델 크기가 stale value를 매우 높은 비율로 재사용했다는 결과가 장기 과학기억의 위험을 드러낸다.
SciLENS는 약 1,200만 건의 학술 record와 citation graph를 구조적 evidence space로 사용한다.
이 세 축을 함께 보면 Co-Scientist의 symbolic component는 더 이상 “지식을 저장하는 그래프”만을 뜻하지 않는다. 무엇을 믿는지, 왜 믿는지, 그 믿음을 어떤 물리적 실험으로 검증할 수 있는지를 각각 명시적 상태로 유지해야 한다.
가장 중요한 신규 연구는 physical laboratory 자체를 계산 가능한 symbolic state space로 정의한다.
2026년 9월 3일 공개. 이 연구는 LLM agent가 실험기기를 단순 tool-call하는 구조에서 한 걸음 더 나아가 물리적 실험실 전체를 계산 가능한 symbolic state space로 표현한다.
실험 대상과 자원을 타입을 가진 상태 객체로 표현한다.
각 operation을 실제 장비·기능 capability에 묶어 허용되는 변환만 정의한다.
의존성, 조건분기, 반복, concurrency까지 포함해 workflow를 조합 가능한 프로그램으로 표현한다.
실제 modular robotic laboratory에서는 formal operation을 실행 가능한 Function Skill에 연결한다. 핵심은 실행 순서다. Agent가 workflow를 생성하면 곧바로 장비로 dispatch하지 않는다. 먼저 stateful simulation으로 object transformation을 전파하고, operation precondition과 laboratory constraint를 검사한 뒤에만 물리 실행을 허용한다.
첨부 파일은 이 논문이 신약개발 전용도 아니고 논문 자체가 “Neuro-Symbolic AI”라는 명칭을 사용하지 않는다는 점을 분명히 구분한다. 그럼에도 probabilistic LLM planner 위에 deterministic symbolic laboratory representation과 constraint checking을 둔다는 점에서 Neuro-Symbolic autonomous science에 실질적으로 가까운 구조라고 해석한다.
BioProAgent가 FSM을 사용해 장비 상태와 procedure를 제약했다면, 이번 접근은 typed objects와 workflow algebra로 agent reasoning과 physical-world transformation 사이에 formal execution semantics를 둔다는 차이가 있다.
| Drug-discovery object | Symbolic role | Example operation | Constraint example |
|---|---|---|---|
| compound / stock solution | typed research object | dispense, dilute | volume, concentration, solvent compatibility |
| plate / well | container state | dispense, normalize | well capacity, plate format |
| cell line / assay | biological context | incubate, measure | assay protocol, incubation window |
| instrument | capability provider | measure, readout | instrument capability, calibration, safety |
| dose / readout | parameter / observation | repeat, normalize | valid range, units, replicate policy |
이렇게 하면 “후보를 검증하라”는 자연어 명령이 실행 가능성, 순서 유효성, volume·concentration·instrument capability·safety constraint를 machine-checkable하게 증명한 뒤 dispatch되는 experiment contract로 바뀐다.
이 지점이 첨부 파일이 제시하는 중요한 연구공백이다. HRKG가 “무엇을 믿고 있는가”를 저장한다면 laboratory algebra는 “그 믿음을 어떤 실험으로 합법적으로 검증할 수 있는가”를 정의한다. 즉, knowledge-state와 physical-state의 형식적 연결이 연구문제가 된다.
Persistent-memory agent의 핵심 실패는 기억을 갖는 것 자체가 아니라, 과거 기억과 최신 authoritative evidence가 충돌할 때 무엇을 우선할지 결정하는 문제다.
2026년 9월 1일 공개. 이 연구는 Qwen3 0.6B–8B와 Llama 계열에서 과거 저장된 stale fact와 현재 authoritative tool evidence가 충돌할 때 persistent-memory agent가 무엇을 믿는지 분석했다.
모든 크기의 모델이 stale value를 매우 높은 비율로 재사용했다.
특히 더 강한 모델도 오래된 memory가 최신처럼 보이면 authoritative evidence보다 memory를 과신하는 현상이 나타났다.
핵심은 단순하다. 모델 규모가 커진다고 epistemic conflict resolution이 자동으로 좋아지지 않는다. 따라서 Co-Scientist 장기 memory를 vector store나 conversation summary로만 두고 conflict resolution을 LLM의 latent judgment에 맡기는 것은 위험하다.
예를 들어 과거 HRKG에 Compound X is inactive against Target Y가 저장되어 있지만 새 assay가 특정 mutation context에서 활성을 보고할 수 있다. 이때 “어느 쪽을 믿을지”를 모델의 언어적 판단만으로 결정해서는 안 된다.
| Field | Role in epistemic memory |
|---|---|
| valid_time | 해당 사실이 유효하다고 간주되는 시간 범위 |
| observed_time | 실제로 관측·기록된 시점 |
| source_authority | 근거 출처의 권위와 우선순위 |
| assay_context | cell line, mutation, protocol 등 조건적 의미 |
| supersedes / contradicts | 신규 evidence가 기존 evidence를 대체하거나 반박하는 관계 |
| evidence_version | 데이터·분석·모델 버전 |
| revision_status | 검토 중, 수정됨, 기각됨 등 belief revision 상태 |
첨부 파일이 권하는 구조는 symbolic conflict resolver가 먼저 evidence precedence를 계산하고, LLM에는 이미 정리된 belief state만 제공하는 것이다.
이 연구와 앞서 추적한 EvoSCM을 함께 보면 연구문제가 더 선명해진다. EvoSCM이 “어떻게 causal belief를 수정할 것인가”를 다룬다면 Memory Trust Gap은 그 이전 단계인 “어떤 evidence가 revision을 일으킬 자격이 있는가”가 별도의 계산 문제임을 보여준다. 그래서 필요한 것은 단순 Belief Revision Agent가 아니라 Evidence Arbitration → Belief Revision의 2단계 구조다.
SciLENS는 scientific retrieval의 기본 단위를 context chunk가 아니라 citation graph 위의 구조적 evidence path로 바꾼다.
2026년 9월 3일 공개. SciLENS는 약 1,200만 건의 학술 record를 로컬 환경에 인덱싱하고 semantic retrieval뿐 아니라 citation graph의 multi-hop traversal을 agent reasoning의 명시적 도구로 사용한다.
로컬 환경에 인덱싱한 학술 record 규모.
citation KG에서 추출한 학습 데이터를 검증하는 frontier model 수.
성능을 보고한 scientific benchmark 수.
시스템은 citation KG에서 multi-hop subgraph를 추출해 학습 데이터를 자동 생성하고, 20개 frontier model의 cross-model consensus로 이를 검증한다. 그 뒤 reverse-decomposition rubric을 이용한 RL로 early planning과 evidence grounding을 강화한다. Citation topology를 chart로 변환해 reasoning context를 압축하는 structural visualization도 포함한다.
기존 scientific RAG와의 차이는 검색된 문서를 단순 context chunk로 취급하지 않고, citation topology 자체를 탐색 가능한 구조적 evidence space로 사용한다는 데 있다.
첨부 파일에 따르면 SciLENS는 six scientific benchmarks에서 open-source baseline을 상회하고 GPT-5.2·Gemini-3.0-pro에 근접하는 성능을 보고한다. 그러나 현재 평가는 일반 scientific synthesis이며 신약개발 hypothesis validation이나 wet-lab 성능을 평가하지 않았다. 따라서 이 성능을 drug discovery에 직접 일반화해서는 안 된다.
신약 Co-Scientist에 적용하면 PubMed, bioRxiv, ClinicalTrials, ChEMBL, Open Targets의 문헌과 데이터를 단순 RAG 대상으로 두지 않고 다음과 같은 evidence lineage를 만들 수 있다.
이전의 Epistemic Sybil Resistance와 결합하면 동일 원 논문에서 파생된 여러 agent report를 독립 evidence로 잘못 세는 문제도 줄일 수 있다.
최신 흐름을 종합하면 epistemic, causal, physical laboratory state가 각각 다른 질문을 맡고 하나의 폐루프로 연결된다.
Evidence provenance, validity, authority, contradiction, revision status를 포함한 현재 belief state를 명시적으로 표현한다.
관찰된 관계와 causal hypothesis, intervention logic, counterfactual dependency를 연결해 belief의 구조적 이유를 보존한다.
Typed research objects, capability-bound operations, operation preconditions, laboratory constraints를 통해 실행가능성을 계산한다.
지금까지 Neuro-Symbolic Co-Scientist의 symbolic layer가 주로 KG·ontology·logic으로 이해됐다면, 최신 연구는 이를 epistemic·causal·physical state의 공동 관리 문제로 확장한다.
이 구조는 문헌에서 evidence를 찾는 단계, 그 evidence를 현재 belief에 반영할 자격을 판정하는 단계, belief를 검증할 실험을 formal하게 컴파일하는 단계를 하나의 계산 가능한 폐루프로 연결한다.
첨부 파일이 제시하는 최종 연구방향은 HRKG, causal inference, falsification, belief revision, robotic experiment automation의 결합이다.
Can a drug-discovery Co-Scientist jointly maintain epistemic, causal, and physical laboratory states so that every belief revision is supported by provenance-aware evidence and every falsification experiment is formally executable before physical dispatch?
Core research question in the attached research watch이 질문이 강한 이유는 단일 기법의 성능 향상보다 과학적 폐루프의 형식적 정합성을 묻기 때문이다. 어떤 주장이 왜 belief state에 들어왔는지 추적할 수 있어야 하고, 어떤 evidence가 belief revision을 촉발할 자격이 있는지 판정해야 하며, 그 belief를 반증하기 위한 experiment가 실제 laboratory state에서 실행 가능한지도 사전에 증명해야 한다.
HRKG, evidence lineage, causal belief는 과학지식을 구조화하지만 실제 실험의 resource·operation·constraint까지 직접 표현하지 못한다.
Robotic lab automation은 실행을 자동화하지만 왜 그 실험이 특정 belief를 판별하는지 epistemic/causal semantics와 충분히 연결되지 않는다.
이번에 확인된 computable laboratory representation은 이 사이에 formal execution semantics를 넣을 수 있는 실마리를 제공한다. 첨부 파일의 결론대로, HRKG, Neuro-Symbolic reasoning, causal inference, falsification, belief revision, robotic experiment automation을 하나의 계산 가능한 폐루프로 연결하는 연구에는 여전히 큰 공백이 있다.
| Research module | Primary question | Candidate mechanism from the tracked work |
|---|---|---|
| Evidence discovery | 어디서 근거를 찾을 것인가? | SciLENS-style citation KG navigation |
| Evidence grounding | 어떤 biomedical relation과 condition을 추출할 것인가? | ANCHOR-RE류 grounding layer |
| Epistemic memory | 무엇을 언제 어떤 권위로 믿을 것인가? | Epistemic HRKG + temporal/authority metadata |
| Evidence arbitration | 어떤 evidence가 revision 자격을 갖는가? | symbolic precedence / conflict resolver |
| Causal revision | 어떻게 causal belief를 수정할 것인가? | EvoSCM과 연결되는 causal update layer |
| Experiment compilation | 반증 실험이 실제로 실행 가능한가? | computable laboratory state + workflow algebra |
| Physical execution | 검증된 workflow를 어떻게 수행할 것인가? | Function Skills / modular robotic laboratory |
아래 서지와 링크는 첨부 파일에 수록된 출처를 바탕으로 정리했다.
Typed research objects, capability-bound operations, compositional workflow algebra와 stateful simulation을 통해 agent-generated laboratory workflow를 실행 전에 검증하는 연구.
Stale memory와 authoritative evidence의 충돌 상황에서 persistent-memory agent가 보이는 epistemic failure를 분석하며 evidence arbitration의 필요성을 드러낸다.
약 1,200만 건의 학술 record와 citation graph multi-hop traversal을 이용해 scientific evidence navigation과 synthesis를 강화하는 research agent.