2026년 9월 9일 확인된 변화는 두 건이다. 하나는 AI Scientist를 평가하는 질문이 “연구 절차를 끝까지 실행했는가”에서 “스스로 선택한 주장에 충분한 과학적 증거가 있는가”로 이동한 것이고, 다른 하나는 멀티모달 분자 모델과 LLM agent가 실패한 wet-lab 조건을 바탕으로 다음 formulation 조건을 좁혀가는 초기 형태를 보인 것이다.
TruthInsightBench는 reference answer를 숨긴 채 agent의 claim을 evidence auditability, robustness, control testing, cross-dataset generalization, novelty, falsifiability로 평가한다. NSA-Bench와 NSA-Net은 molecule identity만이 아니라 ratio, concentration, pH, temperature, incubation time, provenance를 함께 모델링한다. NSA-Agent는 실패한 조건에서 시작해 LLM이 다음 ratio–time 조합을 제안하고 predictor가 점수를 매겨 검색공간을 좁힌다. 두 연구를 함께 보면 다음 경쟁축은 분명해진다. Generate more candidates → Make defensible claims → Choose informative experiments.
이 글은 첨부된 2026년 9월 9일 AI Co-Scientist × 신약개발 업데이트 전체를 1차 출처로 재구성한다. 첨부 자료는 이번 확인에서 새로운 대형 drug-discovery foundation model이나 완전한 실시간 autonomous wet-lab DMTA 결과를 추가로 확인하지 못했다고 명시한다. Prospective Drug-Discovery TruthInsightBench와 Falsifiability-Driven Closed-Loop Co-Scientist는 source가 제안한 연구기회이며, 이미 end-to-end 검증된 시스템으로 표현하지 않는다.
TruthInsight Tasks
4010개 과학 분야의 40개 동료심사 논문에서 만든 blind discovery task.
Artifact Criteria
6 / 296개 과학적 평가 차원과 29개 artifact-grounded 항목.
NSA-Net ROC-AUC
0.947 / 0.949Small 0.9470±0.0112, Large 0.9492±0.0062.
NSA-Agent Search
64 × 5round마다 64개 ratio–time 조건을 제안하고 5회 propose–score–contract 반복.
AI Co-Scientist의 경쟁축이 candidate volume에서 scientific judgment로 이동한다
새 모델의 크기보다 claim의 품질과 다음 실험의 정보가치가 더 중요한 문제가 되고 있다.
하나는 평가의 변화이고, 다른 하나는 실행의 변화이다
첫 번째 신호는 TruthInsightBench다. 기존 scientific-agent benchmark가 hidden source paper를 얼마나 잘 복원하고 필요한 artifact를 만들어 내는지를 주로 측정했다면, TruthInsightBench는 정답이 정해지지 않은 데이터에서 agent가 어떤 claim을 선택하는지, 그리고 그 claim이 과학적으로 방어 가능한지를 본다.
두 번째 신호는 NSA-Bench / NSA-Net / NSA-Agent다. 이 계열은 “좋은 분자인가?”만 묻지 않는다. 같은 분자 조합이라도 어떤 실험조건에서 관계가 성립하는가를 모델링하고, 실패한 wet-lab 조건을 출발점으로 다음 formulation 조건을 좁혀간다.
더 많이 생성하는 것보다 더 잘 반증하고 더 잘 선택한다
첨부 자료는 이 흐름을 이번 업데이트의 가장 중요한 신호로 본다. 모델 수나 agent 수를 늘리는 것 자체보다, 스스로 만든 주장에 controls, robustness, falsifiability를 붙이고 실제 실험조건을 능동적으로 선택하는 능력이 중요해진다는 해석이다.
연구를 끝냈는가보다, 어떤 주장을 할 가치가 있는지 묻는다
AI Scientist 평가가 task completion에서 evidence-grounded scientific claim quality로 이동한다.
원 논문의 결론·기대값·분석경로를 숨긴다
Yang et al.의 TruthInsightBench: An Evidence-Grounded Benchmark for Automated Evaluation of Open-Ended Scientific Discovery Agents는 10개 과학 분야의 40개 동료심사 논문에서 40개의 blind task를 구성한다. Agent는 중립적인 연구목표와 frozen raw data만 받으며, source paper의 결론, 기대값, 분석경로는 알 수 없다.
핵심은 agent가 “무엇을 주장할 가치가 있는가”를 스스로 결정해야 한다는 점이다. reference answer와 얼마나 비슷한가를 보는 대신, 그 claim이 증거와 반례를 얼마나 잘 견디는지가 평가대상이다.
29개 artifact-grounded 항목으로 claim의 성숙도를 평가한다
| Dimension | Meaning | Why drug discovery needs it |
|---|---|---|
| Evidence auditability | claim이 데이터·분석 artifact에 연결되는가 | 후보 선택이 어떤 assay/omics/structure evidence에서 나왔는지 추적 |
| Robustness | 분석 선택이나 조건 변화에도 결론이 유지되는가 | assay setting, seed, preprocessing 변화에 민감한 후보를 걸러냄 |
| Control testing | 경쟁설명과 confounder를 대조했는가 | negative control과 assay dependency를 명시 |
| Cross-dataset generalization | 다른 데이터에서도 살아남는가 | external cohort, scaffold split에서 재검증 |
| Novelty | 주어진 evidence에서 새 claim을 형성했는가 | known target recovery를 discovery로 오인하는 위험 감소 |
| Falsifiability | 무엇이 나오면 claim을 버릴지 명시하는가 | 후속 반증 실험을 설계할 수 있음 |
네 coding agent를 같은 기반모델로 비교했을 때 전체 점수는 58.4–60.3/100에 머물렀다. 특히 control testing은 약 2/15, robustness는 1–2/15, falsifiability는 1–2/5, cross-dataset generalization은 거의 0/10이었다.
첨부 자료는 저자들의 결론을 현재 병목이 coding ability보다 scientific judgment에 있다고 요약한다. 수치는 동일한 기반모델을 사용한 네 coding agent 비교에서 나온 값이다.
null result와 scope boundary도 좋은 과학이 될 수 있다
BixBench3·PaperBench류가 “주어진 연구를 끝까지 재현할 수 있는가”를 강하게 측정했다면, TruthInsightBench는 정답이 없는 데이터에서 claim을 선택하고 반례·null result·scope boundary까지 검증하는 능력을 본다. 즉 평가축이 task completion → scientific claim quality로 이동한다.
정답 molecule을 찾았는가보다, 후보를 지지하는 증거가 살아남는가를 본다
TruthInsightBench의 평가 철학을 Hit Discovery와 Target Discovery에 옮기면 benchmark 설계 자체가 달라진다.
known target recovery와 affinity ranking은 필요한 평가지만 충분하지 않다
기존 drug-discovery evaluation은 known target recovery, docking score, affinity prediction, 정답 후보 재발견처럼 명확한 target을 두는 경우가 많다. 이런 benchmark는 model skill을 비교하기에 유용하지만, 실제 Co-Scientist가 해야 할 일인 새로운 claim의 타당성 관리를 충분히 측정하지 못한다.
target–disease claim은 하나의 점수가 아니라 검증 패키지여야 한다
예를 들어 새로운 target–disease 관계를 제안한다면 agent는 후보명만 제출해서는 부족하다. negative control, assay dependency, scaffold split, external cohort, contradictory evidence, 후속 반증 실험까지 함께 제시해야 한다.
따라서 Hit Discovery/Target Discovery benchmark의 질문은 “정답 molecule을 찾았는가?”보다 “후보 선택을 뒷받침하는 evidence가 다른 조건에서도 살아남는가?”가 되어야 한다.
가장 자연스러운 다음 단계는 prospective assay까지 포함하는 것이다
TruthInsightBench 자체는 drug discovery 전용이 아니며 40개 task 규모이고 실제 wet-lab outcome을 평가하지 않는다. 고정 LLM judge의 calibration과 bias 역시 별도로 검증해야 한다. 첨부 자료는 다음 연구기회로 Prospective Drug-Discovery TruthInsightBench를 제안한다.
이때 최종 점수는 단순 accuracy보다 falsifiability + reproducibility + experimental utility로 구성하는 방향이 제안된다.
분자에서 조건 공간으로 문제정의가 확장된다
nanomedicine self-assembly를 예측할 때 molecule identity만으로는 충분하지 않다. 환경 조건을 일급 객체로 넣어야 한다.
동일한 분자쌍도 pH·농도·시간·비율에 따라 결과가 달라진다
Hao et al.의 Towards AI-Driven Nanomedicine Discovery: A Benchmark and Multimodal Learning Framework for Nano Self-Assembly Prediction은 특정 조건에서 분자 쌍이 nano self-assembly를 형성하는지를 예측하는 NSA-Bench를 제안한다. 데이터는 molecule identity뿐 아니라 component ratio, concentration, pH, temperature, incubation time, provenance를 포함한다.
이 식이 핵심이다. 문제정의가 “좋은 분자인가?”에서 “어떤 조건에서 이 관계가 성립하는가?”로 바뀐다. Drug discovery에서 assay condition과 context를 일급 객체로 취급해야 한다는 흐름과 맞닿아 있다.
graph, sequence, descriptors, experimental conditions를 함께 사용한다
NSA-Net은 molecular graph topology, SMILES 기반 sequence semantics, physicochemical descriptors와 실험조건을 함께 융합하는 condition-aware multimodal model이다.
Small Track
0.9470±0.0112ROC-AUC. 가장 강한 기존 ML baseline보다 3.9 percentage point 높고 graph baseline보다 17.1 point 높았다.
Large Track
0.9492±0.0062ROC-AUC. 첨부 자료가 보고한 Large track 성능.
chemical identity와 protocol이 분리되지 않는 문제들이 있다
분자 AI의 고전적 framing인 molecule → property나 protein–ligand → affinity는 실험조건을 외생변수처럼 취급하기 쉽다. NSA-Net은 outcome이 조건에 따라 달라지는 formulation 문제에서 protocol context를 prediction target의 일부로 끌어들인다.
실패한 wet-lab 조건에서 다음 formulation 조건을 좁혀간다
분자를 생성하는 agent가 아니라 어떤 실험조건을 다음에 시험할지를 탐색하는 agent라는 점이 중요하다.
Baicalin–Geniposide 실패 조건을 검색의 출발점으로 사용한다
NSA-Agent는 Baicalin–Geniposide 조합에서 실패한 wet-lab 조건을 시작점으로 삼는다. LLM이 매 round 64개의 ratio–time 조건을 제안하고 NSA-Net이 점수를 매긴 뒤, 이전 결과를 이용해 검색영역을 좁히는 propose → score → contract 루프를 5회 수행한다.
이 구조는 molecule generator보다 experimental-condition agent에 가깝다. “무엇을 만들까?”가 아니라 “어떤 조건을 다음에 시험할까?”를 최적화한다.
아직 실시간 autonomous wet-lab closed loop는 아니다
최종 converged condition은 wet-lab follow-up 대상으로 반환된다. 실제 측정 결과가 즉시 model을 업데이트하고 다음 조건을 다시 선택하는 완전한 closed loop까지 이어지지는 않는다. 따라서 이 시스템을 완전한 실시간 autonomous wet-lab DMTA로 부르는 것은 이르다.
formulation optimization과 preclinical development로 확장할 수 있다
첨부 자료는 failed experiment → condition-aware model → next condition proposal 패턴이 solubility, nanoparticle formulation, drug–drug self-assembly, release profile, stability 등의 실험 최적화로 확장될 수 있다고 본다. AI Co-Scientist의 범위가 molecule generation을 넘어 formulation space와 experimental protocol 탐색으로 넓어지는 신호이다.
TruthInsight의 평가 철학과 NSA-Agent의 실험선택을 하나의 루프로 결합한다
가설을 만들고 끝내는 것이 아니라 반증 조건을 함께 만들고, 다음 실험을 정보가치로 선택하고, 결과에 따라 belief를 수정한다.
Falsifiability-Driven Closed-Loop Drug-Discovery Co-Scientist
첨부 자료가 가장 주목할 통합 연구기회로 제안하는 방향이다. 후보 또는 가설을 만들 때 동시에 반증 가능한 prediction과 negative control을 생성하고, Agentic RAG/HRKG가 assay condition·provenance·counter-evidence를 관리하며, Value-of-Information으로 다음 실험을 선택하고, 실제 성공·실패 결과를 belief state와 모델에 다시 반영한다.
가장 높은 predicted score보다 가장 많이 배우는 실험을 고른다
현재 NSA-Agent는 LLM이 조건을 제안하고 고정 predictor가 ranking하는 구조이며 uncertainty와 information gain을 직접 최적화하지 않는다. 다음 단계는 Bayesian/Value-of-Information experiment selection + online model update + robotic wet-lab을 결합하는 것이다.
이 구조에서는 다음 실험을 “성공 확률이 가장 높은 조건”으로만 고르지 않는다. 서로 경쟁하는 가설을 가장 잘 구분하고 uncertainty를 가장 많이 줄이는 조건이 더 높은 가치를 가질 수 있다. 이는 첨부 자료의 VoI 방향을 drug-discovery experimental design 관점으로 확장한 해석이다.
핵심 공백은 prospective generalization과 실제 wet-lab belief revision이다
현재 결과를 닫힌 자율 과학 루프로 과장하지 않으면서 다음 연구단계를 구체화한다.
두 연구가 아직 해결하지 못한 것
| Study | Current limitation | Next research step |
|---|---|---|
| TruthInsightBench | drug discovery 전용이 아니며 40 task, 실제 wet-lab outcome 미평가 | prospective assay와 experimental utility를 포함하는 drug-discovery version |
| TruthInsightBench | 고정 LLM judge의 calibration/bias 가능성 | artifact verifier와 human/experimental cross-check를 포함한 evaluator validation |
| NSA-Bench | Small 97, Large 270 observations로 규모가 작음 | 새 chemical family와 외부 연구실에서 prospective generalization |
| NSA-Agent | 고정 predictor ranking, uncertainty/information gain 직접 최적화하지 않음 | Bayesian/VoI experiment selection + online model update |
| NSA-Agent | converged condition을 wet-lab follow-up 대상으로 반환하는 데서 종료 | robotic wet-lab measurement가 즉시 다음 experiment를 바꾸는 online closed loop |
구조·조건표뿐 아니라 이미지·PK/PD·독성·방출동역학까지
첨부 자료는 다음 확장으로 TEM/cryo-EM/DLS 이미지, PK/PD, toxicity, release kinetics를 함께 결합할 것을 제안한다. 이것은 단순한 modality 추가가 아니다. formulation의 상태와 outcome을 여러 관측계에서 동시에 읽어 multimodal formulation Co-Scientist로 확장하는 방향이다.
2026년 9월 9일 현재 end-to-end prospective wet-lab 검증은 확인되지 않았다
첨부 자료가 마지막으로 강조하는 경계는 분명하다. 후보/가설 생성 → falsifier/negative control → evidence graph → VoI experiment selection → 실제 wet-lab → belief/model update 전체를 drug-discovery wet lab에서 end-to-end prospective하게 검증한 새로운 연구는 이번 최신 검색에서 확인되지 않았다.
AI Co-Scientist의 다음 경쟁축은 후보를 더 많이 만드는 것이 아니다. 스스로 만든 주장을 방어 가능한 형태로 만들고, 가장 정보가치가 높은 다음 실험을 선택하고, 실패한 결과까지 belief revision에 반영하는 능력이다.
Evidence-grounded synthesis of the attached 2026-09-09 update이번 업데이트를 여덟 문장으로 압축하면
01 · Two meaningful signals
새 대형 foundation model보다 claim-quality evaluation과 condition-space exploration이 중요하게 추가되었다.
02 · TruthInsight shift
AI Scientist 평가는 task completion에서 evidence-grounded scientific claim quality로 이동한다.
03 · Scientific judgment bottleneck
네 coding agent는 동일 기반모델 조건에서 58.4–60.3/100에 머물렀고 controls·robustness·falsifiability·generalization이 약했다.
04 · Drug benchmark redesign
known target recovery보다 negative control, assay dependency, external cohort, contradictory evidence, falsifier를 포함해야 한다.
05 · Condition-aware molecular AI
NSA-Net은 molecule identity와 experimental conditions를 함께 모델링한다.
06 · Experimental-condition agent
NSA-Agent는 실패한 wet-lab 조건에서 다음 ratio–time search를 좁힌다.
07 · Still not autonomous DMTA
최종 조건은 follow-up 대상으로 반환되며 실제 측정이 온라인으로 다음 결정을 바꾸는 루프는 아직 아니다.
08 · Research opportunity
Falsifiability + HRKG/Agentic RAG + VoI + online update + robotic wet-lab을 결합한 closed-loop Co-Scientist가 가장 직접적인 다음 연구축이다.
References
첨부 연구동향 문서가 직접 제시한 공식 논문과 코드 링크를 유지한다.
blind discovery task, six-dimensional evidence-grounded evaluation, scientific judgment bottleneck의 핵심 출처.
첨부 자료가 제시한 공식 코드·데이터 저장소.
NSA-Bench, condition-aware NSA-Net, NSA-Agent의 propose–score–contract loop와 성능·제약의 핵심 출처.
첨부 자료가 제시한 NSA-Net 공식 코드 저장소.