BioAgenticRAG
MULTI-LLM/SLM · HIT DISCOVERY · EVIDENCE-NATIVE RAG

신약개발을 위한
Biomedical Literature Vector DB

다수의 LLM/SLM 에이전트가 PubMed·PMC·Europe PMC·Semantic Scholar·PubTator와 구조화된 bioactivity 데이터베이스를 함께 사용하여 후보 화합물의 potency, selectivity, cellular activity, toxicity, 재현성과 상충 근거를 추적하는 구현 지침이다.

RAG
MedCPT
Question → Article
PMC OA
Passage Evidence
ChEMBL
Assay Validation
S2AG
Citation Graph
PubTator
Entity Layer
Executive Summary

문헌 검색과 Hit 판단을 분리한다

벡터 검색은 관련 논문을 발견하는 기술이며, hit의 약효·선택성·독성·재현성을 확정하는 기술이 아니다. 논문 수준 검색, 본문 수준 근거 추출, 구조화 bioactivity 검증을 계층적으로 결합해야 한다.

핵심 원칙: MedCPT·Pub2Vec·SPECTER2는 후보 문헌 발견에 사용하고, PMC·Europe PMC는 문장·표 단위 근거 추출에 사용하며, ChEMBL·BindingDB·PubChem BioAssay는 potency와 assay 조건 검증에 사용한다.
1

논문 검색

자연어 질의와 seed paper를 기반으로 관련 문헌 후보를 넓게 확보한다.

2

본문 검색

Methods, Results, 표, 그림 설명에서 assay 조건과 정량 근거를 찾는다.

3

수치 검증

IC50, Ki, Kd, EC50, unit, target, cell line을 구조화 DB와 대조한다.

4

근거 통합

지지·반대 근거를 Hyper-Relational Evidence Graph로 연결한다.

권장 검색·검증 파이프라인

질의 구조화표적·질환·assay·endpoint
논문 후보 검색MedCPT / Pub2Vec
문헌 확장S2AG 인용 그래프
본문 검색PMC / Europe PMC
엔터티 정규화PubTator / MeSH
활성 검증ChEMBL / BindingDB
Hit RankingEvidence-aware score
Open Data Landscape

공개 Vector DB 및 벡터화 가능한 문헌 자원

사전 계산 임베딩, 관리형 벡터 검색, 원문 코퍼스, 엔터티 보강 자원은 목적이 다르다. 하나의 자원으로 전체 Hit Discovery/Selection 워크플로를 대체할 수 없다.

사전 계산 임베딩생의학 전용

NCBI MedCPT PubMed Embeddings

01

PubMed 검색 로그의 대규모 query–article 쌍으로 학습한 생의학 검색 모델이다. Query Encoder, Article Encoder, Cross Encoder를 제공하므로 자연어 질문에서 관련 논문을 찾고 재순위화하는 1차 retriever로 적합하다.

Hit Discovery 활용: 표적 생물학, 작용기전, assay, 독성, 선택성 관련 문헌을 자연어 요구조건으로 검색한다.

고려사항과 Challenges
논문 수준 압축: 표·보충자료의 IC50, cell line, assay 조건이 단일 벡터에서 희석된다.
벡터 공간 일치: 사전 계산 article vector에는 반드시 MedCPT Query Encoder를 사용해야 한다.
최신성: 스냅숏 이후 신규 논문은 동일 encoder로 증분 임베딩해야 한다.
초록 편향: 부정적 결과와 독성 문제는 본문 또는 supplementary material에만 존재할 수 있다.
사전 계산 임베딩문서 유사성

Pub2Vec · PubVec

02

PubMed 제목과 초록을 SPECTER2로 임베딩한 공개 데이터셋이다. seed paper 기반 유사 논문 검색, chemistry series 확장, 표적별 문헌 클러스터링과 emerging topic 분석에 적합하다.

역할 분담: 질문→논문 검색은 MedCPT, 논문→유사 논문 확장은 Pub2Vec/SPECTER2가 자연스럽다.

고려사항과 Challenges
질의 적합성: 짧은 사용자 질의보다 논문 스타일의 확장 질의가 더 안정적이다.
Assay 불일치: 의미가 유사해도 biochemical assay와 cellular assay는 비교할 수 없다.
정보 혼합: 하나의 논문에 여러 표적·화합물·endpoint가 섞이면 검색 근거가 모호해진다.
스냅숏 갱신: Annual Baseline 이후 일일 업데이트를 별도로 처리해야 한다.
사전 계산 임베딩인용 그래프

Semantic Scholar S2AG · SPECTER2

03

대규모 학술 논문 벡터와 인용 관계, 저자, 기관, DOI·PMID 등 식별자를 함께 제공한다. 선행·후속 연구, 재현 연구, 상충 연구와 연구 계보를 확장하는 Graph-enhanced RAG에 강하다.

Hit Discovery 활용: 신규성 평가, 선행 chemistry 탐색, 영향력 있는 후속 연구 및 반증 문헌 탐색에 사용한다.

고려사항과 Challenges
대규모 운영: 전체 벡터 적재보다 PMID·분야·연도 기반 부분집합이 현실적이다.
비생의학 혼입: 유전자 심볼과 타 분야 약어 충돌을 entity filter로 완화해야 한다.
인용 편향: 인용 수는 증거 품질이 아니며 오래된 논문에 유리하다.
식별자 정합성: corpusId–PMID–PMCID–DOI 매핑과 중복 제거가 필요하다.
관리형Full Text

Google BigQuery PMC Vector Search

04

PMC Open Access의 상업적 재사용 가능 부분집합을 BigQuery에서 SQL과 벡터 검색으로 다루는 관리형 접근이다. 여러 에이전트가 동일한 full-text 계층을 공유하면서 연도·문서 유형·표적 조건을 함께 필터링할 수 있다.

적합한 상황: 대규모 인프라를 직접 운영하지 않고 빠르게 Agentic Literature Review 또는 full-text RAG를 검증할 때 유리하다.

고려사항과 Challenges
비용: query scan, embedding, index, model call 비용을 에이전트별 예산으로 통제해야 한다.
부분집합 편향: 전체 PubMed가 아니라 OA·라이선스 가능한 subset이다.
클라우드 종속: 검색 결과와 query trace를 별도 보존해야 재현성이 확보된다.
청킹: 전체 논문 단일 벡터보다 section·paragraph·table 단위 테이블이 필요하다.
벡터화 필요최대 Recall

PubMed Annual Baseline

05

생의학 문헌의 제목, 초록, MeSH, 저자, 저널, 출판 유형을 포함하는 핵심 원천이다. 임베딩 모델, 메타데이터 스키마, 업데이트 정책과 오프라인 운영을 완전히 통제할 수 있다.

Hit Discovery 활용: 가장 넓은 recall을 확보하고, MeSH·publication type·연도 필터로 dense retrieval을 보정한다.

고려사항과 Challenges
구축 비용: 수천만 레코드 임베딩과 인덱싱에 큰 계산·저장 비용이 발생한다.
수정·삭제 처리: daily update는 append가 아니라 PMID 기반 upsert/delete로 처리해야 한다.
본문 부재: 핵심 assay 수치는 PMC 또는 출판사 본문과 연결해야 한다.
시간 누출: 실험 시점 이후 문헌을 차단하는 corpus snapshot이 필요하다.
Full Text근거 추출

PMC Open Access Subset

06

Methods, Results, Discussion, 표, 그림 설명과 supplementary material을 포함하는 핵심 full-text 원천이다. 논문 수준 후보를 실제 assay statement와 정량 근거로 내려가는 2차 evidence index로 사용한다.

Hit Selection 활용: compound–target–assay–endpoint–value–unit–cell line–source 튜플을 문장·표 수준에서 추출한다.

고려사항과 Challenges
라이선스: 논문별 재사용·상업 이용 조건을 vector record에 유지해야 한다.
OA 편향: 구독형 medicinal chemistry 문헌이 누락될 수 있다.
표 파싱: 행·열·단위·endpoint 연결을 보존하는 구조화 추출이 필요하다.
청킹: section·paragraph·table 경계를 유지하고 중복 chunk를 제거해야 한다.
Full TextPreprint

Europe PMC

07

저널 논문, 공개 원문, preprint, annotation, 인용·참고문헌과 데이터베이스 cross-reference를 제공한다. 변화가 빠른 신규 표적과 modality 분야에서 조기 근거 탐색에 유용하다.

Hit Discovery 활용: PubMed·PMC를 보완하고 preprint에서 최신 표적·assay·화합물 시리즈를 조기에 발견한다.

고려사항과 Challenges
중복: PMID·PMCID·DOI·normalized title 기준 통합이 필요하다.
Version 관리: preprint와 최종 논문을 독립 근거로 중복 계산하면 안 된다.
근거 수준: peer review 여부를 hit score와 최종 설명에 반영해야 한다.
메타데이터 이질성: 날짜·문서 유형·저자·license를 정규화해야 한다.
보강 계층Entity-aware

PubTator Central · PubTator 3.0

08

PubMed·PMC에서 gene/protein, disease, chemical, variant와 관계를 자동 주석한다. 문헌 벡터 DB에 entity filter와 query expansion을 결합하고 Evidence Graph를 구축하는 보조 계층이다.

Hit Selection 활용: target ID, variant, chemical entity와 벡터 유사도를 결합해 의미 검색의 오탐을 줄인다.

고려사항과 Challenges
자동 주석 오류: 개체 공기출현이 직접적인 억제·결합 관계를 의미하지 않는다.
심볼 모호성: gene symbol, organism, isoform, mutant를 구분해야 한다.
부정 표현: “did not inhibit”를 양성 관계로 오인하지 않도록 polarity를 추출해야 한다.
Qualifier 부족: assay, endpoint, value, unit, condition을 별도로 추출해야 한다.
Full Text범용 과학

S2ORC

09

공개 학술 논문의 구조화된 전체 본문 코퍼스다. 계산화학, virtual screening, docking, GNN, 합성화학과 drug delivery 등 PMC 밖의 인접 분야를 보완한다.

권장 구조: S2AG에서 논문을 찾고 S2ORC에서 본문 passage를 검색하는 2단계 구조가 적합하다.

고려사항과 Challenges
비생의학 혼입: 분야 분류와 biomedical entity filter가 필요하다.
PDF 추출 노이즈: 표, 화학식, 수식, 그림 설명의 구조가 손상될 수 있다.
라이선스: 개별 원문의 이용 조건을 확인해야 한다.
구조화 필요: assay fact와 수치 추출 파이프라인은 별도로 구축해야 한다.
Structured Validation

문헌 벡터 검색을 bioactivity 검증과 연결한다

자연어의 “low nanomolar activity”는 potency를 암시하지만 assay 비교 가능성, endpoint, 단위와 실험 조건을 보장하지 않는다. 구조화 데이터베이스에서 수치를 재검증해야 한다.

Curated Bioactivity

ChEMBL

문헌에서 큐레이션한 화합물·표적·assay·활성값과 문헌 provenance를 연결한다.

https://www.ebi.ac.uk/chembl/
Binding Affinity

BindingDB

drug-like molecule–protein 사이의 Ki, IC50, Kd 등 측정 결합 친화도와 원 문헌을 연결한다.

https://www.bindingdb.org/
문헌에서 후보 주장 발견 → PMID/DOI와 compound/target 정규화 → ChEMBL·BindingDB·PubChem BioAssay에서 수치 대조 → 원문 Methods·Results에서 assay 조건 확인 → 상충 결과·독성·off-target 근거 탐색 → 검증된 Hit Evidence Record 생성

Hit Evidence Record 최소 스키마

{ "compound": {"id": "...", "name": "...", "smiles": "..."}, "target": {"id": "...", "name": "...", "variant": "..."}, "assay": {"type": "biochemical|cellular|binding", "format": "..."}, "endpoint": "IC50|Ki|Kd|EC50", "value": 12.4, "unit": "nM", "conditions": {"species": "...", "cell_line": "...", "exposure": "..."}, "selectivity": {"wild_type_ratio": "...", "off_targets": ["..."]}, "source": {"pmid": "...", "pmcid": "...", "doi": "...", "section": "..."}, "status": {"peer_reviewed": true, "retracted": false, "confidence": 0.91} }
System Architecture

멀티 LLM/SLM Agentic RAG 권장 아키텍처

검색·추출·검증·반증·통합을 분리하고 중앙 Evidence Graph와 결정론적 도구를 공유한다. 각 모델은 역할에 적합한 문맥만 받고 모든 주장과 도구 호출은 재현 가능하게 기록한다.

Retrieval Layer
Index A · MedCPT
자연어 질문 → PubMed 후보 논문
Index B · Pub2Vec/S2AG
유사 논문·인용·후속 연구 확장
Index C · PMC/Europe PMC
Methods·Results·Table passage 검색
Index D · PubTator
Gene·Chemical·Disease·Variant filter
Evidence Orchestration Core
Planner / Router
질의를 표적 타당성, potency, selectivity, safety 질문으로 분해
Hyper-Relational Evidence Graph
Claim–Evidence–Assay–Qualifier–Source–Counter-evidence 연결
Deterministic Validation
단위 변환, endpoint 비교, 중복 제거, 식별자 매핑, 날짜 컷오프
Provenance Ledger
query, top-k, model, index snapshot, 결과 PMID, agent trace 저장
Validation & Decision Layer
ChEMBL
큐레이션 bioactivity 검증
BindingDB
결합 친화도 검증
PubChem BioAssay
screening active/inactive 검증
Hit Ranker
potency·cellular·selectivity·toxicity·uncertainty 통합
Agent Roles

에이전트 역할을 과학적 검토 절차로 설계한다

Planner · Router

질의를 target biology, assay evidence, chemistry, selectivity, safety, contradiction 질문으로 분해한다.

Target Biology Agent

질환–표적–경로의 인과적 타당성, genetic evidence와 translational relevance를 조사한다.

Assay Evidence Agent

Methods·Results·표에서 compound–target–assay–endpoint–value–unit 튜플을 추출한다.

Chemistry · SAR Agent

유사 scaffold, chemistry series, SAR, synthetic tractability와 선행 특허·논문을 확장한다.

Selectivity Agent

wild type, paralog, kinase panel, counter-screen과 off-target 근거를 별도로 수집한다.

Safety Agent

cytotoxicity, hERG, CYP, mitochondrial toxicity, aggregation과 reactive metabolite 위험을 조사한다.

Contradiction Agent

초기 hit score를 보지 않고 failed, inactive, non-selective, irreproducible 근거를 독립적으로 탐색한다.

Provenance Validator

모든 주장에 PMID·PMCID·DOI, section, table/figure ID와 구조화 DB 레코드를 연결한다.

Consensus Ranker

다수 에이전트 결과를 단순 다수결이 아니라 독립 근거 수, assay 비교 가능성과 uncertainty로 통합한다.

공통 질의 스키마

{ "target": "BRAF V600E", "disease": "melanoma", "modality": "small molecule", "task": "hit selection", "assays": ["biochemical", "cellular"], "endpoints": ["IC50", "Ki", "EC50"], "requirements": ["wild-type selectivity", "cytotoxicity", "independent replication"], "date_cutoff": "YYYY-MM-DD" }
Cross-cutting Challenges

멀티 에이전트 환경의 핵심 기술적 문제

검색 정확도보다 더 어려운 문제는 서로 다른 모델·인덱스·근거 단위를 일관되게 통합하고 재현하는 일이다.

서로 다른 벡터 공간

MedCPT, SPECTER2, 자체 embedding의 cosine score는 직접 비교할 수 없다. 인덱스를 분리하고 rank normalization 또는 reciprocal-rank fusion으로 통합한다.

검색 결과 불일치

LLM/SLM마다 질의 표현이 달라 결과가 흔들린다. 공통 query schema, entity normalization, date cutoff를 강제한다.

중복 근거 과대계산

여러 에이전트가 동일 논문·동일 실험을 독립 근거로 집계할 수 있다. 독립 연구기관·독립 assay·독립 dataset 단위로 evidence count를 계산한다.

Context Fragmentation

각 SLM이 부분 근거만 보면 전체 assay 조건과 반대 근거를 놓친다. 중앙 Evidence Graph에서 claim, qualifier, evidence, counter-evidence를 공유한다.

수치 비교 오류

0.5 μM와 50 nM, IC50와 Ki, pIC50를 LLM이 직접 비교하게 두지 않는다. 단위 변환과 endpoint 호환성은 결정론적 함수가 처리한다.

Confirmation Bias

초기 planner의 가설이 후속 검색을 편향시킬 수 있다. Contradiction Agent에는 후보 점수와 지지 근거를 숨긴 독립 탐색 조건을 적용한다.

최신성과 재현성

운영 인덱스는 계속 갱신되지만 실험은 특정 시점 스냅숏으로 재현되어야 한다. corpus date, model checksum, index parameter, top-k를 기록한다.

라이선스와 재배포

검색 가능성과 원문 재배포 가능성은 다르다. 각 chunk에 source license를 저장하고 답변에는 짧은 인용과 원문 링크만 제공한다.

Hit Selection 통합 점수 예시

S(h) = wpP + wcC + wsS + wrR + weE − wtT − wuU
P

Potency 근거

C

Cellular activity

S

Selectivity

R

독립 재현성

E

Evidence quality

T

Toxicity·off-target penalty

U

Uncertainty·assay mismatch

주의

벡터 유사도는 P 자체가 아니라 문헌 후보 검색 신호다.

Decision Matrix

자원별 Hit Discovery/Selection 적합성

자원형태Hit DiscoveryHit Selection핵심 역할대표 문제점
MedCPT PubMed Embeddings사전 벡터매우 높음중간자연어 질문→논문 검색초록·논문 수준, 최신성 관리
Pub2Vec사전 벡터높음중간유사 논문·주제 확장문서 유사성 중심, assay 혼합
S2AG SPECTER2사전 벡터+그래프높음중간인용·연구 계보·반증 탐색규모, 비생의학 혼입, ID 매핑
BigQuery PMC관리형 벡터 검색높음높음SQL+full-text 검색비용, OA subset, 클라우드 종속
PubMed Baseline원천 코퍼스매우 높음중간전체 recall·자체 인덱스임베딩 비용, 본문 부재, 업데이트
PMC OA원문 코퍼스높음매우 높음assay 문장·표 근거라이선스, OA 편향, 표 파싱
Europe PMC원문+preprint높음높음최신 문헌·version 추적중복, preprint 신뢰도, 정규화
PubTator엔터티 보강보조적으로 매우 높음높음entity filter·KG 구축자동 주석 오류, 부정·qualifier 처리
S2ORC범용 원문 코퍼스중간~높음중간계산화학·AI·합성화학 보완PDF 노이즈, 비생의학 혼입
Recommended Stack

최종 권장 조합

운영 권장 스택

1차 recall: MedCPT PubMed Embeddings
유사·인용 확장: Pub2Vec + S2AG
본문 근거: PMC OA + Europe PMC
엔터티 정규화: PubTator + MeSH
활성 검증: ChEMBL + BindingDB + PubChem
반증 탐색: 독립 Contradiction Agent
중앙 메모리: Hyper-Relational Evidence Graph
재현성: corpus·model·query·index ledger

최종 설계 문장

MedCPT와 Pub2Vec는 관련 논문을 찾고, PMC와 Europe PMC는 assay·수치·한계의 원문 근거를 확인하며, ChEMBL·BindingDB·PubChem BioAssay는 potency와 실험 조건을 검증한다. 모든 결과는 지지와 반대 근거를 함께 갖는 Hyper-Relational Evidence Graph로 통합한다.

이 구조는 여러 LLM/SLM이 서로 다른 전문 역할을 수행하더라도 최종 Hit Selection 결과를 특정 논문, 특정 assay, 특정 수치와 연결하고, 근거 중복·상충·불확실성을 명시할 수 있게 한다.

Primary Sources

주요 출처 URL

  1. NCBI MedCPT
  2. MedCPT Precomputed PubMed Embeddings
  3. Pub2Vec
  4. Semantic Scholar Datasets API
  5. SPECTER2
  6. BigQuery Vector Search
  7. Google PubMed Agentic RAG Example
  8. PubMed Data Download
  9. PMC Open Access Subset
  10. Europe PMC Developers
  11. PubTator 3.0
  12. S2ORC
  13. ChEMBL
  14. PubChem BioAssay
  15. BindingDB