논문 검색
자연어 질의와 seed paper를 기반으로 관련 문헌 후보를 넓게 확보한다.
다수의 LLM/SLM 에이전트가 PubMed·PMC·Europe PMC·Semantic Scholar·PubTator와 구조화된 bioactivity 데이터베이스를 함께 사용하여 후보 화합물의 potency, selectivity, cellular activity, toxicity, 재현성과 상충 근거를 추적하는 구현 지침이다.
벡터 검색은 관련 논문을 발견하는 기술이며, hit의 약효·선택성·독성·재현성을 확정하는 기술이 아니다. 논문 수준 검색, 본문 수준 근거 추출, 구조화 bioactivity 검증을 계층적으로 결합해야 한다.
자연어 질의와 seed paper를 기반으로 관련 문헌 후보를 넓게 확보한다.
Methods, Results, 표, 그림 설명에서 assay 조건과 정량 근거를 찾는다.
IC50, Ki, Kd, EC50, unit, target, cell line을 구조화 DB와 대조한다.
지지·반대 근거를 Hyper-Relational Evidence Graph로 연결한다.
사전 계산 임베딩, 관리형 벡터 검색, 원문 코퍼스, 엔터티 보강 자원은 목적이 다르다. 하나의 자원으로 전체 Hit Discovery/Selection 워크플로를 대체할 수 없다.
PubMed 검색 로그의 대규모 query–article 쌍으로 학습한 생의학 검색 모델이다. Query Encoder, Article Encoder, Cross Encoder를 제공하므로 자연어 질문에서 관련 논문을 찾고 재순위화하는 1차 retriever로 적합하다.
Hit Discovery 활용: 표적 생물학, 작용기전, assay, 독성, 선택성 관련 문헌을 자연어 요구조건으로 검색한다.
PubMed 제목과 초록을 SPECTER2로 임베딩한 공개 데이터셋이다. seed paper 기반 유사 논문 검색, chemistry series 확장, 표적별 문헌 클러스터링과 emerging topic 분석에 적합하다.
역할 분담: 질문→논문 검색은 MedCPT, 논문→유사 논문 확장은 Pub2Vec/SPECTER2가 자연스럽다.
대규모 학술 논문 벡터와 인용 관계, 저자, 기관, DOI·PMID 등 식별자를 함께 제공한다. 선행·후속 연구, 재현 연구, 상충 연구와 연구 계보를 확장하는 Graph-enhanced RAG에 강하다.
Hit Discovery 활용: 신규성 평가, 선행 chemistry 탐색, 영향력 있는 후속 연구 및 반증 문헌 탐색에 사용한다.
PMC Open Access의 상업적 재사용 가능 부분집합을 BigQuery에서 SQL과 벡터 검색으로 다루는 관리형 접근이다. 여러 에이전트가 동일한 full-text 계층을 공유하면서 연도·문서 유형·표적 조건을 함께 필터링할 수 있다.
적합한 상황: 대규모 인프라를 직접 운영하지 않고 빠르게 Agentic Literature Review 또는 full-text RAG를 검증할 때 유리하다.
생의학 문헌의 제목, 초록, MeSH, 저자, 저널, 출판 유형을 포함하는 핵심 원천이다. 임베딩 모델, 메타데이터 스키마, 업데이트 정책과 오프라인 운영을 완전히 통제할 수 있다.
Hit Discovery 활용: 가장 넓은 recall을 확보하고, MeSH·publication type·연도 필터로 dense retrieval을 보정한다.
Methods, Results, Discussion, 표, 그림 설명과 supplementary material을 포함하는 핵심 full-text 원천이다. 논문 수준 후보를 실제 assay statement와 정량 근거로 내려가는 2차 evidence index로 사용한다.
Hit Selection 활용: compound–target–assay–endpoint–value–unit–cell line–source 튜플을 문장·표 수준에서 추출한다.
저널 논문, 공개 원문, preprint, annotation, 인용·참고문헌과 데이터베이스 cross-reference를 제공한다. 변화가 빠른 신규 표적과 modality 분야에서 조기 근거 탐색에 유용하다.
Hit Discovery 활용: PubMed·PMC를 보완하고 preprint에서 최신 표적·assay·화합물 시리즈를 조기에 발견한다.
PubMed·PMC에서 gene/protein, disease, chemical, variant와 관계를 자동 주석한다. 문헌 벡터 DB에 entity filter와 query expansion을 결합하고 Evidence Graph를 구축하는 보조 계층이다.
Hit Selection 활용: target ID, variant, chemical entity와 벡터 유사도를 결합해 의미 검색의 오탐을 줄인다.
공개 학술 논문의 구조화된 전체 본문 코퍼스다. 계산화학, virtual screening, docking, GNN, 합성화학과 drug delivery 등 PMC 밖의 인접 분야를 보완한다.
권장 구조: S2AG에서 논문을 찾고 S2ORC에서 본문 passage를 검색하는 2단계 구조가 적합하다.
자연어의 “low nanomolar activity”는 potency를 암시하지만 assay 비교 가능성, endpoint, 단위와 실험 조건을 보장하지 않는다. 구조화 데이터베이스에서 수치를 재검증해야 한다.
문헌에서 큐레이션한 화합물·표적·assay·활성값과 문헌 provenance를 연결한다.
https://www.ebi.ac.uk/chembl/small molecule·RNAi screening, assay annotation, active/inactive 판정과 제출기관 provenance를 제공한다.
https://pubchem.ncbi.nlm.nih.gov/docs/bioassaysdrug-like molecule–protein 사이의 Ki, IC50, Kd 등 측정 결합 친화도와 원 문헌을 연결한다.
https://www.bindingdb.org/검색·추출·검증·반증·통합을 분리하고 중앙 Evidence Graph와 결정론적 도구를 공유한다. 각 모델은 역할에 적합한 문맥만 받고 모든 주장과 도구 호출은 재현 가능하게 기록한다.
질의를 target biology, assay evidence, chemistry, selectivity, safety, contradiction 질문으로 분해한다.
질환–표적–경로의 인과적 타당성, genetic evidence와 translational relevance를 조사한다.
Methods·Results·표에서 compound–target–assay–endpoint–value–unit 튜플을 추출한다.
유사 scaffold, chemistry series, SAR, synthetic tractability와 선행 특허·논문을 확장한다.
wild type, paralog, kinase panel, counter-screen과 off-target 근거를 별도로 수집한다.
cytotoxicity, hERG, CYP, mitochondrial toxicity, aggregation과 reactive metabolite 위험을 조사한다.
초기 hit score를 보지 않고 failed, inactive, non-selective, irreproducible 근거를 독립적으로 탐색한다.
모든 주장에 PMID·PMCID·DOI, section, table/figure ID와 구조화 DB 레코드를 연결한다.
다수 에이전트 결과를 단순 다수결이 아니라 독립 근거 수, assay 비교 가능성과 uncertainty로 통합한다.
검색 정확도보다 더 어려운 문제는 서로 다른 모델·인덱스·근거 단위를 일관되게 통합하고 재현하는 일이다.
MedCPT, SPECTER2, 자체 embedding의 cosine score는 직접 비교할 수 없다. 인덱스를 분리하고 rank normalization 또는 reciprocal-rank fusion으로 통합한다.
LLM/SLM마다 질의 표현이 달라 결과가 흔들린다. 공통 query schema, entity normalization, date cutoff를 강제한다.
여러 에이전트가 동일 논문·동일 실험을 독립 근거로 집계할 수 있다. 독립 연구기관·독립 assay·독립 dataset 단위로 evidence count를 계산한다.
각 SLM이 부분 근거만 보면 전체 assay 조건과 반대 근거를 놓친다. 중앙 Evidence Graph에서 claim, qualifier, evidence, counter-evidence를 공유한다.
0.5 μM와 50 nM, IC50와 Ki, pIC50를 LLM이 직접 비교하게 두지 않는다. 단위 변환과 endpoint 호환성은 결정론적 함수가 처리한다.
초기 planner의 가설이 후속 검색을 편향시킬 수 있다. Contradiction Agent에는 후보 점수와 지지 근거를 숨긴 독립 탐색 조건을 적용한다.
운영 인덱스는 계속 갱신되지만 실험은 특정 시점 스냅숏으로 재현되어야 한다. corpus date, model checksum, index parameter, top-k를 기록한다.
검색 가능성과 원문 재배포 가능성은 다르다. 각 chunk에 source license를 저장하고 답변에는 짧은 인용과 원문 링크만 제공한다.
Potency 근거
Cellular activity
Selectivity
독립 재현성
Evidence quality
Toxicity·off-target penalty
Uncertainty·assay mismatch
벡터 유사도는 P 자체가 아니라 문헌 후보 검색 신호다.
| 자원 | 형태 | Hit Discovery | Hit Selection | 핵심 역할 | 대표 문제점 |
|---|---|---|---|---|---|
| MedCPT PubMed Embeddings | 사전 벡터 | 매우 높음 | 중간 | 자연어 질문→논문 검색 | 초록·논문 수준, 최신성 관리 |
| Pub2Vec | 사전 벡터 | 높음 | 중간 | 유사 논문·주제 확장 | 문서 유사성 중심, assay 혼합 |
| S2AG SPECTER2 | 사전 벡터+그래프 | 높음 | 중간 | 인용·연구 계보·반증 탐색 | 규모, 비생의학 혼입, ID 매핑 |
| BigQuery PMC | 관리형 벡터 검색 | 높음 | 높음 | SQL+full-text 검색 | 비용, OA subset, 클라우드 종속 |
| PubMed Baseline | 원천 코퍼스 | 매우 높음 | 중간 | 전체 recall·자체 인덱스 | 임베딩 비용, 본문 부재, 업데이트 |
| PMC OA | 원문 코퍼스 | 높음 | 매우 높음 | assay 문장·표 근거 | 라이선스, OA 편향, 표 파싱 |
| Europe PMC | 원문+preprint | 높음 | 높음 | 최신 문헌·version 추적 | 중복, preprint 신뢰도, 정규화 |
| PubTator | 엔터티 보강 | 보조적으로 매우 높음 | 높음 | entity filter·KG 구축 | 자동 주석 오류, 부정·qualifier 처리 |
| S2ORC | 범용 원문 코퍼스 | 중간~높음 | 중간 | 계산화학·AI·합성화학 보완 | PDF 노이즈, 비생의학 혼입 |
이 구조는 여러 LLM/SLM이 서로 다른 전문 역할을 수행하더라도 최종 Hit Selection 결과를 특정 논문, 특정 assay, 특정 수치와 연결하고, 근거 중복·상충·불확실성을 명시할 수 있게 한다.