Molecular Docking · 구조기반 신약설계의 오늘

분자의
결구법

단백질이 제 몸에 파놓은 홈, 그 자리에 꼭 맞아 들어가는 작은 분자 하나. 그 맞물림을 계산으로 미리 읽는 일.

옛 목수는 못을 쓰지 않았다. 나무와 나무가 서로의 몸을 파고들어 스스로 버티게 했으니, 그것을 결구(結構)라 한다. 분자의 세계에도 결구가 있다. 다만 여기서는 자와 끌 대신 samplingscoring function이 그 일을 한다.

결구도 — 단백질 결합 부위와 리간드의 맞물림 단백질 표면에 파인 결합 부위(pocket)와, 그 홈에 들어가 앉는 리간드 분자를 선으로 그린 그림. 결합 부위 BINDING POCKET 리간드 LIGAND RMSD ≤ 2 Å — 성공의 눈금 結構 分子

홈과 촉, 그 맞물림의 정의Definition

분자 도킹은 이미 알려진 3차원 단백질 구조, 또는 AlphaFold 같은 도구가 예측해낸 구조의 결합 부위(binding pocket)에 리간드를 놓아보고, 돌려보고, 구부려보는 일이다. 그렇게 자세를 바꿔가며 scoring function으로 결합 에너지와 상호작용을 하나하나 따져본다. 목수가 촉을 홈에 대어보며 두어 번 두드려보는 것과 다르지 않다.

목적은 둘이다. 하나는 가장 안정된 결합 포즈(pose)를 짚어내는 것이고, 다른 하나는 가상 스크리닝(virtual screening, VS)에서 후보 화합물을 줄 세우는 것이다.

근래에는 판이 더 커졌다. 단순한 포즈 예측을 넘어 protein–ligand interaction modeling 전반으로 넓어지면서, DL-augmented docking, generative diffusion models, hybrid physics–AI approaches가 모두 이 이름 안으로 들어왔다.

Structure-Based Drug Design 분자 도킹은 SBDD, 곧 구조기반 신약설계의 한가운데 놓인 계산 기법이다. 표적 단백질의 생김새를 알아야 그에 맞는 열쇠를 깎을 수 있다는, 지극히 단순하고 오래된 발상에서 출발한다.

조 단위의 창고에서 한 알을 고르는 일Problem Definition

신약 개발의 병목은 늘 같은 자리에 있다. 수천억에서 조 단위에 이르는 방대한 chemical space에서, 하필 그 표적에만 선택적으로 붙는 분자를 어떻게 효율적으로 찾아낼 것인가.

실험으로 하는 high-throughput screening은 비용과 시간이 막대하다. 게다가 구조 정보가 부족한 표적, 유연성이 큰 단백질, 아직 아무도 들여다본 적 없는 새 포켓 앞에서는 그마저도 힘을 쓰지 못한다.

그래서 도킹은 이 문제를 이렇게 고쳐 적는다. 구조에 근거한 결합 가설을 만들어내고, 대규모 라이브러리에 순위를 매기는 일이라고. 다만 전통적 방법은 계산 비용과 scoring 정확도, 단백질 유연성 처리에서 한계를 드러내고, 딥러닝 방법은 일반화(generalization)와 물리적 타당성이라는 새로운 숙제를 들고 온다.

문제는 “붙느냐 안 붙느냐”가 아니라, 붙는다고 말한 것 중 몇이 실제로 붙느냐다.
규모의 감각 10¹¹~10¹² 오늘날 탐색 대상이 되는 화합물의 수. 사람의 손으로는 셀 수 없고, 실험실의 로봇으로도 다 만져볼 수 없는 크기다. 계산이 먼저 훑고 지나가야 하는 이유가 여기 있다.

여섯 개의 열쇠말Core Concepts

이 분야의 말들은 어렵기보다 낯설 뿐이다. 여섯 개만 손에 익히면 논문의 그림이 달리 보이기 시작한다.

탐색Sampling

리간드의 형태와 위치, 배향을 훑는 일. rigid, flexible, induced-fit의 세 층위로 나뉜다.

채점 함수Scoring function

결합 자유에너지를 근사하는 자. 물리 기반, 지식 기반, 경험적, 그리고 ML·DL 기반이 있다.

포즈 정확도Pose accuracy

정답 구조와의 어긋남이 RMSD 2 Å 이하인가. 이 성공률이 이 바닥의 대표 눈금이다.

단백질 유연성Protein flexibility

수용체의 측쇄와 backbone은 움직인다. cryptic pocket과 알로스테릭 부위가 여기서 생긴다.

혼성 접근Hybrid approaches

전통 도킹에 DL rescoring을 얹거나, diffusion 기반 생성과 ensemble docking을 겹쳐 쓴다.

농축도VS enrichment

진짜 binder를 상위에 올려놓는 능력. EF1% 같은 지표로 잰다.

이 여섯을 관통하는 오늘의 화두는 하나로 모인다. physics-based 방법의 이론적 엄밀성과 data-driven 방법의 확장성·속도를 어떻게 한 몸으로 만들 것인가.

삼십 년의 내력Introduction

1990년대 초부터 자라난 docking-based virtual screening(DBVS)은 구조기반 신약설계의 주춧돌이었다. AutoDock, Glide, GOLD 같은 도구들이 오랜 세월 그 자리를 지켰고, 실제로 적지 않은 성과를 냈다.

그러나 라이브러리가 억 단위를 넘어서고 AlphaFold의 시대가 열리면서 오래된 연장의 이가 드러났다. 2025~2026년의 문헌들은 딥러닝이 포즈 예측과 scoring을 지나 de novo 설계에까지 스며들었음을 보여준다. 이제 “physics + data-driven”의 융합이 예외가 아니라 표준이다.

여기에 open-source 생태계와 AI-augmented workflow가 더해지면서, 한때 값비싼 상용 소프트웨어의 몫이던 일을 지금은 훨씬 많은 연구실이 손에 쥐게 되었다.

세 벌의 오래된 연장 AutoDock · Glide · GOLD. 이 이름들은 지금도 벤치마크의 기준선으로 남아 있다. 새 방법이 나올 때마다 가장 먼저 비교당하는 자리에 서 있다는 것은, 그 자체로 이 연장들의 격을 말해준다.

왜 계산으로 먼저 보는가Motivation & Background

실험만으로 가는 신약 개발은 실패율이 높고 값이 비싸다. 임상 단계까지 수십억 달러가 든다. 계산 방법이 선택이 아니라 필수가 된 배경이 이것이다.

kinase, 항생제 내성, 암, 신경퇴행성 질환 같은 영역에서는 이미 docking과 MD를 잇는 통합 파이프라인이 표준으로 자리 잡았다. AlphaFold2와 AlphaFold3, diffusion models, 그리고 DrugCLIP 같은 contrastive learning이 등장하면서 쓸 수 있는 구조 정보가 폭발적으로 늘었고, 수십억 화합물을 다루는 ultra-large-scale docking도 현실이 되었다.

동기는 결국 한 줄이다. 더 빠르고, 더 정확하며, 더 일반화 가능한 결합 예측.

임상까지의 값 $수십억 하나의 약이 환자에게 닿기까지 드는 비용. 계산이 절약하는 것은 시간이 아니라, 실패할 후보를 일찍 걸러냄으로써 아끼는 이 돈이다.

일곱 가지 난제Challenges

좋은 답사기가 그러하듯, 이 분야의 실상도 성과보다 한계를 들여다볼 때 더 정직하게 보인다.

지금 묻고 있는 것들Research Questions

최근 논문들이 실제로 붙들고 있는 질문은 다음과 같이 정리된다.

다섯 갈래의 연장Approaches

연장은 손에 익은 것이 좋은 연장이지만, 새 나무에는 새 연장이 필요한 법이다. 지금 쓰이는 방법은 크게 다섯 갈래로 갈린다.

전통 물리 기반Physics-based

AutoDock Vina, Glide, GOLD. 탐색과 가산적 scoring이라는 오래된 두 축으로 움직인다.

딥러닝 기반Deep learning

SurfDock·DiffDock·DynamicBind 같은 generative diffusion model은 포즈 정확도가 뛰어나다. KarmaDock류의 regression 기반은 빠르지만 물리적 타당성이 흔들리는 경우가 있고, Interformer 같은 혼성형은 그 사이에서 균형을 잡는다.

AI 보강 워크플로AI-augmented

open-source 도킹에 AI rescoring을 얹고, DrugCLIP처럼 contrastive learning을 쓰거나 ML 기반 interaction fingerprint를 곁들인다.

통합 파이프라인Integrated pipeline

도킹 → MD refinement → 자유에너지 추정(MM/PBSA, FEP)으로 이어지는 줄기. ensemble docking과 template-based docking이 여기에 함께 놓인다.

특수 기법Specialized

covalent docking(tethered·biased·dynamic), PROTAC 설계, 그리고 pharmacophore와 도킹과 ML을 겹쳐 쓰는 방식.

쓰임의 자리Key Applications

  • hit 발굴과 lead 최적화. kinase(STK, CDK4/6)를 비롯해 항암, 항생제 내성, 항말라리아, 신경질환 표적에서 쓰인다.
  • 초대규모 가상 스크리닝. 수십억 화합물을 훑어 새로운 scaffold를 건져 올린다.
  • 약물 재창출과 선택성 연구.
  • covalent inhibitor, 알로스테릭 조절제, PROTAC의 설계.
  • AlphaFold 예측 구조를 발판으로 한 신규 표적 탐색.
보고된 성과 실제 사례에서는 nanomolar 수준의 저해제가 발견되고, 실험적 검증을 통과하는 hit rate가 눈에 띄게 올라간 보고가 이어진다. 계산이 낸 가설이 실험대 위에서 살아남기 시작했다는 뜻이다.

아직 풀리지 않은 매듭Open Problems

벤치마크에서 이긴 방법이 실험실에서도 이긴다는 보장은, 아직 어디에도 없다.

앞으로 낼 길Future Directions

길은 이미 몇 갈래로 닦이기 시작했다.

  • 물리와 딥러닝의 깊은 통합. DL-augmented MD, hybrid scoring, physics-informed neural networks.
  • 완전히 유연한 동적 도킹과 cryptic pocket 예측.
  • 파운데이션 모델과 에이전트 워크플로. 다중 에이전트 AI 플랫폼으로 end-to-end 자동화를 노린다.
  • 초대규모 스크리닝에 active learning과 contrastive learning을 얹은 genome-wide VS.
  • covalent·PROTAC·degrader 전용 도구의 고도화.
  • open-source 생태계의 강화와 PoseBench 같은 재현 가능한 벤치마크의 표준화.
  • 양자-고전 혼성 계산, 그리고 cryo-EM ensemble과의 결합.
결국은 정확성·일반화·확장성이라는 세 꼭짓점의 저울을 넘어서는 일이며,
그 끝에서 기다리는 것은 실제 임상 성공률이라는 하나의 숫자다.

주요 출처 · 2025~2026

Chem. Soc. Rev. 2025
Wang et al. — Modeling protein–ligand interactions with deep learning.
pubs.rsc.org/…/d5cs00415b
Biophys. J. 2026
Xu & Zou — Docking-based virtual screening: Past, present, and future.
sciencedirect.com/…/S0006349526002778
Int. J. Mol. Sci. 2026
Azam & Almahmoud — Open-Source Molecular Docking and AI-Augmented Approaches.
doi.org/10.3390/ijms27073302
Chem. Sci. 2025
Li et al. — Decoding the limits of deep learning in molecular docking.
doi.org/10.1039/d5sc05395a
Front. Pharmacol. 2025
Hasan et al. — Molecular docking and dynamics in protein serine/threonine kinase.
doi.org/10.3389/fphar.2025.1696204
참고
이 분야는 빠르게 바뀌므로 최신 preprint와 open-source 도구(AutoDock Vina, DiffDock, Gnina 등)를 함께 살펴보는 편이 좋다. 인용 정보는 원문에서 직접 확인할 것.
MOLECULAR DOCKING · 分子 結構論 구조기반 신약설계 정리 노트 2026