이 안내서는 단어를 외우는 목록이 아니라 과정–실험–데이터–판단이 이어지는 구조를 보여준다. 먼저 큰 여정을 보고, 다음으로 ChEMBL의 엔티티와 필드를 읽은 뒤, pChEMBL과 표준화 규칙으로 내려간다.
From target to medicine
신약 개발의 기본 문법
발견과 개발은 이어져 있지만 같은 말은 아니다. 발견이 ‘무엇을 약으로 만들 것인가’를 좁혀 가는 일이라면, 개발은 그 후보가 실제 사람에게 쓸 수 있는 의약품인지 증명하는 일이다.
기본 개념과 과정
Drug Discovery신약 발견
질병을 치료하거나 예방할 새로운 약물을 찾아 설계하는 과정이다. 넓게는 표적 발굴부터 후보물질 선정까지를 가리키며, 전체 연구개발 여정은 흔히 10–15년 규모로 설명된다.
Drug Development신약 개발
선정한 후보물질을 전임상·임상시험·허가·생산 단계로 옮겨 실제 의약품으로 만드는 과정이다. Discovery 이후의 증명과 산업화가 중심이다.
Target타깃 · 표적
약물이 작용하도록 겨냥한 분자 또는 생물학적 시스템이다. 주로 단백질이나 유전자지만, ChEMBL 어세이에서는 세포주·조직·유기체도 타깃으로 기록될 수 있다.
Target Identification타깃 발굴
질병의 발생·진행과 연관되고 약물로 조절할 가능성이 있는 새로운 표적을 찾아내는 과정이다.
Target Validation타깃 검증
찾아낸 표적을 실제로 조절했을 때 기대한 치료 효과가 나타나는지, 다른 생물학적 교란으로 설명되지 않는지 확인하는 단계다.
Hit히트 · 유효 물질
스크리닝에서 원하는 활성을 보이고 재시험에서도 그 활성이 확인된 초기 화합물이다. 아직 약이라기보다 탐색을 계속할 근거가 생긴 물질에 가깝다.
Lead리드 · 선도 물질
히트 가운데 약효·선택성·물성·안전성의 균형이 더 나아 본격적인 최적화 대상으로 선택된 화합물이다.
Hit-to-Lead · H2L히트에서 리드로
확인된 히트를 구조–활성 관계와 초기 ADME·독성 자료를 바탕으로 개선해 리드로 좁혀 가는 단계다.
Lead Optimization · LO리드 최적화
리드의 화학 구조를 체계적으로 바꿔 효능과 선택성을 높이고, 독성과 체내 불안정성을 줄이며, 개발 가능성을 끌어올리는 과정이다.
Candidate후보 물질
최적화를 마치고 전임상·임상 개발에 진입할 준비가 되었다고 판단한 최종 선도물질이다.
스크리닝과 화합물
High-Throughput Screening · HTS고속 대량 스크리닝
자동화 장비로 수만에서 수백만 개의 화합물을 빠르게 시험해 초기 히트를 찾는 기술이다.
Assay어세이 · 시험법
화합물의 결합, 기능적 효과, 활성, 물성 또는 독성을 정해진 조건에서 측정하는 실험 방법이다.
Compound Library화합물 라이브러리
스크리닝에 쓰기 위해 구조·물성·출처 정보와 함께 관리하는 화학 물질의 모음이다.
Small Molecule저분자 화합물
비교적 작은 분자량을 지닌 화학 물질이다. 세포막을 통과해 세포 안 표적에 작용할 수 있는 전통적 약물 형식의 중심을 이룬다.
Biologic바이오의약품
생물체·세포 또는 생명공학 공정에서 유래한 의약품이다. 항체, 백신, 재조합 단백질, 세포·유전자 치료제 등이 포함된다.
Antibody–Drug Conjugate · ADC항체–약물 접합체
표적을 인식하는 항체에 강력한 세포독성 약물을 연결해 특정 암세포로 운반하도록 설계한 복합 치료제다.
약동학·약력학과 안전성
ADME흡수 · 분포 · 대사 · 배설
약물이 몸에 들어와 흡수되고, 조직에 퍼지고, 대사되어, 몸 밖으로 배출되는 네 가지 거동을 묶은 개념이다.
ADMETADME + 독성
ADME에 독성(Toxicity)을 더해 후보물질의 체내 거동과 안전성을 함께 평가하는 틀이다.
Pharmacokinetics · PK약동학
‘몸이 약물에 무엇을 하는가’를 다룬다. 시간에 따른 농도 변화와 흡수·분포·대사·배설을 정량화한다.
Pharmacodynamics · PD약력학
‘약물이 몸에 무엇을 하는가’를 다룬다. 농도·용량과 효과의 관계, 작용 기전, 생체 반응을 연구한다.
Bioavailability생체이용률
투여한 약물 가운데 전신 순환에 도달해 이용 가능한 비율과 속도를 나타낸다.
In Vitro생체 외
시험관·배양 접시 등 살아 있는 개체 밖의 통제된 환경에서 수행하는 실험이다.
In Vivo생체 내
동물이나 사람처럼 살아 있는 개체 안에서 약효·분포·독성 등을 평가하는 실험이다.
Toxicology독성학
물질이 생명체에 미치는 유해 효과, 노출량과 반응의 관계, 손상의 기전과 위험을 연구하는 분야다.
임상시험과 규제
| 단계 | 주요 대상 | 핵심 질문 |
|---|---|---|
| Preclinical · 전임상 | 세포·동물 모델 | 사람에게 시험할 만큼의 효능 근거와 안전성 여지가 있는가 |
| Phase I · 1상 | 주로 건강한 자원자, 일부 질환은 환자 | 어떤 용량 범위가 견딜 만하며 몸에서 어떻게 움직이는가 |
| Phase II · 2상 | 해당 질환 환자 | 치료 효과 신호가 있는가, 적절한 용량은 무엇인가 |
| Phase III · 3상 | 대규모 환자 집단 | 표준치료 또는 대조군 대비 효과와 안전성이 확증되는가 |
Clinical Trial임상시험
사람을 대상으로 약물의 안전성·효과·용량·체내 거동을 계획된 프로토콜에 따라 평가하는 연구다.
IND임상시험용 신약 신청
미국에서 새로운 약물의 임상시험을 시작하기 위해 FDA에 제출하는 신청이다. 비임상, 제조, 임상계획 자료를 포함한다.
NDA신약 허가 신청
비생물학적 신약의 시판 허가를 위해 안전성·유효성·품질 자료를 FDA 등에 제출하는 신청이다.
BLA바이오의약품 허가 신청
바이오의약품의 제조공정·화학·약리·임상 자료 등을 담아 시판 허가를 요청하는 신청이다.
ANDA약식 신약 신청
제네릭 의약품 허가 신청이다. 일반적으로 안전성·유효성의 새 임상자료 대신 기준의약품과의 생물학적 동등성을 입증한다.
API원료의약품 · 활성 성분
질병의 진단·치료·예방에 직접적인 약리작용을 내는 의약품의 핵심 성분이다.
Excipient부형제
제형을 만들고 안정성·용출·복용 편의성을 조절하기 위해 사용하는 비활성 성분이다.
CMC화학 · 제조 · 품질관리
원료와 완제품의 성분, 제조공정, 시험법, 규격, 안정성을 규제 기준에 맞게 통제하는 활동과 자료 체계다.
GMP우수 제조 관리 기준
의약품이 정해진 품질과 안전성을 일관되게 갖추도록 시설·인력·공정·기록을 관리하는 기준이다.
Indication적응증
특정 의약품을 사용하도록 공식적으로 승인되거나 연구되는 질병, 상태 또는 증상이다.
Adverse Event · AE이상사례
약물 투여 뒤 발생한 바람직하지 않은 의학적 사건이다. 약물과의 인과관계가 확정되었다는 뜻은 아니며, 그 관계는 별도로 평가한다.
Placebo위약
시험약의 활성 성분을 포함하지 않으면서 외형과 투여 방식은 유사하게 만든 대조용 제제다.
그 밖의 핵심 개념
Agonist작용제
수용체에 결합해 그 수용체의 생체 반응을 활성화하는 물질이다.
Antagonist길항제
수용체에 결합하되 활성화를 일으키지 않거나 다른 물질의 작용을 차단하는 물질이다.
Biomarker바이오마커
생물학적 상태, 질병 진행, 약물 반응 또는 위험을 객관적으로 측정하는 특성이나 지표다.
Drug Repurposing약물 재창출 · 재목적화
이미 개발되었거나 허가된 약물을 기존과 다른 질환·용도로 다시 개발하는 전략이다.
First-in-Class계열 내 최초 신약
이전에 승인된 적 없는 새로운 표적 또는 작용 기전을 통해 치료 효과를 내는 계열 최초 의약품을 뜻한다.
Generic Drug제네릭 의약품
기준 브랜드 의약품과 같은 활성 성분·함량을 갖고, 허가를 위해 생물학적 동등성 등 규제 요건을 충족한 의약품이다.
New Molecular Entity · NME신규 분자 실체
FDA 맥락에서는 이전 505조 신청에서 승인된 적이 없는 active moiety를 포함한 활성 성분을 가리킨다. 단순히 ‘새로운 화학구조’라는 일상적 표현보다 규제적 의미가 엄격하다.
A curated bioactivity archive
ChEMBL 데이터 사전
ChEMBL은 EMBL–EBI가 운영하는 수작업 큐레이션 생체활성 데이터베이스다. 약물 유사 분자의 화학구조, 어세이, 활성, 타깃, 문헌 정보를 연결한다. 데이터 한 줄은 숫자 하나가 아니라 화합물–어세이–타깃–출처의 관계다.
기본 엔티티
ChEMBL ID · CHEMBL_ID공개 식별자
화합물, 타깃, 어세이, 문서 등에 부여되는 고유 공개 식별자다. 예를 들어 CHEMBL25는 아스피린 분자 레코드다.
Molregno내부 분자 번호
ChEMBL 내부 관계형 스키마에서 화합물에 부여하는 숫자 키다. 외부 검색과 인용에 쓰는 ChEMBL ID와 역할이 다르다.
Molecule · Compound분자 · 화합물
생체활성이 측정된 화학 물질의 엔티티다. 구조, 계산 물성, 동의어, 계층관계 등의 정보가 연결된다.
Target타깃
어세이가 측정하는 생물학적 대상이다. 단일 단백질뿐 아니라 복합체, 세포주, 조직, 유기체 등도 포함될 수 있다.
Assay어세이
화합물의 결합력·효능·독성·물성 등을 측정한 개별 실험 레코드다. 같은 논문에서도 조건이 다르면 별도 어세이가 될 수 있다.
Activity활성 · 액티비티
특정 어세이에서 특정 화합물에 대해 얻은 측정 결과다. IC50, Ki, EC50, 억제율처럼 유형·값·단위·관계기호가 함께 기록된다.
Document문서
데이터를 추출한 과학 논문, 특허 또는 기타 원출처를 나타내는 엔티티다.
Cell Line세포주
세포 기반 어세이에 사용한 세포의 종류와 계통 정보를 나타낸다.
Tissue조직
어세이에 사용하거나 어세이가 유래한 생체 조직 정보를 나타낸다.
Binding Site결합 부위
단백질 표면이나 내부에서 리간드가 결합하는 특정 위치 또는 부위 정보를 나타낸다.
어세이 유형과 신뢰도
Assay Type은 실험이 무엇을 측정했는지를 여섯 범주로 압축한다.
분자 타깃에 결합하는 정도를 측정한다. Ki, IC50, Kd 등이 대표적이다.
세포 반응, 생리 변화, 동물 표현형 등 기능적 효과를 측정한다.
반감기, 투과성, 대사 안정성, 생체이용률 등 체내 거동을 다룬다.
세포독성·장기독성 등 유해 효과를 측정한다.
생물학적 재료 없이 용해도·안정성 같은 화합물 자체 특성을 측정한다.
다섯 범주로 명확히 분류하기 어려운 어세이를 나타낸다.
Confidence Score어세이–타깃 매핑 신뢰도
어세이 설명과 할당된 타깃의 일치 신뢰도를 0–9로 나타낸다. 9는 단일 단백질 타깃에 직접·고신뢰로 할당된 경우, 1은 비분자 타깃 수준, 0은 미큐레이션 상태를 뜻한다.
BAO Format · BAO LabelBioAssay Ontology 형식
어세이의 실험 형식과 맥락을 BioAssay Ontology로 표준 표현한 값이다. 예: cell-based format.
활성 데이터 필드
Standard Type표준 유형
문헌마다 다르게 표기된 활성 측정 유형을 ChEMBL의 표준 명칭으로 정규화한 값이다.
Standard Value표준 값
원문 수치를 표준 단위로 변환한 숫자다. 농도형 활성은 흔히 nM로 정규화된다.
Standard Units표준 단위
표준화된 값에 적용되는 단위다. IC50, Ki, EC50 등의 농도형 값에서는 nM가 대표적이다.
Standard Relation표준 관계
값이 정확값인지, 상한·하한인지 나타내는 관계기호다. =, >, < 등이 쓰인다.
pChEMBL Value정규화 활성 점수
지정된 농도형 활성값을 몰농도의 음의 상용로그로 바꾼 값이다. 숫자가 클수록 더 낮은 농도에서 효과가 관찰되었음을 뜻한다.
Activity Comment활성 코멘트
활성·비활성 판정이나 용량 의존성 등 측정 결과에 덧붙인 설명을 기록한다.
Data Validity Comment데이터 유효성 코멘트
비정상 범위, 비표준 단위, 전사 오류 가능성, 수동 검증 등 품질과 해석에 필요한 경고를 담는다.
Potential Duplicate잠재적 중복
새 측정이 아니라 앞선 문헌에서 인용된 값일 가능성이 높은 레코드를 표시한다.
Published Value · Units · Type원문 발표값 · 단위 · 유형
원본 문헌에 보고된 표현을 그대로 보존한 필드다. 표준화된 standard_* 필드와 나란히 읽으면 변환 과정과 오류 가능성을 추적할 수 있다.
화합물·약물 정보
Parent Compound부모 화합물
염·용매 성분·동위원소 등을 정리해 얻은 기본 구조다. ChEMBL의 분자 계층에서 여러 형태를 하나의 부모로 연결한다.
Molecule Form분자 형태
부모 화합물과 염·용매화물 등 구체적 형태 사이의 관계를 나타낸다.
Pref Name선호 이름
여러 동의어 가운데 해당 화합물을 대표하도록 지정한 이름이다.
Max Phase최대 개발 단계
화합물이 도달한 최고 개발 단계를 요약한 값이다. 통상 4는 승인, 3은 3상 도달을 나타낸다.
Mechanism of Action작용 기전
약물이 어떤 타깃에 어떤 방식으로 작용하는지를 나타낸다. 작용제·길항제·억제제 등이 예다.
Indication적응증
약물이 치료하거나 연구되는 질병·증상 정보다. MeSH·EFO 등 표준 용어와 연결될 수 있다.
Drug Warning약물 경고
안전성 문제에 따른 철회, 미국 FDA의 박스 경고 등 중요한 규제·안전 정보를 기록한다.
데이터 제출과 식별자
| ID | 의미 | 역할 |
|---|---|---|
AIDX | Assay ID | 제출자가 정의한 어세이 식별자 |
CIDX | Compound ID | 제출자가 정의한 화합물 식별자 |
RIDX | Reference ID | 참조 문헌 식별자 |
ACT_ID | Activity ID | 개별 활성 결과 식별자 |
TEOID | Test Occasion ID | 서로 관련된 측정 묶음 식별자 |
REGID · SAMID | Grouping IDs | 보충 데이터의 그룹화에 쓰는 식별자 |
Depositor-Defined ID제출자 정의 식별자
ChEMBL에 데이터를 넣기 전 제출자가 레코드 간 관계를 표현하기 위해 직접 부여하는 식별자다.
Deposition Job제출 작업
한 번에 함께 검증·로드되는 제출 파일의 묶음이다. 데이터 일관성을 위해 전체 성공 또는 전체 실패 방식으로 처리된다.
Source데이터 소스
레코드가 과학 문헌, PubChem, 직접 제출 등 어디에서 왔는지를 구분하는 출처 정보다.
A logarithmic common scale
pChEMBL 계산과 해석
농도가 작을수록 활성이 강한 값은 직관과 숫자의 방향이 반대다. 음의 로그 변환은 그 방향을 뒤집고 넓은 농도 범위를 짧은 점수로 압축한다.
CM은 표준화된 활성값을 몰농도(M)로 표현한 값이다.
계산되는 조건
허용된 측정 유형
IC50 XC50 EC50 AC50 Ki Kd Potency ED50 중 하나여야 한다.
정확한 관계값
standard_relation = "="이어야 한다.>나<같은 범위·한계값은 계산 대상에서 제외된다.표준 단위와 양수값
standard_units = "nM"이고standard_value > 0이어야 한다.유효성 검사 통과
전형적 범위를 크게 벗어나는 값 등 중대한 데이터 유효성 문제가 없어야 한다.
왜 로그로 바꾸는가
방향을 직관적으로 바꾼다큰 값 = 낮은 농도에서 관찰된 효과
IC50처럼 작을수록 강한 수치는 로그 변환 뒤 큰 점수가 된다. 1 nM은 9, 1 µM은 6이므로 상대적 크기를 빠르게 읽을 수 있다.
자릿수 범위를 압축한다농도를 짧은 척도로
nM에서 µM까지 수천 배 차이나는 값을 한 자리 차이의 점수로 표현해 모델링과 시각화에 편리하게 만든다.
pChEMBL 6–9는 흔히 유의미한 활성 범위로 언급되지만, ‘좋은 후보’의 절대 기준은 아니다. 타깃, 어세이 형식, 종(species), 기질, 시간, 세포 조건, 측정 유형이 다르면 같은 숫자도 생물학적 의미가 달라진다.
원본이 µM·mM·pM이라면 먼저 nM로 표준화한 뒤 몰농도로 바꿔 계산한다. 1 µM = 1,000 nM, 1 mM = 1,000,000 nM, 1 pM = 0.001 nM이다.
Same mathematics, different scope
pIC50와 pChEMBL
둘은 같은 로그 수학을 쓰지만 이름이 붙는 범위가 다르다. pIC50은 IC50만 말하고, pChEMBL은 ChEMBL이 정한 여러 농도형 활성 레코드에 적용하는 데이터베이스 필드다.
| 구분 | pIC50 | pChEMBL |
|---|---|---|
| 대상 | IC50 | IC50, XC50, EC50, AC50, Ki, Kd, Potency, ED50 |
| 공식 | −log10(IC50 in M) | −log10(지정 활성값 in M) |
| 사용 범위 | 약리학·화학생물학 문헌 전반 | ChEMBL의 표준화 생체활성 필드 |
| 목적 | IC50 크기를 로그 척도로 표현 | 허용된 여러 활성 유형을 일관된 수치 방향과 규모로 표현 |
| 계산 조건 | 문헌·분석 설계에 따름 | nM, 양수, relation ‘=’, 허용 유형 등 ChEMBL 규칙 적용 |
IC50 레코드가 ChEMBL의 계산 조건을 만족하면 pChEMBL의 숫자는 pIC50과 같다. 그러나 ‘pIC50이 pChEMBL의 한 종류’라기보다, 같은 원자료에 같은 변환식을 적용해 값이 일치한다고 표현하는 편이 정확하다.
Ki·Kd는 결합 친화도, IC50·EC50은 실험 조건에 의존하는 반응 지표다. pChEMBL이 숫자 형식을 통일해도 측정 개념까지 동일하게 만들지는 않는다. 머신러닝 학습 전에는 표준 유형과 어세이 맥락을 분리하거나 통제해야 한다.
From published record to comparable data
ChEMBL 데이터 표준화
문헌과 특허의 표기는 제각각이다. ChEMBL 표준화는 그 차이를 지우는 일이 아니라, 원문을 보존하면서 비교 가능한 표준 필드를 병행해 만드는 일이다. 활동값과 화학구조는 서로 다른 파이프라인을 거친다.
활성 데이터 표준화
활성 유형 정규화
Ic-50,IC50,mean IC50,IC50_µM처럼 표기가 다른 유형을IC50등 표준 명칭으로 통일한다. pIC50·logIC50 같은 로그값은 필요에 따라 농도형 값으로 역변환한다.단위 표준화
농도형 IC50·Ki·EC50 등은 대개 nM로 환산한다. AUC는
ng·h·mL⁻¹, 일부 측정은µg/mL처럼 유형별 표준 단위를 사용한다.값 변환과 표현
로그값을 원래 농도로 되돌리고 표준값을 일관된 정밀도로 표현한다. 공개 ChEMBL FAQ의 구체적 반올림 규칙과 릴리스별 파이프라인을 함께 확인해야 한다.
pChEMBL 계산
허용 유형, 관계기호
=, 단위 nM, 양수값, 유효성 조건을 만족하는 레코드에 음의 상용로그 변환을 적용한다.데이터 품질 플래그
Outside typical range: 전형적 범위를 벗어난 값Non standard unit for type: 유형과 맞지 않는 단위Potential missing data: 누락 가능성Potential transcription error: 전사·단위 오류 가능성Manually validated: 수동 검증Potential author error: 원문 자체 오류 가능성
잠재 중복 표시
potential_duplicate = 1은 앞선 문헌에서 재인용한 값일 가능성이 높음을 뜻한다. 학습 데이터 분할 전 중복·계보를 점검해야 한다.숫자와 텍스트의 분리
VALUE는 IC50·억제율 같은 수치,TEXT_VALUE는 Active·Not active·Toxic 같은 범주형 결과,ACTIVITY_COMMENT는 부가 설명을 담는다.
화합물 구조 표준화
Checker구조 오류 검사
원자가, 전하, 결합, 스테레오 표현 등 구조 레코드의 잠재적 문제를 탐지한다.
Standardizer구조 표현 정규화
알 수 없는 스테레오와 명시적 수소를 정리하고 Kekulé 표현, 니트로기·아미드 토토머·술폭사이드, 알칼리 금속 등의 표현을 일관되게 만든다.
GetParent부모 구조 생성
염·용매 성분·동위원소를 정리해 부모 화합물을 만들고 여러 분자 형태를 계층적으로 연결한다. 구조의 동일성 판단에는 Standard InChI가 핵심 기준으로 쓰인다.
어세이·타깃 표준화
Ontology Mapping온톨로지 매핑
어세이 설명을 BioAssay Ontology, 세포주 정보를 Cell Line Ontology, 조직 정보를 Uberon 등 표준 어휘에 연결한다.
Target Curation타깃 큐레이션
단백질 계열·복합체·비분자 타깃을 구분하고 어세이 설명과 타깃의 대응에 Confidence Score를 부여한다.
Assay Classification어세이 유형 분류
Binding(B), Functional(F), ADME(A), Toxicity(T), Physicochemical(P), Unclassified(U)로 실험의 주된 측정 성격을 분류한다.
서로 다른 출처의 수치와 구조를 비교 가능한 형식으로 만들고, 의심스러운 레코드에는 품질 플래그를 남기며, 대규모 데이터 마이닝과 머신러닝에 필요한 일관성을 제공하는 데 있다.
표준화는 릴리스와 파이프라인 버전에 의존한다. 연구에서는 ChEMBL 릴리스, 다운로드 날짜, 선택 필드, 유효성 필터, 중복 처리, 구조 표준화 코드 버전을 함께 기록해야 한다.
Primary references
출처와 읽기 안내
정의는 짧게 쓸 수 있지만 규칙은 계속 다듬어진다. 분석이나 논문에 사용할 때는 아래 공식 문서와 원 논문에서 해당 릴리스의 세부 조건을 다시 확인해야 한다.
이 문서는 가장 자주 쓰이는 개념과 ChEMBL 핵심 엔티티를 선별한 입문·실무용 사전이다. 의약품 모달리티, 통계 설계, 규제 지역, ChEMBL 릴리스별 필드를 모두 포괄하는 완전한 목록은 아니다.