KDD 2026 · Enzyme Prediction · Hypergraph + Knowledge Graph Embedding

Improving Enzyme Prediction with Chemical Reaction Equations by Hypergraph-Enhanced Knowledge Graph Embeddings

효소-기질 pair 데이터는 믿을 만하지만 희소하다. 반응식은 훨씬 풍부하지만 여러 educt와 product가 한꺼번에 얽히고 효소 표기가 빠진 경우가 많다. Hyper-Enz는 이 “풍부하지만 불완전한” 반응식을 버리지 않고, educt/product set을 heterogeneous hyperedge로 만들고 PairRE 기반 relation prediction과 세 expert의 결정을 결합해 효소 검색 문제를 다시 정의한다.

Tengwei Song · Long Yin · Zhen Han · Zhiqiang Xu · KDD ’26, Jeju Island · DOI 10.1145/3770854.3780178 · CC BY 4.0

01 · Problem

효소 예측의 병목은 모델보다 supervision의 형태에 있다

효소가 어떤 기질과 반응하는지 알아내는 일은 drug discovery에서 biofuel production까지 넓은 응용을 가진다. 기존 ML은 BRENDA·KEGG처럼 전문가가 정리한 enzyme-substrate pair를 주로 학습한다. 문제는 이 pair가 정확한 대신 비싸게 만들어지고 불완전하다는 점이다.

논문은 대안을 화학 반응식에서 찾는다. 반응식은 여러 compound가 어떤 효소를 거쳐 product로 변환되는지를 한 번에 담는다. pair 하나보다 구조적 맥락이 풍부하고 domain database에 더 많이 존재한다. 하지만 그 풍부함이 곧 난점이다. 하나의 반응에 여러 educt와 product가 등장하므로 어떤 compound가 효소의 핵심 substrate인지 모호하며, 서로 다른 반응 사이에 compound가 중복되어 noisy collaboration이 생긴다.

더 큰 문제는 annotation의 불완전성이다. BRENDA의 22,196 enzyme-substrate pair 중 동일 compound를 포함하는 reaction equation과 정렬되는 pair는 7,472개뿐이다. 또 저자들은 reaction database에서 약 40%의 substrate가 다섯 개보다 많은 compound와 match된다고 보고한다. BKM-react처럼 EC number만 있고 PDB ID가 없는 식도 많다.

Source factHyper-Enz의 출발점은 incomplete equation을 noise로 버리지 않는 것이다. 효소 ID가 빠진 식도 compound 간 구조와 reaction 간 collaborative pattern을 담고 있으므로, missing relation을 추론하는 supervision으로 사용할 수 있다는 관점이다.

02 · Figure 1

한 substrate를 직접 검색하면 두 종류의 모호성이 동시에 나타난다

페이지 2 Figure 1은 2-heptanone을 query로 둔 toy example을 보여준다. 첫째, 동일 substrate가 여러 biochemical process에 참여할 수 있다. 둘째, 어떤 reaction에는 enzyme annotation이 빠져 있다. 이때 structurally related reaction—예를 들어 2-nonanone과 NADH가 Q9Y9P9에 의해 변환되는 식—이 missing enzyme을 추론하는 collaborative clue가 된다.

원 논문 Figure 1을 개념적으로 재구성한 설명도이다.
Query substrate
2-heptanone
여러 reaction에 등장
+ 일부 enzyme missing
관련 reaction의
shared compound pattern
candidate enzyme
ranking 보강

여기서 중요한 변화는 “반응식에 compound와 enzyme이 같이 등장했으니 pair다”라는 단순 co-occurrence를 쓰지 않는다는 점이다. Hyper-Enz는 compound set 전체를 hyperedge로 두고, hyperedge끼리 어떤 방식으로 겹치는지를 별도 관계로 모델링한다.

03 · Preliminaries

Equation-level relation prediction과 pair-level retrieval을 분리한다

효소 집합을 \(\mathcal{M}=\{m_1,\dots,m_{|\mathcal M|}\}\), compound 집합을 \(\mathcal C\), complete reaction equation 집합을 \(\mathcal Q\)라고 한다. 하나의 반응은 다음 triple로 쓴다.

\[q=\langle S,m,P\rangle,\qquad S\subset\mathcal C,\;P\subset\mathcal C,\;m\in\mathcal M\]

여기서 \(S\)는 educt set, \(P\)는 product set이다. reversible reaction이나 shared cofactor 때문에 \(S\cap P\)가 비어 있지 않을 수도 있다. 효소 정보가 없는 식은 \(\mathcal Q'\)로 둔다.

이를 knowledge graph 관점으로 옮기면 entity는 개별 compound가 아니라 educt/product set이다. 즉 \(\mathcal K=\{E,R,T\}\)에서 \(E=\mathcal S\cup\mathcal P\), \(R=\mathcal M\), \(T=\mathcal Q\)이다. equation-level task는 \(\langle S,?,P\rangle\)에 대해 모든 enzyme relation을 rank하는 relation prediction이다.

pair-level에서는 substrate 집합 \(\mathcal S_u\subset\mathcal C\)의 한 substrate \(s_u\)가 주어졌을 때 반응 가능성이 높은 top-\(k\) enzyme을 순위화한다. 기존 binary classification과 달리 저자들은 실제 wet-lab validation의 비용을 고려해 이 문제를 retrieval로 재정의한다.

NotationMeaning
\(\mathcal M\)enzyme set
\(\mathcal C\)compound set
\(q\)chemical equation
\(S,P\)educt set, product set
\(\mathcal K\)chemical equation knowledge graph
\(\mathcal Q\)complete equation set / triples in \(\mathcal K\)
\(\mathcal Q'\)incomplete equation set
\(\mathcal G\)hypergraph
\(\mathbf H\)incidence matrix

04 · Hyperedge representation learning

반응식을 pair로 쪼개지 않고 educt set과 product set을 hyperedge로 보존한다

standard KG triple은 두 entity를 relation 하나가 잇는다. 그러나 Hyper-Enz의 head와 tail은 compound 하나가 아니라 compound set이다. 평균 pooling으로 set을 하나의 vector로 축약하면 permutation invariance는 얻지만 reaction 내부의 high-order interaction을 잃는다.

그래서 저자들은 두 단계 구조를 만든다. 첫 단계에서 vertex는 compound이고, 각 educt set과 product set이 하나의 hyperedge가 된다. 즉 \(\mathcal V\equiv\mathcal C\), \(\mathcal E\equiv\mathcal S\cup\mathcal P\)이다. compound-to-hyperedge incidence를 \(\mathbf H^{(1)}\), hyperedge-to-hyperedge adjacency를 \(\mathbf H^{(2)}\)로 둔다.

C1
C2
C3
C4
S1
S2
P1
P2

페이지 3 Figure 2의 toy equations는 \(q_1:c_1+c_2\rightarrow c_3+c_4\), \(q_2:c_2+c_3\rightarrow c_4\)이다. 두 hyperedge가 educt를 공유하거나 product를 공유하거나, 한쪽 educt가 다른 쪽 product와 겹치면 edge를 연결한다. 마지막 경우가 cross-sharing이다. 즉 E→E relation은 homogeneous가 아니라 세 타입의 heterogeneous collaboration이다.

target hyperedge마다 \(\mathbf H^{(2)}\)에서 \(\eta_1\)개의 hyperedge neighbor를 뽑고, 그 neighbor들에서 \(\mathbf H^{(1)}\)을 따라 \(\eta_2\)개의 1-hop compound neighbor를 샘플링한다. 이 sub-hypergraph가 transformer의 입력이 된다.

05 · Hypergraph transformer

Message passing은 compound 안쪽과 reaction 바깥쪽의 구조를 동시에 본다

논문은 AllSet/STHGCN 계열의 classic hypergraph transformer를 사용한다. target hyperedge \(i\)는 neighbor hyperedge \(j\)의 hidden representation과 두 hyperedge 사이 relation vector \(\mathbf r_{ij}\)를 message로 받아 propagation한다.

\[\mathbf h_i^{(l+1)}=\operatorname{Propagate}_{j\in\mathcal N(i)}\left\{\operatorname{Message}\!\left(\mathbf h_j^{(l)},\mathbf r_{ij}\right)\right\}\tag{1}\]

초기 compound feature \(\mathbf x_v\)는 추가 chemical descriptor 없이 random vector로 초기화한다. multi-head scaled dot-product attention, residual connection, layer normalization, MLP를 거쳐 \(l\) layer 후 head/tail entity에 해당하는 hyperedge embedding \(\mathbf S,\mathbf P\)를 얻는다.

Analysis이 설계는 chemistry feature를 더 많이 넣는 접근과 반대 방향이다. 모델이 SMILES나 protein sequence 자체보다 reaction network의 structural co-occurrence와 role-specific sharing을 얼마나 학습할 수 있는지를 시험한다.

06 · Figure 3

Hyper-Enz는 encoder 하나가 아니라 hypergraph encoder, KGE decoder, expert decision의 세 층이다

페이지 4 Figure 3의 training/inference 흐름을 웹용으로 재구성했다.
\(\mathcal Q\cup\mathcal Q'\)
equation hypergraph
Hypergraph Transformer
\(S,P\) embeddings
PairRE KGE decoder
enzyme relation score
KB · Hyper-Enz · ML
decision module

training에서 hypergraph encoder와 PairRE decoder는 complete equation set \(\mathcal Q\)를 supervision으로 최적화한다. incomplete equation \(\mathcal Q'\)도 hypergraph construction에 들어가 구조적 collaboration을 제공한다. inference에서는 \(\mathcal Q'\)의 missing enzyme을 relation prediction으로 impute한다.

pair-level prediction에서는 세 expert가 서로 다른 지식 source를 사용한다. complete equation을 직접 찾는 KB expert, incomplete equation까지 구조적으로 보완하는 Hyper-Enz expert, enzyme-substrate pair 자체에서 학습한 ML expert를 합친다.

07 · KGE decoder

왜 PairRE인가: enzyme relation이 reversible·irreversible·inverse pattern을 모두 가질 수 있기 때문이다

각 complete reaction의 head/tail hyperedge embedding을 \(\mathbf S,\mathbf P\), enzyme embedding을 head-specific \(\mathbf m^H\), tail-specific \(\mathbf m^T\)로 두고 PairRE distance를 사용한다.

\[f_r=\left\lVert\mathbf S\circ\mathbf m^H-\mathbf P\circ\mathbf m^T\right\rVert_1\tag{2}\]

\(\circ\)는 Hadamard product이다. 학습에는 self-adversarial negative sampling을 사용한다.

\[\mathcal L=-\log\sigma\!\left(\gamma-f_r(\mathbf S,\mathbf P)\right)-\sum_{i=1}^{n}p_i\log\sigma\!\left(f_r(\mathbf S'_i,\mathbf P'_i)-\gamma\right)\tag{3}\]
\[p_i=\frac{\exp f_r(\mathbf S'_i,\mathbf P'_i)}{\sum_j\exp f_r(\mathbf S'_j,\mathbf P'_j)}\]

\(\gamma\)는 fixed margin이다. 모델이 complete equation에서 enzyme-aware relation geometry를 학습하면, missing enzyme equation에 모든 enzyme relation을 대입해 순위를 만들 수 있다.

08 · Multi-expert decision

모든 substrate가 같은 종류의 지식을 갖고 있지 않으므로 expert 조합도 달라진다

M1

KB Expert

query substrate가 등장하는 complete equation \(\mathcal Q\)를 직접 조회해 enzyme을 반환한다.

M2

Hyper-Enz Expert

complete/incomplete equation의 hypergraph structure를 사용해 \(\langle S,?,P\rangle\) enzyme ranking을 만든다.

M3

ML Expert

기존 enzyme-substrate prediction model을 사용한다. 실험에서는 EnzRank를 사용한다.

substrate가 complete와 incomplete equation 모두에 있으면 세 expert를 모두 사용한다. incomplete에만 있으면 M2+M3, complete에만 있으면 M1+M3, equation database 어디에도 없으면 M3만 사용한다.

expert별 logit scale이 다르므로 먼저 z-score normalize한 뒤 weighted sum한다.

\[\widehat z_{i,j}=\frac{z_{i,j}-\mu_i}{\sigma_i},\qquad m_j=\sum_{i=1}^{3}w_i\widehat z_{i,j}\tag{4}\]
\[\widehat m_j=\frac{e^{m_j}}{\sum_{l=1}^{K}e^{m_l}}\]

이 구조는 MoE와 닮았지만 gate network를 end-to-end로 학습하지 않는다. 저자들은 expert score를 정규화하고 수동 weight search로 결합한다.

09 · Equation-level experiment

EQ50k는 complete 38,861식과 incomplete 42,714식을 함께 보유한다

실험은 CentOS Linux 7, PyTorch, 4×42GB A100 환경에서 수행된다. EQ50k는 BRENDA와 PubChem을 중심으로 구축하고 BKMS-react를 이용해 incomplete reaction을 확장한다. complete equation \(\mathcal Q\)는 38,861개, compound 15,772개, enzyme 17,401개다. incomplete equation \(\mathcal Q'\)는 42,714개이며 compound는 \(\mathcal Q\)에 등장한 것들로 제한한다. complete set은 8:1:1로 train/validation/test split한다.

BRENDA

Complete + incomplete

82,119 reactions 중 75,483개가 PDB ID를 잃고 있어 \(\mathcal Q'\)의 중요한 source가 된다.

BKMS-react

Integrated reactions

BRENDA·KEGG·MetaCyc·SABIO-RK를 통합하고 EC number로 enzyme을 표현한다. 이 식들도 \(\mathcal Q'\)에 들어간다.

PubChem

Name ↔ SMILES bridge

reaction DB의 compound name과 pair dataset의 SMILES 표기를 연결하는 변환 source로 사용한다.

baseline KGE는 TransE, RotatE, PairRE, ComplEx, Rot-Pro이고 GNN은 LightGCL과 HL-GNN이다. baseline이 compound set을 직접 처리하지 못하므로 educt/product set의 mean representation을 head/tail entity로 사용한다.

learning rate는 \(10^{-3}\), batch size 512다. embedding dimension은 {64,128,256,512}, \(\eta_1\)은 {5,10,30,50}, \(\eta_2\)는 {1,3,5,10}, negative samples는 {100,200,400}, dropout은 {0.1,0.3,0.5}, regularization weight는 {0.001,0.005,0.01,0.05}에서 탐색한다.

10 · Table 2

Equation-level에서는 Hyper-Enz가 MR·MRR·Hit@1/3/10을 모두 끌어올린다

ModelMR ↓MRR ↑Hit@1 ↑Hit@3 ↑Hit@10 ↑
TransE3326.194.099.236.400
ComplEx4826.150.077.183.303
RotatE4202.160.084.198.324
Rot-Pro2102.181.094.228.363
PairRE1977.223.103.233.378
LightGCL.206.099.230.440
HL-GNN.199.127.217.346
Hyper-Enz(Homo)2472.265.186.299.431
Hyper-Enz(MLP)2297.275.184.301.452
Hyper-Enz(Random)2497.271.189.309.438
Hyper-Enz1936.299.223.326.458

Homo variant는 educt/product hyperedge 타입을 구분하지 않고 세 sharing relation을 하나로 합친다. full model이 이를 앞선다는 결과는 heterogeneous collaboration 자체가 기여함을 보여준다. MLP decoder도 equation-level에서 MRR .275로 꽤 강하지만, 뒤의 pair-level large incomplete setting에서는 KGE를 제거했을 때 손실이 더 커진다.

Random variant와 full Hyper-Enz 비교는 SMILES/EC feature 같은 추가 구조 정보가 성능에 긍정적이라는 저자들의 설명과 함께 제시된다. 다만 Section 3.1은 compound node feature x_v를 additional chemical feature 없이 random vector로 직접 초기화한다고 쓰고, Table 2 설명은 Random variant가 SMILES/EC-derived feature 대신 random initialization을 쓴다고 적는다. 어느 parameter block에 어떤 initialization이 적용되는지 본문만으로는 완전히 명확하지 않다. Appendix ReactZyme 비교 역시 explicit chemical/protein feature 없이 random embedding에서 시작하는 특성을 강조한다.

Analysis핵심은 PairRE decoder만 바꾼 것이 아니라 head/tail을 만드는 representation unit을 compound 평균에서 hyperedge로 바꾼 데 있다. PairRE baseline MRR .223이 Hyper-Enz .299로 올라가는 차이는 KGE geometry 앞단의 구조적 표현이 얼마나 중요한지를 보여준다. 저자들은 abstract에서 equation retrieval accuracy가 traditional model 대비 최대 88% 상대 개선된다고 요약한다. 이 88%는 특정 표의 단일 MRR 값과 동일한 수치가 아니므로, 본문에서는 Table 2의 원 metric을 함께 제시한다.

11 · Figure 4

Neighbor를 너무 적게 샘플링하면 collaboration을 잃고, 충분히 모이면 이득이 포화된다

Figure 4는 1-hop hyperedge neighbor와 2-hop compound neighbor sampling size를 바꿔 MRR/Hit@1/3/10을 비교한다. 작은 sampling size에서는 성능이 대체로 떨어진다. 이는 한 reaction만 보는 것보다 주변 reaction의 shared-educt/shared-product/cross-share 정보를 충분히 모으는 것이 중요하다는 뜻이다.

반대로 sampling size가 커진다고 계속 좋아지지는 않는다. 최적 구간 이후에는 plateau가 나타난다. 저자들은 필요한 neighbor가 사실상 다 포함되고 난 뒤 더 많은 sampling이 추가 정보를 거의 주지 않기 때문이라고 해석한다.

Source boundary논문의 Figure 4는 bar chart로 sensitivity를 보여주지만 본문은 각 bar의 정확한 수치를 표로 제공하지 않는다. 따라서 이 글에서는 측정값을 임의로 재구성하지 않고 source가 명시한 qualitative trend만 전달한다.

12 · Pair-level experiment

ES-23k-M은 domain knowledge와 의도적으로 더 많이 겹치게 만든 sparse split이다

pair-level dataset은 EnzRank가 공개한 BRENDA 기반 22,196 enzyme-substrate pair, 12,196 enzyme, 10,170 substrate로 구성되며 이 글에서는 논문 명칭대로 ES-23k라 부른다. 원 test 2,220 pairs 중 612는 complete와 incomplete equation 모두에 match되고, 758은 complete \(\mathcal Q\)에만, 998은 incomplete \(\mathcal Q'\)에만 match된다.

저자들은 같은 train/validation/test ratio를 유지하면서 domain knowledge와 align되는 pair를 test에 더 많이 배치한 ES-23k-M을 다시 만든다. 이 split은 ES-23k보다 더 sparse하지만, equation knowledge를 더 넓게 활용할 수 있어 multi-expert의 효과를 보기 좋은 설정이다.

baseline은 BPR, NMF, NGCF, DGCF, EnzRank, Boost-RS, Boost-RS(CC), MEIGCN, FusionESP다. 기존 baseline은 binary classification 모델이므로 training에서 random negative sampling을 추가해 multi-candidate ranking이 가능하도록 맞춘다. ML expert는 EnzRank다.

expert weights는 \((w_1,w_2,w_3)\in\{(0.1,0.1,0.8),(0.1,0.3,0.6),(0.1,0.7,0.2),(0.3,0.1,0.6),(0.4,0.1,0.5),(0.7,0.1,0.2)\}\)에서 탐색한다.

13 · Table 3

Pair-level에서도 Hyper-Enz가 두 split의 모든 metric에서 가장 좋다

ModelES-23kES-23k-M
MRMRRH@1H@3H@10MRMRRH@1H@3H@10
BPR.094.071.127.228.067.043.100.129
DGCF.100.074.136.247.086.059.122.168
NGCF.106.080.139.244.069.040.106.218
Boost-RS970.021.007.144.2091240.008.000.075.116
Boost-RS(CC)946.017.002.142.2071184.009.002.079.114
EnzRank88.193.118.189.330212.165.108.153.269
MEIGCN614.032.018.035.068621.030.016.032.063
FusionESP702.038.025.041.077685.034.022.038.071
Hyper-Enz83.209.130.205.368184.215.144.222.356

ES-23k-M의 MRR은 EnzRank .165에서 Hyper-Enz .215로 올라 약 30% 상대 개선이며 abstract의 pair-level 30% 개선과 연결된다. domain knowledge와 test overlap이 더 큰 split에서 gain이 더 크다는 점은 complete/incomplete equation expert가 실제로 추가 정보를 제공한다는 해석과 일치한다.

.299EQ50k equation-level MRR
.209ES-23k pair-level MRR
.215ES-23k-M pair-level MRR
.356ES-23k-M Hit@10

14 · Table 4 + Figure 6

Hypergraph, KGE, KB expert, Hyper-Enz expert가 모두 필요하지만 기여 방식은 다르다

VariantMRRH@1H@3H@10
Full Model.215.144.222.356
w/o KGE.174.118.170.276
w/o Hypergraph.165.108.153.269
w/o KB Expert.168.114.166.264
w/o Hyper-Enz Expert.170.117.153.284

hypergraph를 mean pooling으로 바꾸면 MRR .215→.165로 가장 크게 하락한다. KB expert를 제거하면 .168, Hyper-Enz expert를 제거하면 .170이다. 이 결과는 complete equation의 exact retrieval과 incomplete equation의 structural inference가 둘 다 필요함을 보여준다.

Figure 6은 expert weight sensitivity를 보여준다. KB expert weight \(w_1\)이 약 0.7일 때, Hyper-Enz weight \(w_2\)가 약 0.3일 때 성능이 peak한다. Hyper-Enz의 weight가 작아도 incomplete reaction에서 KB가 놓치는 signal을 보완하므로 양의 기여가 남는다.

AnalysisKB expert가 더 큰 weight를 받는 것은 “정확한 명시 지식이 있으면 직접 조회가 가장 강하다”는 상식과 맞는다. Hyper-Enz의 역할은 KB를 대체하기보다, KB가 incomplete하거나 misleading할 때 structural completion을 제공하는 것이다.

15 · Figure 5

Test에 처음 등장한 hyperedge도 training graph의 sharing relation으로 표현한다

equation-level test triple \((S,e?,P)\)에는 train에 없던 새로운 educt/product hyperedge가 등장할 수 있다. Figure 5는 testing educt set \(S=\{c_2,c_4\}\)의 예를 든다. 새 hyperedge를 graph에 무작정 재학습하는 대신 training incidence와 test incidence의 product를 이용해 기존 hyperedge와의 sharing information을 계산한다.

그 collaboration neighborhood에 대해 Section 3.1의 forward propagation만 수행해 new hyperedge representation을 얻는다. 즉 inference-time inductive step이 hyperedge 단위로 존재한다.

평가는 filtered relation prediction protocol을 따른다. 정답 enzyme을 다른 모든 enzyme으로 corrupt하고, train/validation/test에 이미 valid triple로 존재하는 corrupted case는 제외한 뒤 rank한다. MR은 낮을수록, MRR과 Hit@\(k\)는 높을수록 좋다.

16 · Case study

Explicit KB가 비어 있어도 Hyper-Enz가 D-psicose의 정답 효소를 1위에 놓는다

test pair는 substrate D-psicose, ground-truth enzyme Q6QWR1이다. 대응하는 incomplete reaction은 D-psicose → D-allose다. KB expert는 enzyme을 제공하지 못한다.

MethodRank of GTTop-3 predictions
Boost-RS628Q8TGI8, Q5BM20, P00791
KB-Exp
ML-Exp205Q52383, Q9M9F5, P19971
Hyper-Enz1Q6QWR1, Q04631, Q8TGI8

이 사례에서 Hyper-Enz가 하는 일은 chemical similarity search가 아니라 related reaction hyperedge의 collaboration을 이용해 missing relation을 복원하는 것이다.

17 · Appendix A

Equation KG의 enzyme relation은 세 가지 pattern을 가져 PairRE와 잘 맞는다

Symmetry. \(\langle S,m,P\rangle\Rightarrow\langle P,m,S\rangle\)이면 같은 enzyme이 reversible reaction의 양방향을 촉매한다.

Asymmetry. \(\langle S,m,P\rangle\)이 \(\langle P,m,S\rangle\)을 함의하지 않으면 irreversible reaction이다.

Inversion. \(\langle S,m_1,P\rangle\Rightarrow\langle P,m_2,S\rangle\)이면 서로 다른 enzyme이 역방향 reaction을 담당한다.

Appendix는 일반 PairRE score를 다음과 같이 쓴다.

\[f(h,r,t)=-\left\lVert\mathbf h\circ\mathbf r_h-\mathbf t\circ\mathbf r_t\right\rVert_p\]

symmetry에서는 \(\mathbf r_h=\mathbf r_t\), inverse relation에서는 \(\mathbf r_{1h}=\mathbf r_{2t}\), \(\mathbf r_{1t}=\mathbf r_{2h}\) 같은 조건으로 해당 pattern을 표현할 수 있다. 저자들이 PairRE를 선택한 이유는 enzyme relation geometry가 단일 translation보다 복잡하기 때문이다.

18 · Appendix B

ReactZyme은 explicit molecular/protein feature를 쓰고, Hyper-Enz는 reaction network structure를 쓴다

두 방법 모두 enzyme-reaction prediction을 retrieval로 정의한다. ReactZyme은 SMILES와 protein sequence를 pretrained molecule/protein encoder(예: ESM, AlphaFold)로 표현하고 substrate-product cross-attention으로 reaction embedding을 만든다. Hyper-Enz는 symbolic entity를 random embedding에서 시작해 reaction equation의 statistical/structural co-occurrence를 학습한다.

\[\operatorname{RelationDensity}=\frac{|T|}{|R|},\qquad \operatorname{EntityDensity}=\frac{2|T|}{|E|}\]
DatasetCompound countCompound densityEnzyme countEnzyme density
ReactZyme400,31683.809,5542.2
Ours53,3991.3639,0442.5
Ours-Align8,0124.188,5062.0

SMILES가 없는 compound 때문에 ReactZyme feature와 align 가능한 subset은 Ours-Align처럼 크게 줄어든다.

ModelMRRMRHit@1Hit@3Hit@10
Ours0.15120570.0880.1670.275
ReactZyme-MLP0.0434010.0090.0280.097
ReactZyme-RNN0.0473600.0100.0280.099

Hyper-Enz가 MRR와 Hits에서는 크게 앞서지만 MR은 ReactZyme 쪽이 훨씬 낮다. 저자들은 pretrained encoder가 compound/protein을 unified embedding space에 align하기 때문에 sparse aligned data에서 average rank에 이점이 있을 수 있다고 본다. 반면 Hyper-Enz는 random initialization이라 sparse setting에서 충분히 학습되지 않을 가능성이 있다.

Interpretation boundaryAppendix B의 비교는 full EQ50k와 동일 조건이 아니라 feature alignment 때문에 줄어든 subset에서 수행된다. 따라서 Table 2와 ReactZyme Table 7의 절대 수치를 직접 합쳐 하나의 leaderboard처럼 읽으면 안 된다.

19 · Appendix C

Reaction completeness에 따라 가장 좋은 expert 조합이 달라진다

ES-23k를 four subsets로 나눈다. \(S_1\): complete reaction만 match, \(S_2\): incomplete만 match, \(S_3\): 둘 다 match, \(S_4\): 어떤 reaction도 match하지 않음이다. Table 8은 Hit@10을 보고한다.

Expert setting\(S_1\)\(S_2\)\(S_3\)\(S_4\)
ML Expert0.320.280.330.32
KB + ML Expert0.620.280.420.32
Hyper-Enz + ML Expert0.470.450.450.32
KB + Hyper-Enz + ML Expert0.600.450.480.32

complete reaction만 있는 \(S_1\)에서는 full expert가 0.60으로 KB+ML 0.62보다 약간 낮다. 즉 Hyper-Enz가 완전한 명시 지식에 noise를 추가할 수 있다. 반면 mixed \(S_3\)에서는 full combination 0.48이 가장 좋다. incomplete \(S_2\)에서는 Hyper-Enz가 0.28→0.45로 큰 보완을 한다. equation이 전혀 없는 \(S_4\)에서는 어느 조합도 ML expert 0.32를 넘지 못한다.

Analysis이 표는 multi-expert의 본질을 보여준다. 세 expert를 항상 많이 섞는 것이 목적이 아니라, 지식의 completeness에 따라 explicit retrieval, structural completion, pair model의 역할이 바뀐다.

20 · Appendix D

Hypergraph는 더 무겁지만 test-time은 비교 baseline보다 빠르다

Model#Param (M)Train s/epochTest sPeak GPU MBComplexity
Ours202.082.90159182\(O(S\cdot d)\)
TransE63.271.12215452\(O(d)\)
PairRE96.461.50288418\(O(d)\)
TuckER573.301.94298586\(O(d^3)\)

Hyper-Enz는 TransE/PairRE보다 parameter와 memory가 크고 train/epoch도 느리다. 대신 reported test time은 15초로 가장 짧다. 저자들은 theoretical complexity를 slot 수 \(S\)와 embedding dimension \(d\)에 선형인 \(O(S\cdot d)\)로 정리한다.

Data scale 변화

CompoundsEnzymes#Param (M)Train sTest sMemory MB
39,04421,1532022.90159182
15,07114,607792.3478224
13,29811,176492.3058062

graph가 작아질수록 parameter, train/test time, memory가 모두 줄어든다. 반대로 large biochemical network에서는 \(\mathbf H^{(1)}\), \(\mathbf H^{(2)}\)가 dense해지면서 hypergraph construction과 sampling이 비싸진다. 논문은 fixed \((\eta_1,\eta_2)\) sampling으로 계산 확장을 제한한다. embedding dimension과 model depth도 memory와 forward/backward cost에 직접 영향을 준다.

21 · Appendix E

실제 생화학에서는 “같이 등장했다”가 substrate라는 뜻이 아니다

Appendix E는 human domain expert와 상의해 Hyper-Enz가 겨냥하는 practical ambiguity를 세 사례로 설명한다.

ATP: co-substrate와 primary substrate를 구분해야 한다

\[\mathrm{Glucose+ATP}\xrightarrow{\mathrm{Hexokinase}}\mathrm{Glucose\!\!-\!6\!\!-\!phosphate+ADP}\]

ATP는 reaction에 있지만 hexokinase의 primary substrate는 glucose이고 ATP는 phosphate donor다. 반면 ATPase에는 ATP가 실제 substrate다. 따라서 reaction co-occurrence만으로 ATP-hexokinase pair를 직접 supervision으로 만들면 역할을 잘못 배정할 수 있다.

NAD+: cofactor도 enzyme-substrate pair처럼 보일 수 있다

\[\mathrm{Lactate+NAD^+}\xrightarrow{\mathrm{Lactate\ dehydrogenase}}\mathrm{Pyruvate+NADH}\]

NAD+는 electron acceptor이고 primary substrate는 lactate다. 그러나 NADase/NAD synthase에서는 NAD+가 실제 substrate가 될 수 있다. paper는 reported substrate의 40% 이상이 서로 다른 reaction에서 다섯 개 이상 enzyme과 co-occur한다고 적어 spurious pairing 위험이 크다고 강조한다.

Explicit KB가 misleading한 phenanthridine case

test pair는 phenanthridine–P48034(putative)이고, KB가 찾은 reaction은 H2O, O2, phenanthridine → 6-phenantridone, H2O2이며 enzyme P05091로 annotated되어 있다. 즉 KB expert 자체가 ground truth와 다른 enzyme을 제시한다.

MethodRank of GTTop-3 predictions
Boost-RS602Q52383, P21219, P00791
KB-ExpP05091
ML-Exp194P19971, Q8TGI8, P21219
Hyper-Enz1P48034, B1GV57, Q3ZFI

이 사례에서 Hyper-Enz는 KB의 misleading co-occurrence를 그대로 따르지 않고 collaboration structure로 correct enzyme을 1위에 놓는다.

Cascade reaction: 같은 compound가 product였다가 다음 단계의 substrate가 된다

\[\mathrm{precorrin\!\!-\!2}\xrightarrow{\mathrm{CobI}\;(Q9X795)}\mathrm{precorrin\!\!-\!3A}\xrightarrow{\mathrm{CobJ}\;(Q9X796)}\mathrm{precorrin\!\!-\!4}\]

precorrin-3A는 첫 step에서는 product, 다음 step에서는 substrate다. 중간 enzyme이 missing이면 uniform pair model이 방향성을 혼동할 수 있다. Hyper-Enz는 educt와 product를 서로 다른 hyperedge type으로 두고 별도 message passing에 참여시키므로 role-specific behavior를 보존한다. 저자들은 cascade reaction 전용 dataset을 future direction으로 제안한다.

23 · Limits and critical reading

Hyper-Enz의 강점은 구조적 supervision이지만, 같은 이유로 coverage와 scale에 민감하다

Alignment coverage. 22,196 BRENDA pair 중 reaction equation과 직접 정렬되는 pair가 7,472개에 그친다. multi-expert가 이 gap을 완화하지만, equation database와 연결되지 않는 \(S_4\)에서는 ML expert 이상의 추가 이득이 없다.

Complete knowledge가 있을 때 structural expert가 noise를 만들 수 있다. Appendix C에서 \(S_1\)은 KB+ML 0.62가 full expert 0.60보다 높다. 모든 query에 Hyper-Enz를 강하게 섞는 것이 최적은 아니다.

Feature-free abstraction의 양면성. reaction structure만으로 general relational pattern을 학습하는 것은 장점이지만, Appendix B에서 저자들이 인정하듯 random embedding은 sparse aligned setting에서 충분히 훈련되지 않을 수 있다. pretrained molecule/protein representation과의 hybrid가 열려 있다.

Scalability. incidence/adjacency matrix가 커지면 hypergraph construction과 node sampling 비용이 증가한다. fixed neighbor sampling은 계산량을 묶지만, 매우 큰 reaction network에서 정보 손실과 계산 절충을 어떻게 잡을지는 별도 검증이 필요하다.

Training description의 모호성. Section 3.2 본문은 Hyper-Enz를 \(\mathcal Q\cup\mathcal Q'\) 위에서 train한다고 쓰지만, Figure 3 caption은 hypergraph construction에는 두 pool을 쓰되 encoder/decoder는 \(\mathcal Q\)로 optimize한다고 설명한다. 불완전 식이 loss에 직접 들어가는지 구조적 context로만 쓰이는지는 paper text만으로 완전히 명료하지 않다.

Evaluation split의 의미. ES-23k-M은 domain knowledge와 align되는 pair를 test에 적극 배치해 knowledge-enhanced setting을 측정한다. 이는 모델의 목표에는 적절하지만 “완전히 새로운 compound/enzyme에 대한 cold-start generalization”과 같은 질문을 직접 분리해 답하는 실험은 아니다.

Inference이 논문의 더 넓은 메시지는 “생화학 feature보다 graph가 낫다”가 아니다. 희소 pair label을 풍부한 process-level 기록으로 보완할 때, process를 pair로 평탄화하지 않고 high-order unit으로 유지하면 supervision의 밀도를 늘리면서도 역할 정보를 덜 잃을 수 있다는 설계 원리다.

24 · Conclusion and future work

다음 과제는 더 많은 equation annotation과 causal reasoning이다

저자들은 Hyper-Enz가 complete/incomplete chemical equation을 함께 사용해 missing enzyme을 보완하고, equation-level task와 dataset, multi-expert pair-level retrieval을 하나의 framework로 연결했다고 정리한다. 향후에는 equation-level annotation을 확장하고 causal inference를 도입해 reaction data가 enzyme-substrate prediction을 더 정확히 guide하도록 만들 계획이다.

Appendix의 domain expert feedback까지 합치면 추가적으로 cascade reaction 전용 dataset도 자연스러운 후속 과제다. 동일 compound가 step마다 product와 substrate 역할을 바꾸는 상황은 Hyper-Enz의 heterogeneous hyperedge 설계를 직접 시험할 수 있는 설정이다.

25 · Key takeaways

핵심 정리

희소 pair label을 풍부한 reaction equation으로 보완한다.incomplete equation까지 supervision source로 취급한다.
반응식을 independent pair로 분해하지 않는다.educt set과 product set을 각각 heterogeneous hyperedge로 유지한다.
Reaction 간 collaboration은 세 타입이다.share educt, share product, cross share를 분리해 message passing한다.
PairRE는 enzyme relation pattern을 담당한다.symmetry, asymmetry, inversion을 relation geometry로 표현한다.
세 expert의 역할이 다르다.KB는 complete equation, Hyper-Enz는 incomplete/mixed reaction, ML은 equation coverage 밖의 fallback을 맡는다.
EQ50k에서 MRR .299를 기록한다.PairRE .223, Hyper-Enz(Homo) .265보다 높다.
ES-23k-M에서 MRR .215를 기록한다.EnzRank .165 대비 약 30% 상대 개선이며 Hit@10은 .356이다.
완전한 KB에서는 Hyper-Enz가 약간의 noise를 줄 수 있다.\(S_1\)에서 KB+ML 0.62가 full 0.60보다 높다.
explicit chemistry/protein feature와 structural collaboration은 상호 배타적이지 않다.ReactZyme 비교는 두 방향의 장단점을 동시에 보여준다.
실제 중요 문제는 role ambiguity다.ATP/NAD+ cofactor와 cascade intermediate처럼 co-occurrence만으로 substrate를 정의하면 오류가 생긴다.

26 · References

논문 참고문헌 전체

  1. Askr et al. Deep learning in drug discovery: an integrative review and future challenges. Artificial Intelligence Review, 2023.
  2. Balažević, Allen, and Hospedales. TuckER: Tensor Factorization for Knowledge Graph Completion. 2019.
  3. Bordes et al. Translating Embeddings for Modeling Multi-relational Data. NeurIPS, 2013.
  4. Cai et al. LightGCL: Simple Yet Effective Graph Contrastive Learning for Recommendation. ICLR, 2023.
  5. Chao et al. PairRE: Knowledge Graph Embeddings via Paired Relation Vectors. ACL-IJCNLP, 2021.
  6. Chien et al. You are AllSet: A Multiset Function Framework for Hypergraph Neural Networks. 2021.
  7. Chien et al. You are allset: A multiset function framework for hypergraph neural networks. arXiv:2106.13264, 2021.
  8. Dettmers et al. Convolutional 2D Knowledge Graph Embeddings. AAAI, 2018.
  9. Du et al. FusionESP: Improved Enzyme-Substrate Pair Prediction by Fusing Protein and Chemical Knowledge. JCIM, 2025.
  10. Feng et al. Hypergraph Neural Networks. AAAI, 2019.
  11. He et al. Neural Collaborative Filtering. 2017.
  12. Hua et al. ReactZyme: A Benchmark for Enzyme-Reaction Prediction. NeurIPS Datasets and Benchmarks, 2024.
  13. Kanehisa et al. KEGG: new perspectives on genomes, pathways, diseases and drugs. Nucleic Acids Research, 2017.
  14. Kim et al. PubChem 2023 update. Nucleic Acids Research, 2022.
  15. Kroll et al. A general model to predict small molecule substrates of enzymes based on machine and deep learning. Nature Communications, 2023.
  16. Li et al. HousE: Knowledge Graph Embedding with Householder Parameterization. ICML, 2022.
  17. Li, Liu, and Hassoun. Boost-RS: boosted embeddings for recommender systems and its application to enzyme-substrate interaction prediction. Bioinformatics, 2022.
  18. Mahapatra et al. Biofuels and their sources of production. Energy Nexus, 2021.
  19. Maren, Michael, and Dietmar. BKM-react, an integrated biochemical reaction database. BMC Biochemistry, 2011.
  20. Nguyen et al. A Novel Embedding Model for Knowledge Base Completion Based on Convolutional Neural Network. NAACL, 2018.
  21. Paszke et al. PyTorch: An Imperative Style, High-Performance Deep Learning Library. NeurIPS, 2019.
  22. Qian et al. Deep Learning-Driven Insights into Enzyme-Substrate Interaction Discovery. JCIM, 2025.
  23. Rendle et al. BPR: Bayesian personalized ranking from implicit feedback. UAI, 2009.
  24. Rives et al. Biological structure and function emerge from scaling unsupervised learning to 250 million protein sequences. bioRxiv, 2020.
  25. Schomburg et al. The BRENDA enzyme information system - From a database to an expert system. Journal of Biotechnology, 2017.
  26. Shazeer et al. Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer. ICLR, 2017.
  27. Song, Luo, and Huang. Rot-Pro: Modeling Transitivity by Projection in Knowledge Graph Embedding. NeurIPS, 2021.
  28. Sun et al. RotatE: Knowledge Graph Embedding by Relational Rotation in Complex Space. ICLR, 2019.
  29. Trouillon et al. Complex embeddings for simple link prediction. ICML, 2016.
  30. Upadhyay, Boorla, and Maranas. Rank-ordering of known enzymes as starting points for re-engineering novel substrate activity using a convolutional neural network. Metabolic Engineering, 2023.
  31. Wang et al. Knowledge Graph Embedding via Graph Attenuated Attention Networks. IEEE Access, 2020.
  32. Wang et al. Neural Graph Collaborative Filtering. SIGIR, 2019.
  33. Wang et al. Disentangled Graph Collaborative Filtering. SIGIR, 2020.
  34. Xia et al. Hypergraph Contrastive Collaborative Filtering. SIGIR, 2022.
  35. Xue et al. Deep matrix factorization models for recommender systems. IJCAI, 2017.
  36. Yadati et al. HyperGCN: A New Method of Training Graph Convolutional Networks on Hypergraphs. 2019.
  37. Yan et al. Spatio-Temporal Hypergraph Learning for Next POI Recommendation. SIGIR, 2023.
  38. Yang et al. Embedding entities and relations for learning and inference in knowledge bases. ICLR, 2015.
  39. Zhang et al. Heuristic Learning with Graph Neural Networks: A Unified Framework for Link Prediction. KDD, 2024.
  40. Zhu et al. Neural Bellman-Ford Networks: A General Graph Neural Network Framework for Link Prediction. NeurIPS, 2021.

Primary source: Tengwei Song, Long Yin, Zhen Han, and Zhiqiang Xu. Improving Enzyme Prediction with Chemical Reaction Equations by Hypergraph-Enhanced Knowledge Graph Embeddings. KDD ’26, August 9-13, 2026, Jeju Island, Republic of Korea. DOI: 10.1145/3770854.3780178. Source code is reported by the paper as publicly available via Zenodo DOI 10.5281/zenodo.18076811.