Knowledge Graphs and LLMs in Action · Chapter 10

그래프 특징 공학:
수작업과 반자동화의 사이

그래프는 선과 점으로 보이지만, 학습 알고리즘 앞에서는 아직 말이 없는 풍경이다. 제10장은 그 풍경에 수치를 붙이고, 구조를 벡터로 옮기며, 사람이 이해할 수 있는 특징과 기계가 다룰 수 있는 표현 사이에 길을 놓는다.

좋은 특징은 복잡한 구조를 지우지 않는다. 오히려 구조가 품고 있던 의미를 더 짧고 분명한 숫자로 번역한다.
원문 범위: 233-271쪽 핵심 사례: 사기 탐지 · 신약 재창출 핵심 방법: 수작업 특징 · 메타패스 · DWPC · ReFeX 독립 실행형 HTML
01 · Representation before learning

학습보다 먼저, 표현이 있다

로지스틱 회귀와 랜덤 포리스트, 깊은 신경망까지 학습 알고리즘은 이미 잘 다듬어진 연장이다. 그러나 그 연장은 그래프의 노드와 관계를 그대로 집어 들지 못한다. 그래프를 수치 벡터로 바꾸는 벡터화 또는 특징화가 먼저 필요하며, 이 번역의 품질이 노드 분류와 링크 예측, 그래프 분석의 성패를 좌우한다.

1

노드

한 노드의 이웃, 삼각형, 중심성, 위험 노출 정도를 숫자로 만든다. 한 사람의 위치를 그의 주변과 전체 네트워크 안에서 함께 읽는 방식이다.

2

관계

두 노드 벡터를 결합하거나, 둘 사이를 잇는 경로 패턴을 세어 잠재적 연결을 표현한다. 링크 예측은 이 관계 벡터를 입력으로 삼는다.

3

그래프

그래프 전체를 하나의 데이터 포인트로 표현할 수도 있다. 이 장은 주로 노드와 관계 표현에 집중하며, 다음 장들의 표현학습으로 가는 기초를 놓는다.

제10장의 관점 — 특징 공학은 단순한 전처리가 아니다. 도메인 지식, 그래프 구조, 학습 목표를 한데 묶어 무엇을 보존하고 무엇을 버릴지를 결정하는 모델링 행위다.
02 · Interpretability spectrum

자동화가 깊어질수록, 설명은 멀어진다

장은 특징 생성 방식을 하나의 스펙트럼으로 본다. 어느 한쪽이 절대적으로 우월한 것이 아니라, 해석 가능성·개발 비용·표현력 사이에서 목적에 맞는 지점을 고르는 문제다.

수작업 특징

도메인 지식과 그래프 알고리즘으로 사람이 직접 설계한다.

해석 가능성 높음 · 개발 비용 큼 · 통제력 높음

반자동 특징

ReFeX처럼 구조적 후보를 자동 생성하되 사람이 검증하고 가지치기한다.

설명과 효율의 균형 · 재현성 · 전이 가능성

완전 자동 표현학습

신경망이 복잡한 패턴을 학습한다. 다음 11·12장의 주제다.

표현력 높음 · 해석 어려움 · 튜닝 의존성

수작업 특징은 오래된 수공예와 닮았다. 시간이 들지만, 어느 자국이 왜 남았는지 제작자가 알고 있다. ReFeX는 그 손끝을 기계화하되, 결과의 결을 지우지 않으려는 시도다.

03 · Manual node features

한 노드를 읽는 여덟 가지 시선

사례 그래프는 A부터 T까지 20명의 사람을 노드로 두고, D·E·F·I를 알려진 사기 행위자로 표시한다. 모든 관계는 무방향이다. 목표는 알려지지 않은 사기 행위자를 분류하거나, 다른 사용자가 사기의 영향을 받을 위험을 추정하는 것이다.

로컬 특징

노드의 1홉 이웃 또는 n홉 이웃을 중심으로 계산한다. 중심 노드는 ego, 주변 노드는 alter다. 차수, 삼각형, 에고넷 밀도가 여기에 해당한다.

글로벌 특징

전체 네트워크에서 노드가 맡는 역할을 계산한다. 최단거리, 근접 중심성, 매개 중심성, PageRank가 대표적이다.

특징무엇을 재는가사기 탐지에서의 변형핵심 해석
Degree직접 이웃 수전체·사기·정상 차수로 분해누구와 직접 연결되어 있는가
Triangles세 노드가 모두 연결된 폐쇄 구조사기·정상·반사기 삼각형가까운 집단의 결속과 영향
Density에고넷에서 가능한 관계 중 실제 관계 비율도메인 분해 없이 구조만 사용주변이 얼마나 촘촘한가
Geodesic가장 가까운 사기 노드까지의 최단거리1·2·3홉 사기 경로 수 추가위험에 얼마나 가깝고 많이 노출되는가
Closeness다른 노드까지의 평균거리 역수도달 가능한 노드만으로 정규화전체 네트워크에 얼마나 빨리 닿는가
Betweenness다른 노드 쌍의 최단경로에 등장하는 빈도병목·브리지 탐지흐름을 얼마나 중개하는가
PageRank중요한 이웃에게서 받은 중요도기본값과 사기 가중값 비교일반적 영향과 사기 맥락의 영향 차이
Prediction위 특징을 하나의 벡터로 통합로지스틱 회귀·표준화·계층 분할설명 가능한 위험 확률로 전환

밀도

가능한 간선 수 = N(N-1)/2
density = M ÷ [N(N-1)/2]

노드 A의 에고넷은 7개 노드와 7개 간선을 가지므로 밀도는 7/21≈0.33이다.

DWPC가 아닌 최단거리 계열

closeness(v) ≈ (도달 노드 수 / 전체 타 노드 수) × (도달 노드 수 / 거리 합)

분리된 그래프에서는 도달 불가능한 노드의 무한거리를 제외하고 정규화한다.

04 · Interactive fraud network

사기 네트워크를 직접 읽기

노드를 선택하면 원문의 표 10.1~10.7에 제시된 주요 값을 함께 확인할 수 있다. 검은 노드 D·E·F·I는 알려진 사기 행위자다.

20-node Fraud Graph

노드를 클릭해 구조적 특징을 비교한다.

선택 노드
05 · From feature matrix to probability

특징표가 확률이 되기까지

장은 모든 지표를 pandas DataFrame으로 묶고, 80:20 계층 분할과 표준화, 로지스틱 회귀를 거쳐 사기 확률을 출력한다. 작은 예제 그래프는 통계적으로 충분하지 않으므로 실제 성능 수치는 제시하지 않는다. 중요한 것은 예측값보다 파이프라인의 통제 가능성과 설명 가능성이다.

① 구조 계산
차수·삼각형·중심성
② 특징 행렬
노드 × 수치 특징
③ 계층 분할
Train 80% / Test 20%
④ 표준화·학습
StandardScaler + LR
⑤ 확률·설명
predict_proba + 중요도

반복 설계

예측 품질이 목적에 도달할 때까지 특징을 추가·수정한다. 특징 공학은 한 번의 계산이 아니라 반복적인 모델 설계다.

스케일 정렬

차수와 중심성처럼 범위가 다른 값을 그대로 넣으면 로지스틱 회귀가 왜곡될 수 있으므로 표준화한다.

해석 가능성

각 특징은 그래프 위에서 다시 확인할 수 있다. 제한된 데이터나 설명 책임이 큰 업무에서 이 장점이 크다.

06 · Manual relationship features

관계도 하나의 데이터 포인트다

링크 예측은 두 노드 사이에 관계가 존재할 가능성, 또는 어떤 유형의 관계가 생길지를 예측한다. 단백질 상호작용, 고객-상품 추천, 약물-질병 치료 관계는 겉모습은 다르지만 같은 계산 문제로 환원된다.

노드 기반 결합

출발 노드와 도착 노드의 벡터를 하나로 합친다. 단순하고 범용적이며 자동 학습된 노드 임베딩과 잘 맞는다.

경로 기반 특징

두 노드를 잇는 구조적 경로를 특징으로 삼는다. 도메인 의미를 잘 보존하지만 메타패스 설계와 계산 비용이 크다.

07 · Node-pair composition

두 벡터를 한 관계로 묶는 다섯 방식

결합 연산은 링크의 표현을 바꾼다. 보편적인 정답은 없으며, 노드 표현과 과제에 맞춰 벤치마크로 선택해야 한다.

연결

모든 정보를 보존하지만 차원이 2배가 된다.

차이

L1·L2는 두 노드가 얼마나 다른지 표현한다. L2는 큰 차이를 더 강조한다.

상호작용

Hadamard는 같은 차원의 값이 함께 클 때 강하게 반응한다.

08 · Hetionet, metapath and DWPC

길의 수보다, 어떤 길인가가 중요하다

신약 재창출 사례는 19개 공개 데이터베이스를 통합한 Hetionet을 사용한다. 5만 개가 넘는 노드와 200만 개 이상의 관계를 바탕으로 약물-질병 쌍의 네트워크 연결성을 치료 확률로 번역한다. 연구진은 길이 2~4의 Compound→Disease 메타패스를 조사한다.

CompoundBINDSGeneASSOCIATESDiseaseCbGaD · length 2
CompoundBINDSGeneEXPRESSESAnatomyLOCALIZESDiseaseCbGeAlD · length 3
CompoundBINDSGenePARTICIPATESPathwayPARTICIPATESGeneASSOCIATESDiseaseCbGpPWpGaD · length 4
메타패스길이약어
Compound-binds-Gene-associates-Disease2CbGaD
Compound-downregulates-Gene-upregulates-Disease2CdGuD
Compound-resembles-Compound-treats-Disease2CrCtD
Compound-binds-Gene-binds-Compound-treats-Disease3CbGbCtD
Compound-binds-Gene-expresses-Anatomy-localizes-Disease3CbGeAlD
Compound-binds-Gene-interacts-Gene-interacts-Gene-associates-Disease4CbGiGiGaD
Compound-binds-Gene-participates-Pathway-participates-Gene-associates-Disease4CbGpPWpGaD
단순 Path Count의 함정 — 연결이 많은 허브 유전자는 수많은 경로에 등장한다. 경로가 많다는 사실이 곧 생물학적 특이성을 뜻하지는 않는다. DWPC는 중간 노드의 차수가 높을수록 경로 기여도를 낮춘다.

DWPC 감쇠 실험

단일 중간 노드의 기여도를 degree-w로 단순화해 비교한다. 원문 예시는 감쇠계수 0.4를 사용한다.

100
10
0.4
허브 경로 기여
특이 경로 기여

계산량 축소

모든 약물-질병 쌍과 모든 메타패스를 계산하면 비용과 잡음이 급증한다. 원문이 소개한 방법은 1,026개 메타패스를 통계적으로 709개로 줄이고, 도메인 지식과 차수 기반 확률 분석으로 유망한 쌍을 추가 선별한다.

실제 예시

Metformin-Type 2 Diabetes의 CbGaD DWPC는 원문 실행에서 0.0007로 제시된다. 이 값 하나가 해당 관계 벡터의 한 차원이 된다.

09 · LLM-assisted feature engineering

LLM은 특징을 대신 결정하지 않고, 설계를 가속한다

제10장은 LLM을 그래프 특징 공학의 조력자로 둔다. 핵심은 스키마, 예시 질의, 메타패스 목록, 시험용 약물·질병을 명확히 제공하고, Path Count와 DWPC의 계산 요건을 구체적으로 요구하는 것이다.

Query generation

메타패스의 고수준 설명을 Neo4j Cypher로 옮기고, 경로별 차수와 DWPC를 계산하도록 돕는다.

Feature suggestion

사람이 놓치기 쉬운 경로 패턴과 관계 조합 후보를 제안한다. 최종 채택과 검증은 도메인 전문가의 몫이다.

Code generation

질의를 반복 실행하고 결과를 벡터로 조립하는 Python 인프라 초안을 생성한다.

프롬프트의 최소 구성
① `apoc.meta.schema()`로 얻은 스키마 ② 정확한 DWPC 예시 ③ 생성 대상 메타패스 ④ 출발 약물과 도착 질병 ⑤ 반환 필드와 감쇠계수. 명세가 흐리면 생성 코드도 흐려진다.
10 · Recursive Feature eXtraction

ReFeX: 구조를 재귀적으로 읽는 반자동 장치

ReFeX는 수작업 특징과 신경 표현학습 사이의 중간 지대다. 순수한 그래프 구조에서 로컬·에고넷·재귀 특징을 자동으로 만들고, 사람이 추적하고 검증할 수 있는 수치로 남긴다.

두 원칙

Structural: 노드·간선의 부가 속성 없이 특징 행렬을 만든다.
Effective: 노드 속성 예측에 유용하고, 시간에 따라 그래프가 바뀌어도 다른 그래프로 전이될 수 있어야 한다.

네 장점

효율성, 일관성, 해석 가능성, 확장성. 동일한 입력은 동일한 출력을 내므로 생산 환경의 재현성에도 유리하다.

1

Local

degree, directed graph의 in/out-degree, weighted degree를 계산한다.

2

Egonet

에고넷의 노드·내부 간선·외부 출입 간선과 가중 변형을 계산한다.

3

Recursive

이웃 특징에 SUM·MEAN을 재귀 적용해 더 넓은 지역의 행동 패턴을 만든다.

특징 폭발 제어 — 상관 분석으로 중복 특징을 제거하고, 로그 구간화로 값 범위를 이산화하며, 임계값보다 차이가 작은 특징을 가지치기한다.

Node A의 ReFeX 단계

원문의 수작업 계산을 단계별로 재구성했다. A의 이웃은 H·I·G·B·T·O다.

A
6

Degree(A)

A는 여섯 이웃과 직접 연결된다. 이것이 재귀 계산의 출발점이다.

사람의 역할

생성 특징의 관련성을 검증하고, 도메인 지식으로 선택을 이끌며, 예측에 대한 기여를 설명하고, 업무 요건에 맞게 추출 절차를 수정한다.

한계

순수 구조에 의존하므로 노드 속성과 간선 유형을 직접 반영하지 못한다. 특징 수 증가와 가지치기 기준에도 인간의 감독이 필요하다.

11 · Listings 10.1-10.18

코드 목록의 역할 지도

원문의 코드는 하나의 완성된 제품보다, 특징을 설계하고 검증하는 사고 순서를 보여주는 실습 골격이다.

10.1-10.2 · 예제 그래프

NetworkX로 20개 노드, 25개 간선, 사기 라벨을 가진 무방향 그래프를 만들고 이후 모든 지표 계산의 공통 입력으로 사용한다.

10.3 · 차수

전체 차수와 사기·정상 이웃 수를 분리한다.

10.4 · 삼각형

두 이웃이 서로 연결되는지 확인하고 사기·정상·반사기 삼각형을 분류한다.

10.5 · 에고넷 밀도

에고와 이웃의 실제 간선을 가능한 간선 수로 나눈다.

10.6 · 최단거리

사기 노드까지의 최소거리와 1·2·3홉 경로 수를 계산한다.

10.7-10.9 · 중심성

근접 중심성, 매개 중심성, 기본 및 사기 가중 PageRank를 계산한다.

10.10-10.13 · 분류 파이프라인

모든 특징을 DataFrame으로 구성하고, 계층 분할·표준화·로지스틱 회귀·확률 예측을 수행한다.

10.14 · 관계 벡터 결합

연결, 평균, L1, L2, Hadamard 연산을 함수로 구현한다.

10.15-10.17 · 메타패스 DWPC

CbGaD, CbGeAlD, CbGpPWpGaD에 대해 Cypher로 Path Count와 DWPC를 계산한다.

10.18 · ReFeX 핵심 구현

로컬 특징, 에고넷 특징, SUM/MEAN 재귀 집계, 상관 임계값 0.95 기반 가지치기를 구성한다.

12 · Source integrity notes

원문을 그대로 읽을 때 보이는 작은 균열

수치를 임의로 고치지 않고 정합성 문제를 명시한다

PageRank 표 10.7은 Q의 기본 PageRank를 0.75로 적지만, 이어지는 본문은 A의 0.108을 최고값이라고 설명한다. PageRank 값의 합과 본문 서술을 함께 보면 서로 양립하기 어렵다. 이 웹페이지의 인터랙티브 데이터는 원문 표의 값을 보존하되, 해당 불일치를 표시한다.

Betweenness 표 10.6은 104, 65 같은 비정규화 값을 제시하지만, 코드와 설명은 기본적으로 0~1 정규화를 사용한다고 말한다. 표와 구현 설명의 스케일이 일치하지 않는다.

Node O는 일부 표와 추출 텍스트에서 숫자 0처럼 보인다. 그래프 도식과 간선 목록에 따라 문자 O로 통일했다.

분류 결과는 의도적으로 해석하지 않는다. 20개 노드의 작은 예제는 통계적 성능 평가에 충분하지 않다는 원문의 판단을 따른다.

13 · Chapter conclusion

특징은 구조와 판단 사이의 약속이다

노드 특징

로컬 지표와 글로벌 중심성을 결합하면 직접 이웃의 성격, 집단 결속, 위험 거리, 네트워크 영향력을 동시에 포착할 수 있다.

관계 특징

노드 벡터 결합은 단순하고 범용적이며, 메타패스 기반 표현은 도메인 의미와 구조적 경로를 직접 반영한다.

DWPC

허브 노드가 경로 수를 독점하는 편향을 낮추어, 더 특이적이고 설명 가능한 생물학적 연결을 강조한다.

ReFeX

구조 특징을 재귀 생성하고 중복을 가지치기함으로써 수작업의 설명력과 자동화의 효율 사이에 실용적 균형을 만든다.

이 장의 결론은 화려한 알고리즘에 있지 않다. 무엇을 특징으로 삼을 것인가를 묻는 순간, 이미 도메인에 대한 해석이 시작된다는 데 있다. 수치는 중립적인 돌멩이가 아니라, 선택된 관점의 표식이다.