Springer · Synthesis Lectures on Computer Science 2026 DOI 10.1007/978-3-032-15858-1_5 Liu & Tong
CHAPTER 5 · RESEARCH QUESTION Q3 — 방법 ① 지식그래프 불완전 질의 정확

불완전한 KG 위 뉴로-심볼릭 추론에 의한
정확한 질의 응답 — BiNet

불완전한 지식그래프 위 추론은 제한적이고 파편화된 정보로부터 논리적 결론을 추론하고 정확한 예측을 수행하는 과정이다. 그래프에 핵심 트리플이 결여되어 있어도, 가용한 정보·패턴·관계를 활용해 공백을 메우고 의미 있는 통찰을 도출해야 한다. 이 장은 멀티홉 KGQA와 지식그래프 완성(KGC)이 본질적으로 상호 보완적이라는 통찰에 기반해, 두 태스크를 멀티태스크 학습 문제로 결합하는 BiNet을 제안한다.

FIG 5.2 재구성 — BiNet 아키텍처 (원문의 색 규약을 따름)
KGQA 전용 KGC 전용 답 스코어링 — 두 태스크 공용 (§5.3.3) KGQA·KGC 공동 사용
INPUT · KGQA
질문 + 토픽 개체
멀티홉 자연어 질문. 토픽 개체는 [NE]로 마스킹된다.
ENCODER
사전학습 BERT
질문 임베딩 Q 생성 — [CLS]와 <s> 임베딩을 FFN으로 결합.
DECODER · 공동
LSTM 경로 디코더
질문 맥락을 가장 잘 해석하는 관계 경로 P를 확률 모델로 생성 — KGQA·KGC 모두 사용.
SCORING · 공용
답 스코어링 (ComplEx)
공유 임베딩 공간에서 모든 노드를 랭킹, 상위 k개 후보 선택.
REFINE · KGQA
Transformer 정제
v_Q · P · k개 후보를 입력으로 최종 KGQA 출력 생성 (선택적).
OUTPUT · KGC
지식그래프 완성
디코딩된 경로 P가 답 스코어링을 거쳐 KGC 태스크를 돕는다.
SECTION 5.1

서론 — 분리되어 있던 두 태스크

지식그래프는 노드가 실세계의 개체·사건·객체를, 에지가 두 노드 간의 관계를 나타내는 사실의 집합이다. 2012년 등장 이후 Freebase, Yago, Wikidata 등 다양한 지식그래프가 만들어졌고, 네트워크 정렬[161], 계산적 팩트체킹[83, 88, 93], 추천[39]에 이르기까지 응용은 무수하다. 그중 멀티홉 KGQA는 지식그래프의 도움으로 자연어 질문에 답하고, 지식그래프 완성(KGC)은 기존 정보에 기반해 누락된 사실을 추론한다.

KGQA와 KGC 모두 학계·산업의 큰 관심을 받아 왔다. KGC에서는 TransE[11]가 관계를 임베딩 공간의 선형 전이로 모델링하고, ComplEx[147]는 복소 공간에 임베딩하여 에너지 함수로 예측한다. 멀티홉 질의응답에서는 PullNet[135]이 질문 특정 서브그래프를 추출한 뒤 GNN으로 멀티홉 추론을 수행하고, EmbedKGQA[126]는 사전학습 BERT로 자연어 질문을 관계 임베딩에 매핑하고 ComplEx로 답을 찾는다. 일부 연구[126]는 두 태스크의 호환성 때문에 KGC를 단일홉 KGQA로 취급한다 — 예컨대 KGC의 (Interstellar, hasGenre, ?) 예측은 "Interstellar의 장르는 무엇인가?"라는 자연어 질문으로 변환될 수 있다. 그러나 기존 연구는 두 태스크를 분리해서 다루며 상호 이익을 고려하지 않는다 — 기존 멀티홉 KGQA는 배경 지식그래프가 완전하다고 암묵적으로 가정하고[135, 136], 기존 KGC(RESCAL[107], ComplEx[147])는 입력된 불완전한 KG의 기존 정보만 활용한다.

FIG 5.1 기반 — KGQA ⇄ KGC 상호 보완 루프 (버튼으로 방향 전환)
멀티홉 KGQA
자연어 질문 → 답 개체 집합
R1 → ← R2
KGC
(h, r, ?) → 누락 사실 추론
R1 — KGQA가 KGC를 돕는다. KGQA 태스크로부터 새 지식이 추론되어 지식그래프 완성에 쓰일 수 있다. Fig 5.1의 지식그래프에서 "A Song of Love는 몇 년에 개봉했는가?"는 답할 수 없다 — 이 영화 주변에는 direct와 hasGenre 두 관계뿐이라 사람조차 기존 그래프만으로는 답할 수 없다. 그러나 "Jean Genet이 감독한 모든 영화는 몇 년에 개봉했는가?"의 답(1950)이 주어지면, Jean Genet이 평생 단 한 편의 영화만 감독했으므로 A Song of Love의 개봉 연도가 1950임을 추론할 수 있다.

이 핵심 통찰로 무장하여, 멀티홉 KGQA와 KGC를 공동으로 해결하는 멀티태스크 학습 문제를 정식화한다. 첫째, 멀티홉 KGQA를 KGC에 활용하기 위해 자연어 질문을 관계 경로로 변환하는 인코더-디코더 모델을 제안한다. 둘째, KGC를 멀티홉 KGQA에 활용하기 위해 두 태스크가 임베딩 공간과 답 스코어링 모듈을 공유하게 하여 잠재 특징을 자동으로 나누고 서로를 강화하도록 한다. 여러 실세계 데이터셋 실험에서 제안한 BiNet은 두 태스크 모두에서 일관되게 최신 성능을 달성한다.

SECTION 5.2

문제 정의

지식그래프는 𝒢 = (V, R, ℒ)로 표기한다 — V는 노드/개체 집합, R은 관계 집합, ℒ는 트리플 리스트다. 각 트리플 (h, r, t)에서 h는 머리(주어), t는 꼬리(목적어), r은 둘을 잇는 에지(관계·술어)다. 노드·관계의 임베딩은 굵은 소문자(ei, ri)로 나타낸다.

기호정의기호정의
v_i / r_ii번째 개체(노드) / 관계(에지)𝒬멀티홉 자연어 질문 훈련 집합
e_{v_i}, e_i / r_i노드 v_i의 임베딩 / 관계 r_i의 임베딩v_Q / e_Q질문의 토픽 개체 / 그 임베딩
Q자연어 질문 Q의 임베딩w_iQ의 i번째 단어
P질문 임베딩에서 디코딩된 경로P[i]경로 P의 i번째 관계
TASK · 멀티홉 KGQA
지식그래프 𝒢와 토픽 개체 vQ ∈ V, 단어 시퀀스 Q = (w₁, …, w|Q|)를 포함하는 자연어 질문이 주어지면, 질문에 답하는 노드 집합 AQ ⊆ V를 식별한다. [126]의 정의를 따라 모든 답 개체는 지식그래프에 존재하고, 각 질문은 단일 토픽 개체 vQ를 포함하며 vQ는 주어진다고 가정한다 — 예컨대 "영화 The Love of Siam의 언어는 무엇인가"의 토픽 개체는 The Love of Siam이다. 이상적으로 각 질문은 지식그래프의 유일한 경로 P = (r₁, r₂, …, r|P|)에 매핑될 수 있다.
TASK · 지식그래프 완성 (KGC)
기존 정보에 기반해 누락 사실/트리플을 추론한다. KGC는 통상 세 하위 태스크를 포함한다 — (1) (h, r, ?)에서 꼬리 개체 예측, (2) (?, r, t)에서 머리 개체 예측, (3) 머리·꼬리가 주어졌을 때 관계 예측. 이 장은 첫 번째 하위 태스크만 고려한다. 꼬리 개체를 예측할 때 KGC 방법은 지식그래프의 각 개체에 확률 점수를 산출하며, 후보 개체 v의 점수는 트리플 (h, r, v)가 참일 가능성을 나타낸다.

많은 실세계 지식그래프는 불완전하여, 불완전한 그래프에서 KGQA를 수행하면 잘못된 답으로 이어질 수 있다. 그래프가 완전하면 KGQA가 정답을 찾을 가능성이 높아진다. 반대로 추가 정보 없이 기존 그래프를 완성하기는 어려운데, KGQA의 질문-답 쌍이 그래프 완성을 돕는 보조 정보를 제공할 수 있다. 이 관찰에 기반해 KGC와 멀티홉 KGQA를 공동으로 다루며, 형식적으로 다음과 같이 정의한다.

PROPOSITION 5.1 · 멀티홉 KGQA와 KGC의 공동 해결
주어진 것 — (1) KGC 태스크의 훈련 트리플 집합, (2) KGQA 태스크의 훈련 멀티홉 자연어 질문 집합.
출력 — (1) KGC 태스크의 테스트 트리플에 대한 답, (2) KGQA 태스크의 테스트 멀티홉 자연어 질문에 대한 Top-k 답.
SECTION 5.3

제안 방법 — BiNet의 네 모듈

멀티홉 KGQA는 Q를 질의 경로로 번역해 지식그래프를 여행하며 답을 찾는 개체 탐색 문제로 볼 수 있으나, 그래프가 불완전하면 경로 순회나 서브그래프 매칭[81]으로 AQ를 직접 찾는 것은 비현실적이다. KGC 또한 지식 기근(knowledge famine)이나 핵심 정보 누락에 시달린다 — Fig 5.1에서 A Song of Love와 1950 사이의 releaseYear 관계가 없다면, 추가 정보 없이는 완성이 불가능하다. BiNet은 (1) 인코더-디코더로 자연어 질의를 관계 경로로 변환해 KGC를 돕고, (2) KGQA·KGC가 같은 임베딩 공간과 답 스코어링 모듈을 써서 잠재 특징을 자동 공유하도록 설계된다. 전체 모델은 각 부분의 손실을 결합해 종단간(end-to-end)으로 최적화된다.

5.3.2 질문 인코더-디코더

A — 전처리. 개체 표면형이 유발하는 잡음을 줄이기 위해, 질문 맥락 내 토픽 개체를 특수 토큰 [NE]로 마스킹한다 — "Who starred Interstellar?"는 "Who starred [NE]?"가 된다. 마스킹은 인코더가 개체 표면형을 암기하는 것을 막고 다른 개체가 등장하는 유사 질문으로의 일반화를 돕는다. 또한 질문 맥락의 경계를 표시하기 위해 시작과 끝에 [CLS]<s> 지시 토큰을 붙인다.

B — 질문 인코더 (사전학습 BERT [37])
[hCLS, w₁, …, w|Q|, hs] = BERT([CLS], w₁, …, w|Q|, <s>) (5.1)
hQ = FFN([hCLS | hs]) (5.2)
[CLS] 임베딩 hCLS와 <s> 임베딩 hs를 연결(|)해 FFN에 통과시켜 최종 질문 임베딩을 얻는다.
C — 질문 디코더 (LSTM [54])
질문 임베딩 hQ를 디코딩해 관계 시퀀스 P = (r₁, r₂, …, rn)을 생성한다.
h₀ = FFNh(hQ),   c₀ = FFNc(hQ) (5.3)
ht = LSTM(ht−1, ct−1, ot−1) (5.4)
at = softmax(MLP(ht)) (5.5)
xt+1 = Σi at(i)·ri (5.6)
초기 은닉/셀 상태는 hQ를 두 FFN에 각각 통과시켜 얻고, 초기 입력 x₀는 hQ 또는 영벡터다. 각 시점의 은닉 상태는 배치 정규화·드롭아웃을 갖춘 FFN과 Softmax를 거쳐 관계별 점수 벡터가 되고, 다음 시점 입력은 모든 관계 임베딩의 가중합이다. 각 시점의 최종 예측은 점수가 가장 높은 관계다.
D — 인코더-디코더 훈련 (베이즈 규칙에 의한 정답 경로 추론)
토픽 개체 vQ와 답 개체 사이에는 여러 경로가 존재할 수 있다. 각 쌍 (vQ, vi)의 k-최단 경로를 모두 찾아 정답 경로 후보로 취급하고, 베이즈 규칙으로 각 경로가 질문 맥락의 올바른 매핑일 확률을 추론한다. 토픽 개체 마스킹 후 유일한 질문 맥락 수 m에 따라 훈련 질문을 m개 그룹 S₁, …, Sm으로 나누고, 각 그룹은 답 풀 PLi = {AQ_j | Qj ∈ Si}, 각 답 개체는 후보 경로 집합 PC(Qj, vi) = {Pi | (vQ_j, Pi, vi) ∈ 𝒢}를 갖는다. PC 내 경로들의 출현을 i.i.d. 확률 변수로 가정하면:
Pr(Pi | Sj, θ) = ΣQ_j∈S_j Pr(Pi, Qj | θ) / |PLj| (5.7)
Pr(Pi, Qj | θ) = [ Σv_i∈A_{Q_j} 𝟙(Pi ∈ PC(Qj, vi)) / |PC(Qj, vi)| ] / |AQ_j| (5.8)
확률이 가장 높은 경로를 정답으로 택하며, 최고 확률 경로가 여러 개면 모두 정답으로 취급한다. 인코더-디코더 훈련에는 이진 교차 엔트로피 손실을 사용한다:
ℒ(P̂, P) = (1/N) Σi=1N Σj=1|P| 𝟙(P[j]=ri)·log Pr(ri|M) + (1−𝟙(P[j]=ri))·log(1−Pr(ri|M)) (5.9–5.10)
M은 인코더-디코더 파라미터, N은 𝒢의 관계 수, P̂는 경로 디코더의 출력이다.

5.3.3 답 스코어링 — 두 태스크가 공유하는 심장

A — 배경. 알고리즘이 지식그래프의 이행성을 만족하면 경로 연산은 p = r₁ ⋆ r₂ ⋆ ⋯ ⋆ r_n (Eq 5.11)으로 표현된다 — ⋆는 합성 연산이다. TransE[11]에서는 각 관계가 선형 이동이므로 p = Σ r_i (Eq 5.12), RotatE[138]에서는 회전이므로 아다마르(원소별) 곱 p = r₁ ⊙ ⋯ ⊙ r_n (Eq 5.13)이다. 그러나 Eq 5.11을 소박하게 써서 답을 찾으면 정확도가 낮을 수 있다 — 임베딩 공간에는 잡음이 있고, 경로가 길어질수록 연쇄 오류(cascading error)가 커지기 때문이다[60, 85]. 따라서 중간 후보들로 탐색 과정을 조정해야 한다.

B — 확률적 추론 모델 Θ와 빔 서치
토픽 개체 vQ에서 출발하는 관계 시퀀스 P에 대해, 모델 Θ: (r, v) → [0, 1]은 해당 에지를 따라갈 우도를 예측한다. v의 우도는 P가 순회하는 모든 중간 단계 우도의 곱이다:
Pr(v | P, vQ, 𝒢) ∝ ∏i=1|P| Θ(ri, vi | P1→i−1, vQ, 𝒢) (5.14)
o = maxv_i∈V Pr(vi | P, vQ, 𝒢) (5.15)
각 시점에서 최대 확률의 중간 개체만 고르면 그래프 불완전성 때문에 정답을 놓칠 수 있고, 모든 중간 후보를 순회하면 효율이 저해된다. 효과-효율 균형과 연쇄 오류 완화를 위해 각 단계에서 우도 최대 Top-k 후보를 선택하며, 이는 vQ에서 시작하는 빔 서치 같은 효율적 탐색 알고리즘으로 수행한다. 마지막 단계에서 최고 확률 후보를 택한다. Θ는 KGQA·KGC 두 태스크 모두가 사용해 정보를 자동 공유하게 하며, 쌍선형 변환[162]· 합성곱 신경망[36] 등으로 모델링할 수 있으나 실험에서는 단순성을 위해 ComplEx[147]를 쓴다:
Pr(vt | ri, vh, 𝒢) = Re(< ri, eh, ei >) (5.16)
C — 기존 방법과의 연결 이행성을 만족하는 대부분의 기존 알고리즘은 이 모델의 특수 사례다. TransE에서는 Θ(ri, vt | ·) ∝ ‖ev_Q + Σr_j∈P₁→ᵢ rj − et‖₂−𝟙(i=|P|) (Eq 5.17), RotatE에서는 Θ(ri, vt | ·) ∝ ‖ev_Q ⊙ r₁ ⊙ … ⊙ ri − et‖₂−𝟙(i=|P|) (Eq 5.18)로 계산된다.

5.3.4 답 정제 (Answer Refinement) — 선택적 재랭킹

Θ가 찾은 후보 집합은 대체로 AQ의 합리적 추정치지만, 때로 잡음이 참 답보다 높은 확률을 가질 수 있다 — KG의 관계는 FatherOf·liveIn처럼 비대칭이거나 IsFriendWith처럼 대칭인 다양한 패턴·성질을 보이는데, 그래프의 불완전성과 복잡성 때문에 대칭·비대칭·이행성 등 모든 성질 조합을 만족하는 완벽한 모델은 사실상 불가능하기 때문이다. 이에 답 스코어링 모듈의 Top-k 후보를 재정렬하는 정제 모델을 제안한다[59, 149]. 토픽 개체 vQ와 경로 P를 각 후보와 연결해 k개의 시퀀스를 만들고, 각 시퀀스를 하나의 언어 문장처럼 Transformer[149]에 통과시켜 문장의 타당성을 예측한다:

EQ 5.19–5.20 · Transformer 재랭킹
hi = TRANSFORMER([ev_Q | r₁ | … | rn | ev_i]) (5.19)
Pr(vi | P, vQ, 𝒢) = Sigmoid(FFN(hi)) (5.20)
마지막 단계에서 분류기가 답 스코어링 모듈과 Transformer 모듈 중 어느 쪽의 예측을 반환할지 결정한다. 정제 단계는 선택적(optional)이다.

5.3.5 학습 알고리즘 — 통합 손실

EQ 5.21–5.22 · BiNet 전체 손실
ℒ = ℒ_KGQA + ℒ_KGC + ℒ_Path + ℒ_REG
  = ΣQ∈𝒬 J(ŷ, y) + λ₁ Σ(h,r,t)∈𝒢 J(t̂, t) + λ₂ ΣQ∈𝒬 ℒ(P̂, P) + λ₃‖W‖₂²
λ₁·λ₂·λ₃는 손실 균형 하이퍼파라미터, J는 이진 교차 엔트로피다. 첫 항은 KGQA 손실(ŷ: BiNet 예측, y: 정답), 둘째 항은 KGC 손실, 셋째 항은 과적합 방지 정규화, 마지막 항은 경로 디코더 손실이다. ℒ_KGQA는 정제 전 답 스코어링 손실과 정제 후 손실의 두 부분으로 구성된다.

5.3.6 증명과 분석 — 표현력 보장

Lemma 5.1·5.2는 KGC와 KGQA가 실제로 서로 이익을 준다는 것을, Lemma 5.3은 경로의 정확 매칭이 그래프에 존재하고 임의의 (h, r, t) ∈ ℒ에 대해 Eq 5.16이 1이라면 BiNet이 그것을 반드시 찾음을 보인다.

LEMMA 5.1 · KGQA가 KGC에 주는 이익
질문 Q(토픽 개체 vQ, 답 집합 AQ)와 관계 시퀀스 P에 대해, vQ와 AQ의 어떤 v 사이에도 정확 매칭이 없고 <vk, rj, vm>이 vQ→va 경로 상의 누락 링크라면, ℒ_KGQA 최소화는 ℒ_KGC도 최소화한다.
PROOFℒ_KGQA 최소화는 임의의 v ∈ AQ에 대한 Pr(v|P, vQ, 𝒢) 최대화를 뜻한다. <vk, rj, vm>이 그 경로 위의 누락 링크이므로 Pr(va|P, vQ, 𝒢) 최대화는 트리플 (vk, rj, vm)에 대한 KGC 출력 Pr(vm|rj, vk, 𝒢)의 최대화를 뜻한다. 따라서 ℒ_KGC가 최소화된다. □
LEMMA 5.2 · KGC가 KGQA에 주는 이익
같은 설정에서 vQ와 AQ의 어떤 v 사이에도 정확 매칭이 없다면, ℒ_KGC 최소화는 ℒ_KGQA도 최소화한다.
PROOFℒ_KGC 최소화는 임의의 (vh, ri, vt) ∈ 𝒢에 대한 Pr(vt|ri, vh, 𝒢) 최대화를 뜻한다. Pr(va|P, vQ, 𝒢)는 Eq 5.14로 표현되며 각 항이 최대화되므로 전체도 최대화된다. 따라서 ℒ_KGQA가 최소화된다. □
LEMMA 5.3 · 모델 건전성 (Model Soundness)
임의의 (h, r, t) ∈ ℒ에 대해 Eq 5.16이 1이고 vQ와 어떤 v ∈ AQ 사이에 정확 매칭이 존재하면, k ≥ D|P|−1인 한 BiNet은 반드시 그것을 찾는다 — D는 특정 관계 타입에 대한 노드의 최대 출차수다.
PROOFD가 특정 관계 타입 상 최대 출차수이므로, vQ에서 출발하는 (r₁, …, r|P|−1)의 정확 매칭 경로는 최대 D|P|−1개다. k ≥ D|P|−1이면 이들이 모두 Top-k 후보에 포함되어 정확 매칭을 찾을 수 있다. □

|P|는 비교적 작은 값이다(통상 |P| ≤ 3).

SECTION 5.4

실험 — 두 태스크에서의 일관된 우위

완전한 KG에서의 KGQA는 이들 데이터셋에서 사소해지므로(경로 순회·서브그래프 매칭만으로 거의 100% 정확도), 전체 그래프에서 에지의 50%와 70%를 무작위 삭제한 불완전 KG라는 도전적 설정에서 비교한다 — 표의 "50% KG"는 에지 50% 보존, "30% KG"는 30% 보존을 뜻한다.

84.3
MetaQA 50% KG 평균 Hits@1 — EmbedKGQA보다 약 2.5%, 그 외 베이스라인보다 25% 이상 우위
79.5
MetaQA 30% KG 평균 Hits@1 — EmbedKGQA보다 약 3.5%, 그 외 평균 28% 우위
+2%
정제(재랭킹) 모듈의 평균 정확도 개선 — 긴 경로일수록 효과 증가 (3.2% vs 1.3%)
<15분
긴 훈련 시간에도 불구하고 테스트 시간은 15분 미만

5.4.1 실험 설정

MetaQA
영화 도메인 멀티홉 질문 데이터셋. 40만 개 이상의 자연어 질문과 감독·영화·장르·배우 관계를 담은 10만 개 이상의 트리플 배경 KG. 질문은 1-hop·2-hop·3-hop 세 범주다.
WebQuestionsSP
Freebase로 답할 수 있는 약 4,000개 질문. 1-hop과 2-hop 질문이 혼재한다.
SimpleQuestions
10만 개 이상의 단순 1-hop 질문과 대응 Freebase 트리플. WebQuestionsSP에 사용된 Freebase로 답할 수 있는 질문들의 부분집합을 사용한다.

KGQA 베이스라인 4종 — GraftNet[136](질문 특정 서브그래프 + GNN 예측), PullNet[135](최단 경로를 감독 신호로 그래프 검색 모듈 훈련, 검색된 서브그래프 위에서 GraftNet으로 멀티홉 추론), KV-Mem[103](KG 사실을 저장하는 메모리 테이블 유지·검색), EmbedKGQA[126](RoBERTa 질문 임베딩과 사전학습 개체 임베딩 매칭; 관계 매칭 없이 사용). KGC 베이스라인 — RESCAL[107](3-way 텐서 분해: 개체=잠재 벡터, 관계=행렬), DistMult[162](저차원 벡터 + 쌍선형 함수), ComplEx[147](실수부·허수부를 갖는 복소 벡터 + 쌍선형 함수).

5.4.2 KGQA 성능 (Hits@1)

표준 설정[126]을 따라 Hits@1로 평가한다. PullNet은 코드가 비공개라 30% KG 성능은 생략했고, GraftNet·KV-Mem의 결과는 [136]에서 가져왔다. 배경 그래프가 희소해질수록 모든 방법의 정확도가 감소하며 — 배경 KG의 품질이 KGQA에 상당한 영향을 미친다. 특히 서브그래프 검색 기반인 GraftNet·PullNet은 그래프가 희소해지면 생성된 서브그래프가 답 개체를 포함하지 못해 성능이 심각하게 저하된다.

모델50% KG30% KG
MetaQA-1MetaQA-2MetaQA-3평균MetaQA-1MetaQA-2MetaQA-3평균
GraftNet64.052.659.258.648.448.4
PullNet65.152.159.759.0
KV-Mem63.641.837.647.744.744.7
EmbedKGQA83.191.870.381.777.781.269.076.0
BiNet84.292.875.984.377.886.474.379.5

WebQuestionsSP·SimpleQuestions에서도 유사한 경향이며, BiNet이 베이스라인을 일관되게 능가한다 — 평균 약 1.2% 우위다.

모델50% KG30% KG
WebqspSimpleQAWebqspSimpleQA
GraftNet32.739.834.925.7
PullNet48.234.6
KV-Mem50.128.925.822.8
EmbedKGQA47.341.738.833.5
BiNet49.442.640.533.9

5.4.3 KGC 성능

RESCAL·DistMult·ComplEx 같은 전통적 임베딩 방법은 MetaQA 지식그래프에서 성능이 낮다 — 이 그래프는 매우 희소하여 에지가 약 66,791개로 Freebase의 2.3%에 불과하기 때문이다. EmbedKGQA는 KGC용으로 설계되지 않았으므로 KG 트리플 (h, r, v)를 자연어 질문으로 변환해 훈련했는데, MetaQA에서는 질문 데이터 없이도 기존 KGC 베이스라인보다 높고 질문 데이터를 쓰면 약 15% 더 높다. 그리고 제안한 BiNet이 일관되게 최고의 KGC 성능을 보인다('Merge' 데이터셋은 Webqsp + SimpleQA의 결합).

5.4.4 어블레이션 연구

A — 답 정제. 정제 모듈은 50%·30% 불완전 KG 모두에서 평균 약 2%의 정확도 개선을 가져온다 — 배경 그래프의 희소성을 실제로 완화한다는 뜻이다. Webqsp·SimpleQA 같은 1-hop 질문 대비 긴 경로 질문에서 개선이 더 크다(3.2% vs 1.3%) — 경로가 길수록 정제 모듈이 더 효과적이다.

모델MetaQA-3hopWebqspSimpleQA
50% KG
BiNet 재랭킹 없음70.347.241.8
BiNet 재랭킹 포함75.949.442.6
30% KG
BiNet 재랭킹 없음71.239.133.2
BiNet 재랭킹 포함74.340.533.9

B — 지식그래프 완성의 힘. 그래프를 먼저 완성하는 것만으로 KGQA에 도움이 되는지를 두 전략으로 검증한다. 먼저 KGQA 훈련·검증 집합의 자연어 질문에 따라 휴리스틱 기반으로 완성한다(규칙 기반 KGC[47]와 유사 — 예: A가 B의 자녀이고 C가 B의 남편이면 A는 C의 자녀). 이어서 부분 완성된 그래프에 ComplEx를 훈련해 (h, r, ?)를 예측하되, Pr ≥ 0.99인 트리플만 유지하고 명백한 오류(예: 머리가 영화 Interstellar이고 관계가 starredBy인데 예측이 배우가 아닌 경우)는 확률이 0.99 이상이어도 제거한다.

모델EmbedKGQAKGC + EmbedKGQABiNet
50% KG
MetaQA-1hop83.183.284.2
MetaQA-2hop91.892.492.8
MetaQA-3hop70.373.575.9
Webqsp47.347.749.4
SimpleQA41.741.942.6
30% KG
MetaQA-1hop77.777.877.8
MetaQA-2hop81.285.186.4
MetaQA-3hop69.071.174.3
Webqsp38.839.140.5
SimpleQA33.533.733.9

KGC+EmbedKGQA는 세 종류 질문 모두에서 EmbedKGQA보다 낫다 — 그래프를 먼저 완성하면 실제로 KGQA가 향상된다. 30% KG의 MetaQA-2hop에서 최대 3.9%의 개선을 보이고, 평균적으로 그래프 선완성은 Hits@1을 약 1.2% 높인다. 제안한 BiNet은 여기서 다시 1.3%를 추가로 개선한다.

C — 경로 예측. 좋은 경로 디코더는 BiNet에 중요하다. 디코더 훈련 전 정답 경로를 훈련 데이터에 수동 추가하고, 각 시점에서 이전에 디코딩된 관계에 따라 다음 관계를 예측한다. 확률 α(= 0.5)로는 실제 정답 관계를 다음 시점 입력으로 쓰고, 확률 1 − α로는 정답과 달라도 모델이 예측한 관계를 입력으로 쓴다(스케줄드 티처 포싱). 경로 디코더는 높은 정확도로 관계 경로를 생성한다.

질문 (Table 5.6)디코딩된 경로
[Tanner Maguire]가 출연한 영화들은 어떤 장르였나Starred_actors_reverse | has_genre
[Cristian Nemescu]가 각본을 쓴 영화들은 언제 개봉했나Written_by_reverse | release_year
[Benjamin Pitts]가 연기한 영화들은 몇 년에 개봉했나Starred_actors_reverse | release_year
[Ray Ashley]의 영화 공동 각본가는 누구인가Written_by_reverse | written_by
[Mary McDonnell]과 공동 출연한 사람은 누구인가Starred_actors_reverse | starred_actors
[Jack Hazan]의 영화 공동 감독은 누구인가Directed_by_reverse | directed_by

D — 효율성. Webqsp·SimpleQA에서의 BiNet 실행 시간은 MetaQA보다 훨씬 큰데, 배경 지식그래프가 훨씬 크기 때문이다. 긴 훈련 시간에도 불구하고 테스트 시간은 15분 미만으로 비교적 짧다.