불완전한 지식그래프 위 추론은 제한적이고 파편화된 정보로부터 논리적 결론을 추론하고 정확한 예측을 수행하는 과정이다. 그래프에 핵심 트리플이 결여되어 있어도, 가용한 정보·패턴·관계를 활용해 공백을 메우고 의미 있는 통찰을 도출해야 한다. 이 장은 멀티홉 KGQA와 지식그래프 완성(KGC)이 본질적으로 상호 보완적이라는 통찰에 기반해, 두 태스크를 멀티태스크 학습 문제로 결합하는 BiNet을 제안한다.
지식그래프는 노드가 실세계의 개체·사건·객체를, 에지가 두 노드 간의 관계를 나타내는 사실의 집합이다. 2012년 등장 이후 Freebase, Yago, Wikidata 등 다양한 지식그래프가 만들어졌고, 네트워크 정렬[161], 계산적 팩트체킹[83, 88, 93], 추천[39]에 이르기까지 응용은 무수하다. 그중 멀티홉 KGQA는 지식그래프의 도움으로 자연어 질문에 답하고, 지식그래프 완성(KGC)은 기존 정보에 기반해 누락된 사실을 추론한다.
KGQA와 KGC 모두 학계·산업의 큰 관심을 받아 왔다. KGC에서는 TransE[11]가 관계를
임베딩 공간의 선형 전이로 모델링하고, ComplEx[147]는 복소 공간에 임베딩하여
에너지 함수로 예측한다. 멀티홉 질의응답에서는 PullNet[135]이 질문 특정 서브그래프를 추출한 뒤
GNN으로 멀티홉 추론을 수행하고, EmbedKGQA[126]는 사전학습 BERT로 자연어 질문을
관계 임베딩에 매핑하고 ComplEx로 답을 찾는다. 일부 연구[126]는 두 태스크의
호환성 때문에 KGC를 단일홉 KGQA로 취급한다 — 예컨대 KGC의 (Interstellar, hasGenre, ?) 예측은
"Interstellar의 장르는 무엇인가?"라는 자연어 질문으로 변환될 수 있다.
그러나 기존 연구는 두 태스크를 분리해서 다루며 상호 이익을 고려하지 않는다 —
기존 멀티홉 KGQA는 배경 지식그래프가 완전하다고 암묵적으로 가정하고[135, 136],
기존 KGC(RESCAL[107], ComplEx[147])는
입력된 불완전한 KG의 기존 정보만 활용한다.
이 핵심 통찰로 무장하여, 멀티홉 KGQA와 KGC를 공동으로 해결하는 멀티태스크 학습 문제를 정식화한다. 첫째, 멀티홉 KGQA를 KGC에 활용하기 위해 자연어 질문을 관계 경로로 변환하는 인코더-디코더 모델을 제안한다. 둘째, KGC를 멀티홉 KGQA에 활용하기 위해 두 태스크가 임베딩 공간과 답 스코어링 모듈을 공유하게 하여 잠재 특징을 자동으로 나누고 서로를 강화하도록 한다. 여러 실세계 데이터셋 실험에서 제안한 BiNet은 두 태스크 모두에서 일관되게 최신 성능을 달성한다.
지식그래프는 𝒢 = (V, R, ℒ)로 표기한다 — V는 노드/개체 집합, R은 관계 집합, ℒ는 트리플 리스트다.
각 트리플 (h, r, t)에서 h는 머리(주어), t는 꼬리(목적어), r은 둘을 잇는 에지(관계·술어)다.
노드·관계의 임베딩은 굵은 소문자(ei, ri)로 나타낸다.
| 기호 | 정의 | 기호 | 정의 |
|---|---|---|---|
| v_i / r_i | i번째 개체(노드) / 관계(에지) | 𝒬 | 멀티홉 자연어 질문 훈련 집합 |
| e_{v_i}, e_i / r_i | 노드 v_i의 임베딩 / 관계 r_i의 임베딩 | v_Q / e_Q | 질문의 토픽 개체 / 그 임베딩 |
| Q | 자연어 질문 Q의 임베딩 | w_i | Q의 i번째 단어 |
| P | 질문 임베딩에서 디코딩된 경로 | P[i] | 경로 P의 i번째 관계 |
(h, r, ?)에서 꼬리 개체 예측, (2) (?, r, t)에서 머리 개체 예측,
(3) 머리·꼬리가 주어졌을 때 관계 예측. 이 장은 첫 번째 하위 태스크만 고려한다.
꼬리 개체를 예측할 때 KGC 방법은 지식그래프의 각 개체에 확률 점수를 산출하며,
후보 개체 v의 점수는 트리플 (h, r, v)가 참일 가능성을 나타낸다.
많은 실세계 지식그래프는 불완전하여, 불완전한 그래프에서 KGQA를 수행하면 잘못된 답으로 이어질 수 있다. 그래프가 완전하면 KGQA가 정답을 찾을 가능성이 높아진다. 반대로 추가 정보 없이 기존 그래프를 완성하기는 어려운데, KGQA의 질문-답 쌍이 그래프 완성을 돕는 보조 정보를 제공할 수 있다. 이 관찰에 기반해 KGC와 멀티홉 KGQA를 공동으로 다루며, 형식적으로 다음과 같이 정의한다.
멀티홉 KGQA는 Q를 질의 경로로 번역해 지식그래프를 여행하며 답을 찾는 개체 탐색 문제로 볼 수 있으나, 그래프가 불완전하면 경로 순회나 서브그래프 매칭[81]으로 AQ를 직접 찾는 것은 비현실적이다. KGC 또한 지식 기근(knowledge famine)이나 핵심 정보 누락에 시달린다 — Fig 5.1에서 A Song of Love와 1950 사이의 releaseYear 관계가 없다면, 추가 정보 없이는 완성이 불가능하다. BiNet은 (1) 인코더-디코더로 자연어 질의를 관계 경로로 변환해 KGC를 돕고, (2) KGQA·KGC가 같은 임베딩 공간과 답 스코어링 모듈을 써서 잠재 특징을 자동 공유하도록 설계된다. 전체 모델은 각 부분의 손실을 결합해 종단간(end-to-end)으로 최적화된다.
A — 전처리. 개체 표면형이 유발하는 잡음을 줄이기 위해, 질문 맥락 내 토픽 개체를 특수 토큰
[NE]로 마스킹한다 — "Who starred Interstellar?"는 "Who starred [NE]?"가 된다.
마스킹은 인코더가 개체 표면형을 암기하는 것을 막고 다른 개체가 등장하는 유사 질문으로의 일반화를 돕는다.
또한 질문 맥락의 경계를 표시하기 위해 시작과 끝에 [CLS]와 <s> 지시 토큰을 붙인다.
A — 배경. 알고리즘이 지식그래프의 이행성을 만족하면 경로 연산은
p = r₁ ⋆ r₂ ⋆ ⋯ ⋆ r_n (Eq 5.11)으로 표현된다 — ⋆는 합성 연산이다.
TransE[11]에서는 각 관계가 선형 이동이므로 p = Σ r_i (Eq 5.12),
RotatE[138]에서는 회전이므로 아다마르(원소별) 곱
p = r₁ ⊙ ⋯ ⊙ r_n (Eq 5.13)이다.
그러나 Eq 5.11을 소박하게 써서 답을 찾으면 정확도가 낮을 수 있다 — 임베딩 공간에는 잡음이 있고,
경로가 길어질수록 연쇄 오류(cascading error)가 커지기 때문이다[60, 85].
따라서 중간 후보들로 탐색 과정을 조정해야 한다.
Θ가 찾은 후보 집합은 대체로 AQ의 합리적 추정치지만, 때로 잡음이 참 답보다 높은 확률을 가질 수 있다 — KG의 관계는 FatherOf·liveIn처럼 비대칭이거나 IsFriendWith처럼 대칭인 다양한 패턴·성질을 보이는데, 그래프의 불완전성과 복잡성 때문에 대칭·비대칭·이행성 등 모든 성질 조합을 만족하는 완벽한 모델은 사실상 불가능하기 때문이다. 이에 답 스코어링 모듈의 Top-k 후보를 재정렬하는 정제 모델을 제안한다[59, 149]. 토픽 개체 vQ와 경로 P를 각 후보와 연결해 k개의 시퀀스를 만들고, 각 시퀀스를 하나의 언어 문장처럼 Transformer[149]에 통과시켜 문장의 타당성을 예측한다:
Lemma 5.1·5.2는 KGC와 KGQA가 실제로 서로 이익을 준다는 것을, Lemma 5.3은 경로의 정확 매칭이 그래프에 존재하고 임의의 (h, r, t) ∈ ℒ에 대해 Eq 5.16이 1이라면 BiNet이 그것을 반드시 찾음을 보인다.
|P|는 비교적 작은 값이다(통상 |P| ≤ 3).
완전한 KG에서의 KGQA는 이들 데이터셋에서 사소해지므로(경로 순회·서브그래프 매칭만으로 거의 100% 정확도), 전체 그래프에서 에지의 50%와 70%를 무작위 삭제한 불완전 KG라는 도전적 설정에서 비교한다 — 표의 "50% KG"는 에지 50% 보존, "30% KG"는 30% 보존을 뜻한다.
KGQA 베이스라인 4종 — GraftNet[136](질문 특정 서브그래프 + GNN 예측), PullNet[135](최단 경로를 감독 신호로 그래프 검색 모듈 훈련, 검색된 서브그래프 위에서 GraftNet으로 멀티홉 추론), KV-Mem[103](KG 사실을 저장하는 메모리 테이블 유지·검색), EmbedKGQA[126](RoBERTa 질문 임베딩과 사전학습 개체 임베딩 매칭; 관계 매칭 없이 사용). KGC 베이스라인 — RESCAL[107](3-way 텐서 분해: 개체=잠재 벡터, 관계=행렬), DistMult[162](저차원 벡터 + 쌍선형 함수), ComplEx[147](실수부·허수부를 갖는 복소 벡터 + 쌍선형 함수).
표준 설정[126]을 따라 Hits@1로 평가한다. PullNet은 코드가 비공개라 30% KG 성능은 생략했고, GraftNet·KV-Mem의 결과는 [136]에서 가져왔다. 배경 그래프가 희소해질수록 모든 방법의 정확도가 감소하며 — 배경 KG의 품질이 KGQA에 상당한 영향을 미친다. 특히 서브그래프 검색 기반인 GraftNet·PullNet은 그래프가 희소해지면 생성된 서브그래프가 답 개체를 포함하지 못해 성능이 심각하게 저하된다.
| 모델 | 50% KG | 30% KG | ||||||
|---|---|---|---|---|---|---|---|---|
| MetaQA-1 | MetaQA-2 | MetaQA-3 | 평균 | MetaQA-1 | MetaQA-2 | MetaQA-3 | 평균 | |
| GraftNet | 64.0 | 52.6 | 59.2 | 58.6 | 48.4 | – | – | 48.4 |
| PullNet | 65.1 | 52.1 | 59.7 | 59.0 | – | – | – | – |
| KV-Mem | 63.6 | 41.8 | 37.6 | 47.7 | 44.7 | – | – | 44.7 |
| EmbedKGQA | 83.1 | 91.8 | 70.3 | 81.7 | 77.7 | 81.2 | 69.0 | 76.0 |
| BiNet | 84.2 | 92.8 | 75.9 | 84.3 | 77.8 | 86.4 | 74.3 | 79.5 |
WebQuestionsSP·SimpleQuestions에서도 유사한 경향이며, BiNet이 베이스라인을 일관되게 능가한다 — 평균 약 1.2% 우위다.
| 모델 | 50% KG | 30% KG | ||
|---|---|---|---|---|
| Webqsp | SimpleQA | Webqsp | SimpleQA | |
| GraftNet | 32.7 | 39.8 | 34.9 | 25.7 |
| PullNet | 48.2 | – | 34.6 | – |
| KV-Mem | 50.1 | 28.9 | 25.8 | 22.8 |
| EmbedKGQA | 47.3 | 41.7 | 38.8 | 33.5 |
| BiNet | 49.4 | 42.6 | 40.5 | 33.9 |
RESCAL·DistMult·ComplEx 같은 전통적 임베딩 방법은 MetaQA 지식그래프에서 성능이 낮다 — 이 그래프는 매우 희소하여 에지가 약 66,791개로 Freebase의 2.3%에 불과하기 때문이다. EmbedKGQA는 KGC용으로 설계되지 않았으므로 KG 트리플 (h, r, v)를 자연어 질문으로 변환해 훈련했는데, MetaQA에서는 질문 데이터 없이도 기존 KGC 베이스라인보다 높고 질문 데이터를 쓰면 약 15% 더 높다. 그리고 제안한 BiNet이 일관되게 최고의 KGC 성능을 보인다('Merge' 데이터셋은 Webqsp + SimpleQA의 결합).
A — 답 정제. 정제 모듈은 50%·30% 불완전 KG 모두에서 평균 약 2%의 정확도 개선을 가져온다 — 배경 그래프의 희소성을 실제로 완화한다는 뜻이다. Webqsp·SimpleQA 같은 1-hop 질문 대비 긴 경로 질문에서 개선이 더 크다(3.2% vs 1.3%) — 경로가 길수록 정제 모듈이 더 효과적이다.
| 모델 | MetaQA-3hop | Webqsp | SimpleQA |
|---|---|---|---|
| 50% KG | |||
| BiNet 재랭킹 없음 | 70.3 | 47.2 | 41.8 |
| BiNet 재랭킹 포함 | 75.9 | 49.4 | 42.6 |
| 30% KG | |||
| BiNet 재랭킹 없음 | 71.2 | 39.1 | 33.2 |
| BiNet 재랭킹 포함 | 74.3 | 40.5 | 33.9 |
B — 지식그래프 완성의 힘. 그래프를 먼저 완성하는 것만으로 KGQA에 도움이 되는지를 두 전략으로 검증한다. 먼저 KGQA 훈련·검증 집합의 자연어 질문에 따라 휴리스틱 기반으로 완성한다(규칙 기반 KGC[47]와 유사 — 예: A가 B의 자녀이고 C가 B의 남편이면 A는 C의 자녀). 이어서 부분 완성된 그래프에 ComplEx를 훈련해 (h, r, ?)를 예측하되, Pr ≥ 0.99인 트리플만 유지하고 명백한 오류(예: 머리가 영화 Interstellar이고 관계가 starredBy인데 예측이 배우가 아닌 경우)는 확률이 0.99 이상이어도 제거한다.
| 모델 | EmbedKGQA | KGC + EmbedKGQA | BiNet |
|---|---|---|---|
| 50% KG | |||
| MetaQA-1hop | 83.1 | 83.2 | 84.2 |
| MetaQA-2hop | 91.8 | 92.4 | 92.8 |
| MetaQA-3hop | 70.3 | 73.5 | 75.9 |
| Webqsp | 47.3 | 47.7 | 49.4 |
| SimpleQA | 41.7 | 41.9 | 42.6 |
| 30% KG | |||
| MetaQA-1hop | 77.7 | 77.8 | 77.8 |
| MetaQA-2hop | 81.2 | 85.1 | 86.4 |
| MetaQA-3hop | 69.0 | 71.1 | 74.3 |
| Webqsp | 38.8 | 39.1 | 40.5 |
| SimpleQA | 33.5 | 33.7 | 33.9 |
KGC+EmbedKGQA는 세 종류 질문 모두에서 EmbedKGQA보다 낫다 — 그래프를 먼저 완성하면 실제로 KGQA가 향상된다. 30% KG의 MetaQA-2hop에서 최대 3.9%의 개선을 보이고, 평균적으로 그래프 선완성은 Hits@1을 약 1.2% 높인다. 제안한 BiNet은 여기서 다시 1.3%를 추가로 개선한다.
C — 경로 예측. 좋은 경로 디코더는 BiNet에 중요하다. 디코더 훈련 전 정답 경로를 훈련 데이터에 수동 추가하고, 각 시점에서 이전에 디코딩된 관계에 따라 다음 관계를 예측한다. 확률 α(= 0.5)로는 실제 정답 관계를 다음 시점 입력으로 쓰고, 확률 1 − α로는 정답과 달라도 모델이 예측한 관계를 입력으로 쓴다(스케줄드 티처 포싱). 경로 디코더는 높은 정확도로 관계 경로를 생성한다.
| 질문 (Table 5.6) | 디코딩된 경로 |
|---|---|
| [Tanner Maguire]가 출연한 영화들은 어떤 장르였나 | Starred_actors_reverse | has_genre |
| [Cristian Nemescu]가 각본을 쓴 영화들은 언제 개봉했나 | Written_by_reverse | release_year |
| [Benjamin Pitts]가 연기한 영화들은 몇 년에 개봉했나 | Starred_actors_reverse | release_year |
| [Ray Ashley]의 영화 공동 각본가는 누구인가 | Written_by_reverse | written_by |
| [Mary McDonnell]과 공동 출연한 사람은 누구인가 | Starred_actors_reverse | starred_actors |
| [Jack Hazan]의 영화 공동 감독은 누구인가 | Directed_by_reverse | directed_by |
D — 효율성. Webqsp·SimpleQA에서의 BiNet 실행 시간은 MetaQA보다 훨씬 큰데, 배경 지식그래프가 훨씬 크기 때문이다. 긴 훈련 시간에도 불구하고 테스트 시간은 15분 미만으로 비교적 짧다.