CHAPTER 06 Knowledge Graph Reasoning  /  A Neuro-Symbolic Perspective

온톨로지를 결합한 지식 그래프 추론크로스뷰 링크와 인트라뷰 계층을 함께 쓰면 두 뷰가 서로를 강화한다

DBPedia, YAGO, ConceptNet 같은 다수의 대규모 KG는 두 개의 구별되는 뷰를 갖는다. (1) 추상 개념의 메타 관계로 구성된 온톨로지 뷰, (2) 특정 엔티티 사이의 관계를 담는 인스턴스 뷰다. (Politician, IsLeaderOf, City)는 두 개념 사이의 관계인 온톨로지 뷰 트리플이고, (Barack Obama, WasBornIn, Honolulu)는 두 엔티티 사이의 관계인 인스턴스 뷰 트리플이다. 두 뷰는 크로스뷰 링크로 매끄럽게 상호 연결된다. 그럼에도 기존 방법 대부분은 인스턴스 뷰 표현에만 집중하고 온톨로지 뷰의 정보를 방기한다. 이 장은 두 뷰를 공동으로 고려해 KG 추론을 강화하는 방법을 파고든다.

“Science is organized knowledge. Wisdom is organized life.” — Immanuel Kant
저자Kewei Cheng · Yizhou Sun 출판Springer, 2025 범위pp. 149–179
6.1

개요

온톨로지 뷰  ·  클래스 · 속성 · 관계  ·  형식화
Fig. 6.1 — 두 뷰 KG의 예
ONTOLOGY VIEW  G_O = (C, R_O, O_O) INSTANCE VIEW  G_I = (E, R_I, O_I) IsLeaderOf is_a is_a Politician City Singer Artist Person IsA IsA WasBornIn Barack Obama Honolulu
개념 (concept) 엔티티 (entity) 일반 메타 관계 계층 메타 관계 크로스뷰 링크 인스턴스 뷰 관계
Fig. 6.1 두 뷰 KG의 예다. 온톨로지 뷰에서 일반 메타 관계계층 메타 관계는 각각 주황색과 검은 점선으로 표시된다. 크로스뷰 트리플 (Honolulu, IsA, City)는 “Honolulu는 City다”를 뜻한다. “Singer”, “Artist”, “Person”은 온톨로지 뷰 안에서 계층을 이룬다. 원문 도판은 래스터 이미지로 삽입되어 좌표를 추출할 수 없다. 본문이 명시한 개념·엔티티·관계(Politician–IsLeaderOf–City, Barack Obama–WasBornIn–Honolulu, Honolulu·Barack Obama의 IsA 링크, Singer→Artist→Person 계층)만으로 재구성했다.

온톨로지 뷰 지식 그래프

온톨로지 개념과 그 지식 표현상의 중요성은 오랜 역사를 가진다. 1970~1980년대 AI 연구의 초기 진전이 자동 추론을 위한 구조화된 지식 표현을 만들려는 목표로 온톨로지의 기초를 놓았다. 1990년대에는 시맨틱 웹 이니셔티브의 등장이 온톨로지 개발과 웹 지식 표현으로의 통합을 추동했다. 이는 기계 판독 가능한 형식으로 지식과 온톨로지의 형식적 표현을 촉진한 RDF [5]와 OWL [6] 같은 언어의 창출로 이어졌다. DBpedia [7]와 Freebase [8] 같은 대규모 KG의 성장과 함께 온톨로지 개념과 관계의 포함이 점점 결정적이 되었다.

온톨로지 개념의 포함은 더 구조화되고 포괄적인 지식 표현을 허용한다. 모든 저자에게 공통된 속성을 포괄하는 일반화를 나타내는 “Author” 개념을 생각해 보면, 이 개념은 KG 안에서 저자에 관한 정보를 조직·범주화하는 틀을 제공한다. 온톨로지는 개별 엔티티에 관한 특정 정보를 담지 않는다는 점이 중요하다. “Albert Einstein” 같은 구체적 인스턴스는 “Author” 개념에 속하며 부모 개념으로부터 속성을 상속받는 특정 엔티티로 간주된다. 이 구별이 온톨로지 뷰 KG가 더 구조화되고 포괄적인 지식 표현을 달성하게 하여 지식의 더 나은 일반화를 촉진한다.

Fig. 6.2 — KG 온톨로지의 예
hasGender hasPrice write workWith livedIn publishedBy locatedIn locatedIn cite Gender Price Author Book Publisher Location
클래스 (Classes) 속성 (Attributes) 관계 (Relationships)
Fig. 6.2 그림의 각 타원은 온톨로지 뷰 KG의 클래스를, 각 사각형은 개별 클래스의 속성을 기술하는 속성을 나타낸다. Author는 Book을 쓰고(write), Publisher와 함께 일하며(workWith), Location에 산다(livedIn).

엔티티 유형과 속성을 정의하는 것 외에 온톨로지는 개념 사이의 관계도 정의할 수 있다. 예컨대 “Author”와 “Book” 사이에 “Write” 관계를, “Book”과 “Publisher” 사이에 “PublishedBy” 관계를 정의할 수 있다. 일반적으로 온톨로지에는 세 주요 구성 요소가 있다.

Classes

클래스

KG에 존재하는 엔티티의 구별되는 유형이다. Fig. 6.2에서는 “Book”, “Author”, “Publisher”, “Location”의 네 클래스가 KG의 엔티티를 표현한다.

Attributes

속성

개별 클래스를 기술하는 속성이다. 모든 클래스는 고유한 속성을 가진다. 예컨대 “Book” 클래스에 속한 모든 엔티티는 price 속성을 가진다.

Relations

관계

두 클래스를 잇는 링크다. “Authors” 클래스는 여러 관계로 다른 클래스와 상호작용한다 — Authors write Books, Authors work with Publishers, Authors live in Locations.

온톨로지는 KG의 일반 데이터 모델로 작동하며 KG의 엔티티와 속성을 기술하는 재사용 가능한 틀을 제공한다. 특정 엔티티에 관한 정보를 포함하지 않으므로 KG 정보 표현의 일관성과 정확성을 보장한다. 높은 일반화 가능성 때문에 온톨로지는 흔히 안정적이며 자주 변하지 않는다. 온톨로지와 데이터의 진화 속도 차이를 고려해, 둘을 별개 자원으로 유지하고 응용에서 결합하는 것이 통상적 실무다. 이 접근은 온톨로지의 일관성을 보존하면서 데이터의 손쉬운 수정을 허용한다.

E-Commerce

Amazon Catalogue

Amazon 전자상거래 플랫폼의 결정적 측면이다. 상품의 계층 구조와 관계를 정의해 효율적인 브라우징·검색·추천 시스템을 촉진한다 [9].

Academia

연구 분야 분류체계

ACM이 유지하는 연구 분야 분류체계는 컴퓨터과학 내 여러 분야를 조직·범주화한다 [10]. 논문·학회·연구자의 분류와 조회를 돕는다.

Biomedicine

Gene Ontology

생의학에서 널리 사용되는 온톨로지다 [11]. 여러 종에 걸쳐 유전자와 그 기능을 범주화하여 유전자 주석·분석·생물학적 지식 발견을 촉진한다.

Biomedicine

Disease Ontology

질병과 그 관계의 구조화된 표현을 제공한다 [12]. 증상·원인·치료를 포함해 질병 관련 생의학 정보의 조직과 조회를 돕는다.

인스턴스 뷰 KG와 온톨로지 뷰 KG의 형식화

Formalization
  • 인스턴스 뷰 KG GI = (E, RI, OI) — 엔티티 집합 E, 관계 집합 RI, 사실 집합 OI를 담으며 사실은 트리플 (h(I) ∈ E, r(I) ∈ RI, t(I) ∈ E)다.
  • 온톨로지 뷰 KG GO = (C, RO, OO) — 개념 집합 C, 관계 집합 RO, 사실 집합 OO를 담으며 사실은 트리플 (h(O) ∈ C, r(O) ∈ RO, t(O) ∈ C)다.
  • 크로스뷰 링크 S — “type_of” 같은 인스턴스와 개념 사이의 연관을 담는 알려진 크로스뷰 링크 집합이다. (e, c) ∈ Se ∈ E와 그에 대응하는 개념 c ∈ C 사이의 링크를 나타낸다. 예: (e: Los Angeles International Airport, c: airport).
  • 계층 부구조 — “subclass_of” 같은 메타 관계로 식별되며, 더 세밀한(구체적) 개념이 더 조밀한(일반적) 개념에 속함을 나타내는 개념 쌍 (cl, ch) ∈ C를 관측할 수 있다. 예: (cl: singer, ch: person).

KB의 각 뷰마다 노드와 엣지를 임베딩할 전용 저차원 공간이 배정된다. 볼드체 h(I), t(I), r(I)는 인스턴스 뷰 트리플의 임베딩 벡터를, h(O), t(O), r(O)는 온톨로지 뷰의 대응 개념과 메타 관계의 임베딩 벡터를 나타낸다.

온톨로지를 KG 추론에 결합한다

온톨로지 정보는 엔티티·관계 유형과 그 계층을 포함하는 의미 구조를 KG에 제공한다. 온톨로지 정보를 활용하면 KG 임베딩 방법은 엔티티와 관계 의미의 모호성을 해소할 수 있다.

Example — 두 명의 “Michael Jordan”

KG에 두 트리플 (Michael Jordan, PlayFor, Chicago Bulls)(Michael Jordan, Field, Machine Learning)이 있다고 가정한다. 두 트리플이 같은 머리 엔티티를 공유하지만 서로 다른 인물을 지칭한다. 첫 관계 “PlayFor”는 스키마 (Athlete, PlayFor, Team)과 결합되어 스포츠 도메인에 속함을 나타내고, 둘째 관계 “Field”는 스키마 (Scientist, Field, Domain area)와 관련되어 과학 분야와의 연결을 시사한다. 온톨로지에 근거해 첫 “Michael Jordan”은 운동선수, 둘째는 과학자임을 판정할 수 있다. 이 온톨로지 지식을 결합하면 KG 임베딩 방법은 두 인물을 임베딩 공간에서 별개로 표현하도록 학습해 해석의 모호성을 해소하고 링크 예측·엔티티 분류·KG 완성 같은 다운스트림 태스크의 성능을 높인다.

나아가 온톨로지의 결합은 추론 과정에도 이득을 준다. 2.2.1절의 “모든 사람은 죽는다. Socrates는 사람이다. 그러므로 Socrates는 죽는다”라는 예처럼, 인스턴스의 부모 클래스에 근거해 그 인스턴스의 속성과 관계를 연역할 수 있다. 이 연역적 접근은 합리적 추론을 위해 상당한 양의 증거를 요구할 수 있는 인스턴스 수준 정보에만 의존하는 것과 다르다. 따라서 온톨로지는 콜드 스타트와 롱테일 엔티티, 그리고 상식 추론이 개입하는 상황에서 특히 추론 역량을 강화하고 더 정보에 근거한 의사결정을 가능하게 한다.

온톨로지 스키마를 KG 추론에 통합하는 방법은 사용하는 링크에 따라 두 유형으로 분류된다.

§6.2  Cross-view links

크로스뷰 링크 활용

엔티티 유형 정보를 사용해 온톨로지 스키마와 인스턴스 수준 데이터 사이의 간극을 메워, 서로 다른 뷰 사이의 연결을 확립하는 것을 목표로 한다.

§6.3  Intra-view links

인트라뷰 계층 활용

계층 정보를 활용해 온톨로지 스키마의 같은 뷰 안의 정보를 착취하는 데 주로 집중한다. 사용하는 계층 정보 유형에 따라 (1) 개념 계층 기법과 (2) 관계 계층 기법의 두 하위 범주로 나뉜다.

6.2

KG 표현 학습을 위한 크로스뷰 링크 활용

추가 관계로 모델링  ·  정규화 항으로 모델링

크로스뷰 링크는 엔티티를 대응하는 클래스와 결합해 KG의 인스턴스 뷰와 온톨로지 뷰 사이의 간극을 메운다. Fig. 6.1에서 인스턴스 뷰의 엔티티 “Barack Obama”는 온톨로지 뷰의 “Politician” 클래스에 속하고, “Honolulu”는 “City” 클래스에 속한다. 이 크로스뷰 링크는 다수의 KG에서 발견되며, 온톨로지 뷰의 추상 지식과 인스턴스 뷰의 구체 지식을 매끄럽게 통합할 수 있게 한다.

  • 모호성 해소 — 엔티티를 각자의 클래스와 결합함으로써 역할과 관계가 명확해지고, 이는 다시 추론 과정을 돕는다.
  • 더 나은 일반화 — 같은 유형 엔티티 사이의 공통 패턴과 관계를 식별할 수 있게 하여, 다양한 인스턴스에 적용 가능한 더 나은 일반화로 이어지고 KG 안의 새로운 관계와 통찰 발견을 돕는다.
  • 일관성 확보 — 엔티티 분류의 불일치를 식별해 KG 내부의 일관성을 보장하는 데 도움을 준다. 전체 데이터 품질을 개선할 뿐 아니라 KG의 추론 역량과 유용성을 강화한다.

엔티티 유형 정보를 KG 임베딩에 활용하는 방법은 세 갈래로 범주화된다. (1) 크로스뷰 링크를 추가 관계로 모델링, (2) 정규화 항으로 모델링, (3) 유형 임베딩으로 모델링.

6.2.1크로스뷰 링크를 추가 관계로 모델링

엔티티 유형 정보를 결합하는 가장 직관적인 방법은 크로스뷰 링크를 추가 관계 “IsA”로 표현해 KG의 두 뷰를 하나의 통합 그래프로 병합하는 것이다. Fig. 6.1의 구체적 엔티티 “Barack Obama”와 엔티티 유형 “Politician” 사이의 크로스뷰 링크는 트리플 (“Barack Obama”, “IsA”, “Politician”)으로 정식화된다. 통합 KG의 모든 트리플을 학습에 포함하면 엔티티 유형 정보가 자연스럽게 포착된다.

예컨대 YAGO는 엔티티와 그 속성 사이의 다양한 유형의 관계를 포착하는 풍부한 온톨로지를 담는다. 이 정보를 착취하기 위해 Nickel et al. [13]은 클래스와 엔티티를 같은 잠재 공간에 표현하고 크로스뷰 링크를 특수한 유형의 관계로 모델링한다. 그다음 3.3.3.1절에서 논의한 이중선형 모델 RESCAL을 사용해 KG를 분해하여 임베딩을 학습하고 미지 트리플을 예측한다. 다시 말해 이 접근은 두 뷰의 차이를 단순히 무시하고 통합 KG를 일반 KG로 취급한다.

6.2.2크로스뷰 링크를 정규화 항으로 모델링

또 다른 방법은 엔티티 유형 정보를 지침으로 삼아 같은 유형의 엔티티가 임베딩 공간에서 가깝도록 강제하는 것이다. 예컨대 같은 의미 범주(동물)에 속하는 엔티티는 임베딩 공간에서 서로 가까이 놓이므로, 엔티티 “cat”은 “computer”보다 “dog”에 더 가까이 있어야 한다. SSE(Semantically Smooth Embedding) [14]는 두 매니폴드 학습 알고리즘 — (1) 라플라시안 고유맵과 (2) 국소 선형 임베딩 — 으로 이 매끄러움 가정을 모델링한다. 두 방법 모두 KG 임베딩 목적 함수를 제약하는 매니폴드 정규화 항으로 정식화된다.

R₁ — LAPLACIAN EIGENMAPS

라플라시안 고유맵

같은 범주 안의 다른 모든 엔티티에 대해 엔티티가 가까이 놓일 것을 요구한다. ceicej는 엔티티 ei, ej의 범주 레이블이다.

R₁ = ½ Σi=1n Σj=1n ‖ei − ej22 wij(1)   (6.1)

wij(1) = 1  if cei = cej
wij(1) = 0  otherwise   (6.2)
R₂ — LOCALLY LINEAR EMBEDDING

국소 선형 임베딩

엔티티를 그 최근접 이웃(같은 범주에 속한 엔티티)의 선형 결합으로 표현한다. N(ei)ei가 속한 범주에서 균일하게 무작위 샘플링된 K개 엔티티 집합이며, 각 행 i에 대해 Σj wij(2) = 1이 되도록 행을 정규화한다.

R₂ = Σi=1n ‖ ei − Σej ∈ N(ei) wij(2) ej22   (6.3)

wij(2) = 1  if ej ∈ N(ei)
wij(2) = 0  otherwise   (6.4)

R1R2를 전통적 KG 임베딩 손실에 정의된 마진 기반 순위 손실에 정규화 항으로 결합함으로써, SSE는 의미적으로 매끄럽고 동시에 관측 사실과 양립하는 임베딩 공간을 얻는다.

SSE의 한계

SSE는 KG 임베딩의 우월한 방법임이 입증되었으나 주목할 만한 한계가 있다. 엔티티 의미 범주의 계층적 본성을 방기하고, 각 엔티티가 단일 범주에만 속한다고 가정한다는 점이다. 이 결함은 6.3.1절에서 더 상술된다.

6.2.3 요약. 크로스뷰 링크는 KG의 온톨로지 뷰와 인스턴스 뷰 사이의 간극을 메우는 연결이다. 온톨로지 뷰의 추상 지식과 인스턴스 뷰의 구체 엔티티·관계를 통합하는 데 결정적 역할을 한다. 엔티티를 각자의 유형과 결합함으로써 KG 안 엔티티의 역할과 관계를 더 잘 이해하게 하고, 따라서 생성된 KG 임베딩의 전반적 품질과 표현력을 개선한다.

6.3

KG 표현 학습을 위한 인트라뷰 계층 활용

엔티티 유형 계층 (TKRL)  ·  관계 계층 (HRS · TransRHS)

인스턴스 뷰 KG의 구체 엔티티와 온톨로지 뷰의 대응 유형 사이의 크로스뷰 연결 외에, 온톨로지 뷰만으로도 계층 조직을 담는다. Fig. 6.1을 보면 “Singer”가 “Artist” 범주에 속하고 “Artist”가 “Person”의 한 유형이므로 세 개념이 온톨로지 뷰 안에서 계층을 형성한다. 온톨로지 뷰는 두 주요 유형의 계층을 특징으로 한다. 엔티티 계층은 KG 엔티티 사이의 계층 관계를, 관계 계층은 KG 관계 사이의 계층 관계를 포착한다.

6.3.1엔티티 유형 계층 — TKRL

엔티티 유형 계층은 KG의 서로 다른 엔티티 유형 사이의 계층 관계를 지칭한다. 각 노드가 엔티티 유형을 나타내고 노드 사이 관계가 유형 사이의 부모-자식 관계를 나타내는 트리 구조를 정의한다. 즉 계층은 엔티티의 하위 유형과 상위 유형을 정의하며, 하위 유형은 부모 상위 유형으로부터 속성과 관계를 상속하면서 자신만의 고유한 속성과 관계도 갖는다.

예컨대 “Jazz Musician”이 “Musician”의 하위 클래스이고 Musician이 관계 “performs in”으로 “Club”과 연관될 수 있다면, “Jazz Musician”도 같은 관계로 “Club”과 연관됨을 추론할 수 있다. 이 상속과 일반화는 엔티티 계층 정보를 사용하는 임베딩 방법으로 포착되어 KG의 의미를 더 잘 잡아낸다.

엔티티 계층을 KG 임베딩 학습에 결합하는 가장 주목할 만한 방법은 TKRL(Type-based Knowledge Representation Learning) [15]이다. TKRL은 유형별 엔티티 투영을 특징으로 하는 이동 거리 모델을 채택한다. 사실 (ei, rk, ej)가 주어지면 먼저 유형별 투영 행렬로 엔티티를 투영하고, 그다음 관계 rk를 두 투영된 엔티티 사이의 이동으로 모델링한다.

frk(ei, ej) = ‖ Mrkei ei + rk − Mrkej ej(6.5)

KG의 엔티티는 여러 유형을 가질 수 있으므로 엔티티 e의 투영 행렬 Me는 모든 유형 행렬의 가중 합으로 모델링된다. αd는 엔티티 e가 속한 유형 cd에 대응하는 유형 행렬 Mcd에 부여된 가중치다.

Me = α1Mc1 + α2Mc2 + ⋯ + αnMcn(6.6)

어떤 상황에서는 엔티티가 특정 속성을 강조하는 서로 다른 표현을 갖는 것이 중요하다. 다행히 KG의 관계별 유형 정보는 특정 관계에서 엔티티가 속할 수 있는 유형을 제공해 다중 엔티티 표현의 생성을 돕는다. Crkei는 관계별 유형 정보가 제공하는, 관계 rk에서 머리 엔티티의 유형 집합이다. 꼬리 엔티티의 투영 행렬도 같은 형태를 가진다.

Mrkei = ( Σd=1n αdMcd ) / ( Σd=1n αd ),    αd = 1 if cd ∈ Crkei,   αd = 0 if cd ∉ Crkei(6.7)

유형 c의 투영 행렬 Mc는 다음 두 인코더로 구성될 수 있다. 두 경우 모두 m은 계층 구조에서 유형 c의 층 수, Mc(d)d번째 하위 유형의 투영 행렬이며 c(d+1)c(d)의 부모 하위 유형이다.

RHE

재귀 계층 인코더

계층 구조의 모든 하위 유형에 대한 투영 행렬의 으로 Mc를 정의한다.

Mc = ∏d=1m Mc(d) = Mc(1)Mc(2) ⋯ Mc(m)   (6.8)
WHE

가중 계층 인코더

모든 하위 유형의 투영 행렬을 각기 다른 가중치로 합산해 계층 유형 행렬을 계산한다.

Mc = Σd=1m βdMc(d) = β1Mc(1) + β2Mc(2) + ⋯ + βmMc(m)   (6.9)

TKRL은 링크 예측과 트리플 분류 같은 다운스트림 태스크에서 훌륭한 성능을 보였으나, 각 클래스를 특정 투영 행렬과 결합하기 때문에 공간 복잡도가 상대적으로 높다.

6.3.2관계 계층 — HRS와 TransRHS

관계 계층은 KG의 관계 또는 속성의 계층 구조를 표현하며, 상위 수준 관계가 더 구체적인 관계를 포섭한다. 예컨대 영화 KG의 관계 계층은 “cast”와 “crew”를 최상위 관계로 가질 수 있다. “Cast”는 “actor”, “actress”, “voice actor” 같은 하위 관계를, “crew”는 “director”, “producer”, “writer” 같은 하위 관계를 가질 수 있다. 관계 계층을 활용하면 KG 임베딩 방법은 엔티티와 그 속성 사이의 미관측 관계를 더 잘 추론할 수 있고, 관계의 일반화와 상속을 도와 서로 다른 추상 수준에서 엔티티와 관계를 추론하기 쉽게 만든다.

그러나 관계 계층은 특히 크고 이종적인 KG에서 복잡하고 관리하기 어려울 수 있으며, 주어진 KG에 대해 관계 계층을 명시적으로 정의하기 어려울 수 있다.

HRS [16]

3층 계층 관계 구조

명시적 관계 계층이 없을 때 Zhang et al. [16]은 (1) 관계 클러스터, (2) 관계, (3) 하위 관계로 구성된 3층 HRS를 제안한다. 관계 클러스터는 의미적으로 유사한 관계의 묶음이다. 예컨대 “producerOf”와 “directorOf”는 둘 다 사람과 영화 사이의 관계를 기술하므로 의미적으로 연관될 수 있다.

일부 관계는 여러 의미를 가질 수 있으므로 하위 관계로 특정 관계의 서로 다른 의미를 구별한다. 예컨대 “partOf”는 최소 두 의미를 가진다 — 위치 관련 (New York, partOf, USA)와 구성 관련 (monitor, partOf, television).

rk = rkc + rk0 + rks   (6.10)
frk(ei, ej) = ‖ ei + rkc + rk0 + rks − ej ‖   (6.11)

TransE에서 얻은 관계 임베딩에 k-means를 적용해 관계 클러스터 rkc를 만든다. TransE는 트리플이 유효할 때 ei − ej ≈ rk를 가정하므로, 하위 관계 학습을 위해 각 트리플의 k = ei − ej 값을 모두 모아 k-means로 여러 군집으로 나눈다. 각 군집이 세밀한 하위 관계에 대응한다.

TransRHS

subRelationOf 기반 일반 RHS

HRS의 3층 구조는 KG 관계의 복잡성을 고려하면 보편적으로 적용 가능하지 않을 수 있다. TransRHS는 관계 사이의 일반화 관계 subRelationOf로 구성되는 더 일반적인 RHS를 도입한다. 예컨대 subRelationOf 트리플 (actor, subRelationOf, cast)는 관계 “actor”가 “cast”의 하위 관계임을 나타낸다. 이 도입으로 KG의 트리플 집합은 두 서로소 부분집합으로 나뉜다.

Or = {(rk, sro, rp) | rk, rp ∈ R}
Oe = {(ei, rk, ej) | ei, ej ∈ E, rk ∈ R}

(rk, sro, rp) ∈ Or이 성립하고 (ei, rk, ej) ∈ Oe가 양성 트리플이면 (ei, rp, ej)도 반드시 양성이다. TransE의 원리를 따라 임베딩은 ei + rk ≈ ej이면 ei + rp ≈ ej를 만족해야 한다. TransRHS에서 각 엔티티는 저차원 벡터로, 각 관계는 저차원 벡터와 관계별 구(sphere)로 인코딩된다.

rp, rk의 임베딩과 그에 대응하는 구를 반지름 m1s1, 반지름 m2s2라 하면 TransRHS는 경우별로 손실 함수를 정의한다. 여기서 d1 = ‖ei + rp − ej, d2 = ‖ei + rk − ej이고 α들은 각 경우의 가중치다.

LRHS = α1[ ‖ei + rp − ej2 − m1 ]+                if d1 > m1
           = α2[ ‖ei + rk − ej2 − m2 ]+               if d2 > m2
           = α3[ m1 − ‖ei + rk − ej2 ]+               if d2 < m1
           = α4[ m1 − m2 ]+                                 if m1 > m2
(6.12)

6.3.3 요약. KG의 온톨로지 뷰에 존재하는 계층 구조도 엔티티와 관계 사이의 관계를 포착하는 데 유의미한 역할을 한다. 이 구조를 활용해 임베딩의 품질을 개선하고 링크 예측·엔티티 분류 같은 다운스트림 태스크의 정확도를 높일 수 있다. 계층 정보를 KG 임베딩 방법에 결합하면 유사한 레이블을 가진 엔티티나 관계 사이의 모호성이 해소되어 KG 임베딩의 해석 가능성이 개선된다.

6.4

JOIE — 온톨로지 뷰와 인스턴스 뷰의 공동 결합

크로스뷰 연관 모델  ·  인트라뷰 모델  ·  계층 인식

KG의 크로스뷰 연결과 인트라뷰 구조 모두가 KG 추론에 유의미하다. 두 유형의 정보를 공동 활용하기 위해 JOIE [1]는 두 모델 구성 요소로 엔티티와 개념을 공동 임베딩한다. 크로스뷰 연관 모델은 대응 개념으로부터 엔티티의 인스턴스화를 포착해 두 뷰 사이의 연결과 정보 흐름을 가능하게 하고, 인트라뷰 모델은 KG의 각 뷰에서 엔티티/개념과 관계/메타 관계를 인코딩한다.

6.4.1JOIE의 프레임워크

6.4.1.1 크로스뷰 연관 모델

목표는 KB의 크로스뷰 링크에 근거해 엔티티 임베딩 공간과 개념 임베딩 공간 사이의 연관을 포착하는 것이며, 이것이 JOIE의 핵심 기여다. 서로 다른 가정에 근거해 다른 목적 함수를 최적화하는 두 기법을 제안한다.

Fig. 6.4 / 6.5 — 크로스뷰 연관 모델의 직관
FIG. 6.4 — CROSS-VIEW GROUPING (CG) 단일 공간   d = dc = de c₁ γ^CG c₂ 벌점 대상 FIG. 6.5 — CROSS-VIEW TRANSFORMATION (CT) 엔티티 공간   d₁ 개념 공간   d₂ < d₁ c₁ c₂ f^CT σ(W_ct·e + b_ct)
Fig. 6.4 / 6.5 CG는 온톨로지 뷰 KG와 인스턴스 뷰 KG가 같은 공간에 임베딩될 수 있다고 가정하고, 임의의 인스턴스가 대응 개념에 가까워지도록 강제한다. 따라서 두 뷰의 임베딩 차원이 같아야 한다. CT는 두 임베딩 공간이 서로 완전히 달라도 되게 하며, 변환을 통해 정렬한다. 원문 도판의 정확한 좌표는 래스터로 삽입되어 추출할 수 없다. 두 기법의 가정 차이(같은 공간 / 다른 차원의 두 공간 + 변환)를 드러내는 도식으로 재구성했다.
Cross-view Grouping (CG)

그룹화 기반 정규화

두 뷰가 같은 공간에 임베딩될 수 있다고 가정하고, 임의의 인스턴스 e ∈ E가 대응 개념 c ∈ C에 가까워지도록 강제한다. 인스턴스 뷰와 온톨로지 뷰의 임베딩 차원이 같아야 한다(d = dc = de). 손실은 ec의 임베딩 거리를 마진 γCG와 비교해 정의된다.

JCrossCG = (1/|S|) Σ(e,c)∈S [ ‖c − e‖2 − γCG ]+   (6.13)

e의 임베딩이 c의 임베딩을 중심으로 하는 γCG 반지름 이웃 밖으로 벗어나는 경우에 벌점을 부과한다. CG는 강한 군집화 효과를 가져 결국 엔티티 임베딩을 개념 임베딩에 가깝게 만든다.

Cross-view Transformation (CT)

공간 사이의 비선형 변환

엔티티 임베딩 공간과 개념 공간 사이에서 정보를 변환하려 한다. 변환 후 인스턴스는 온톨로지 뷰 공간의 임베딩으로 사상되며, 이는 대응 개념의 임베딩에 가까워야 한다. fCT(e) = σ(Wct·e + bct)는 비선형 아핀 변환이고 σ(·)로 tanh를 사용한다. 통상 개념이 엔티티보다 훨씬 적으므로 d2d1보다 작게 설정할 수 있다.

c ← fCT(e),  ∀(e, c) ∈ S   (6.14)

JCrossCT = (1/|S|) Σ [ γCT + ‖c − fCT(e)‖2 − ‖c′ − fCT(e)‖2 ]+   (6.15)

힌지 손실의 마진 하이퍼파라미터 γ는 모델 설정에 따라 통상 0.5 또는 1로 선택할 수 있으며, 민감한 하이퍼파라미터는 아니다.

6.4.1.2 인트라뷰 모델

인트라뷰 모델의 목표는 KB 각 뷰의 원래 구조 정보를 두 임베딩 공간에 별도로 보존하는 것이다. 인스턴스 뷰의 관계와 온톨로지 뷰의 메타 관계는 의미가 다르므로, 둘을 단일 표현 스키마로 합치는 대신 각 뷰에 별도 처리를 주는 것이 다운스트림 태스크 성능에 도움이 된다.

기본 인트라뷰 모델. 트리플 (h, r, t)의 그럴듯함은 점수 함수 f(h, r, t)로 측정된다. 임의의 트리플 임베딩 기법이 적용 가능하며, 이 논문은 대표적인 세 기법 TransE [17], DistMult [18], HolE [19]를 채택한다.

fTransE(h, r, t) = − ‖h + r − t‖2
fDistMult(h, r, t) = (h ∘ t) · r
fHolE(h, r, t) = (h ⋆ t) · r         [a ⋆ b]k = Σi=0d ai b(k+i) mod d
(6.16)

는 아다마르 곱, ·는 내적, 는 순환 상관이다. 한 그래프의 모든 노드 임베딩을 학습하기 위해 그래프의 모든 트리플에 대해 힌지 손실을 최소화하며, (h′, r, t′)는 머리 또는 꼬리 엔티티를 대체해 G에 존재하지 않는 손상 트리플 집합에서 뽑은 샘플이다.

JIntraG = (1/|G|) Σ(h,r,t)∈G ∧ (h′,r,t′)∉G [ γG + f(h′, r, t′) − f(h, r, t) ]+ (6.17)
JIntra = JIntraGI + α1 · JIntraGO (6.18)

온톨로지를 위한 계층 인식(HA) 인트라뷰 모델. 일부 KG의 온톨로지 뷰는 “subclass_of”, “is_a”처럼 계층 성질을 가진 메타 관계로 구성되는 계층을 형성한다 [7, 20]. 그런 메타 관계 사실을 (cl, rmeta = “subclass_of”, ch)로 정의할 수 있다. 예컨대 “musician”과 “singer”는 “artist”에 속하고 “artist”도 “person”의 하위 클래스다. 이런 의미적 온톨로지 특징은 다른 메타 관계보다 추가 모델링을 요구한다. 즉 온톨로지 계층을 형성하는 메타 관계와 “related_to” 같은 일반 의미 관계를 인트라뷰 모델에서 구별한다.

gHA(ch) = σ( WHA · cl + bHA )         WHA ∈ Rd2×d2, bHA ∈ Rd2, σ = tanh (6.19)
JIntraHA = (1/|T|) Σ(cl,ch)∈T ∧ (cl,ch′)∉T [ γHA + ‖ch − g(cl)‖2 − ‖ch′ − g(cl)‖2 ]+ (6.20)
JIntra = JIntraGI + α1 · JIntraGO \ T + α2 · JIntraHA (6.21)

식 (6.21)의 JIntraGO\T일반 의미 관계 트리플만으로 학습되는 기본 인트라뷰 모델의 손실을, JIntraHA는 온톨로지 계층을 형성하는 메타 관계 트리플로 명시적으로 학습되는 손실을 지칭한다. 이것이 식 (6.18)과의 주된 차이다.

6.4.1.3 두 뷰 KG의 공동 학습

J = JIntra + ω · JCross         (ω > 0) (6.22)

J를 직접 갱신하는 대신 구현은 JIntraGI, JIntraGO, JCross교대로 최적화한다. 구체적으로 한 에폭 안의 연속 단계에서 θnew ← θold − η∇JIntraθnew ← θold − (ωη)∇JCross를 최적화한다. η는 학습률이고 ω가 인트라뷰와 크로스뷰 손실의 학습률을 차별화한다.

  • 최적화기는 AMSGrad [21]를 사용한다.
  • 벡터는 단위 구면상의 균등 분포에서 뽑아 초기화하고, 행렬은 무작위 직교 초기화 [22]로 초기화한다.
  • 학습 중 모든 엔티티·개념 벡터의 L2 노름이 1이 되도록 제약해 0으로 수축하는 것을 막는다.
  • 인트라뷰 모델과 크로스뷰 연관 모델 모두에 음성 샘플링 비율 1(양성 하나당 음성 하나)을 사용하고, 모든 변형에 힌지 손실을 적용한다.

6.4.1.4 JOIE의 변형과 복잡도 분석

HA 기법을 고려하지 않으면 크로스뷰 연관 모델 2개와 인트라뷰 모델 3개의 조합으로 6가지 변형이 있다. 변형은 구성 요소 이름으로 표기하며(예: “JOIE-TransE-CT”), 여기에 계층 인식 인트라뷰 모델을 크로스뷰 변환 모델에 결합해 3가지 변형이 추가된다(JOIE-HATransE-CT, JOIE-HAMult-CT, JOIE-HAHolE-CT). 실험에서 CT 기반 변형이 CG 기반을 일관되게 능가하므로 HA 인트라뷰 설정은 CT 기반 변형에만 적용된다.

JOIE 변형 조립기
크로스뷰 연관 모델과 인트라뷰 점수 함수, 계층 인식 여부를 고르면 변형 이름·손실 구성·복잡도·측정 성능이 함께 갱신된다. 성능 수치는 Table 6.2와 Table 6.3의 값이다.
JOIE-TransE-CT 최적 설정 d_e = 300, d_c = 50 · γ = 0.5 · α₁ = 2.5
파라미터 복잡도
트리플 완성 시간 복잡도
엔티티 타이핑 시간 복잡도
측정 태스크MRRHit@1 / Acc.Hit@10 / Hit@3
HA는 CT 기반 변형에만 적용된다(원문 각주 2). CG를 선택하면 HA 옵션이 비활성화된다.

6.4.2기존 접근과의 연결

엔티티의 복잡한 유형 정보를 KG 임베딩에 결합하려는 몇몇 접근이 제안되었으나 [15, 24–26], JOIE의 설정은 두 관점에서 실질적으로 다르다.

  • 기존 연구는 엔티티 유형의 근접성으로 인스턴스 수준 엔티티 유사성 학습을 강화하지만, 그런 유형 사이의 의미 관계는 포착하지 않는다.
  • 대부분 인스턴스 뷰 트리플 완성 개선에 집중하며, 인스턴스 뷰 지식을 온톨로지 확충에 활용하지도, 인스턴스와 온톨로지 개념을 잇는 크로스뷰 연관을 지원하지도 않는다.

JOIE는 두 구성 요소로 이 한계를 해결한다. 첫째, 크로스뷰 연관 모델이 인스턴스 임베딩을 대응 개념 임베딩과 연관시킨다. 둘째, 인트라뷰 임베딩 모델이 온톨로지 뷰와 인스턴스 뷰의 관계 사실을 두 개의 별도 임베딩 공간에서 특징화한다. 논리 규칙 [27, 28]으로 온톨로지를 KG 추론에 결합하는 또 다른 계열도 있으나, 이들은 통상 두 뷰 KG에 제공되지 않는 추가 정보를 요구한다.

6.4.3실험

6.4.3.1 데이터셋

기존 KG 임베딩 데이터셋은 인스턴스 뷰(FB15k)나 온톨로지 뷰(WN18) 한쪽만 고려한다. 따라서 YAGO [20]와 DBpedia [7]의 연결된 부분집합에서 추출한 두 새 데이터셋 YAGO26K-906DB111K-174를 준비한다. 구성 절차는 다음 세 단계다.

STEP 1

속성 트리플 제거와 샘플링

엔티티나 개념의 관계를 표현하지 않는 모든 속성 트리플을 걸러낸다. 원래 YAGO와 DBpedia 모두 인스턴스 뷰 트리플이 방대하므로 나머지에서 관계 트리플을 무작위 샘플링한다.

STEP 2

크로스뷰 정렬 추출

인스턴스 뷰의 엔티티 집합을 얻은 뒤 두 KG의 온톨로지 뷰로의 크로스뷰 정렬을 추출한다. 그 결과 일부 엔티티가 연관 개념에 연결되며, 이 개념들이 자연히 온톨로지 뷰의 노드가 된다.

STEP 3

온톨로지 뷰 구성

단계 2에서 얻은 모든 연관 개념이 주어지면 원래 온톨로지의 교차 부분그래프를 근거로 대응하는 온톨로지 뷰를 구성한다.

원래 YAGO는 세 유형의 의미 관계만 가진 분류학적 온톨로지를 가져 개념 사이 의미 관계에 제약이 있다. 따라서 개념 사이 메타 관계를 대량으로 담은 ConceptNet [4]의 지식으로 YAGO의 온톨로지 뷰를 풍부하게 만든다. ConceptNet과 YAGO의 개념은 공유된 WordNet 기반 ID 또는 개념 이름으로 손쉽게 정렬된다.

Table 6.1 — 데이터셋 통계
데이터셋인스턴스 그래프 GI온톨로지 그래프 GO유형 링크 S
#엔티티#관계#트리플#개념#메타 관계#트리플
YAGO26K-90626,07834390,738906308,9629,962
DB111K-174111,762305863,6431742076399,748
통상 인스턴스 뷰 KG가 온톨로지 뷰 그래프보다 유의미하게 크다. 두 KG는 유형 링크의 밀도에서도 다르며, DB111K-174의 엔티티-대-개념 비율(643.4)이 YAGO26K-906(28.7)보다 훨씬 높다. 계층 성질을 가진 메타 관계의 온톨로지 뷰 트리플은 DB111K-174가 164개, YAGO26K-906이 1,411개다. 두 데이터셋 모두 엔티티·관계 빈도가 롱테일 분포(Zipf 법칙)를 따르며(Fig. 6.6·6.7), 전체 엔티티의 75% 이상이 출현 횟수 15회 미만이다. 데이터셋: https://github.com/JunhengH/joie-kdd19
6.4.3.2 KG 트리플 완성

트리플 완성은 KG 구조의 누락 관계 사실을 구성하는 것이며 학습된 임베딩의 품질을 직접 시험한다. 이 태스크는 인스턴스 뷰 KG 완성온톨로지 확충의 두 하위 태스크로 나뉜다. 인스턴스 뷰와 온톨로지 뷰 트리플을 각각 학습·검증·테스트로 85% / 5% / 10% 분할하고, 각 변형을 GItrain, GOtrain 트리플과 모든 크로스뷰 링크 S로 학습한다. 테스트에서 각 질의 (h, r, ?t)에 대해 테스트 후보 집합의 모든 로 형성된 트리플의 점수를 인트라뷰 모델로 계산·순위 매기고, MRR·Hit@1·Hit@10을 보고하며 필터링 지표를 채택한다.

하이퍼파라미터. 차원 d는 {50, 100, 200, 300}, 학습률은 {0.0005, 0.001, 0.01}, 마진 γ는 {0.5, 1}에서 선택한다. 최적 설정은 CT에서 de = 300, dc = 50, CG에서 de = dc = 200이며 α1 = 2.5, α2 = 1.0이다. 모든 TransE 변형에 γ = 0.5, 모든 DistMult·HolE 변형에 γ = 1을 기본값으로 설정하고 학습은 120 에폭으로 제한한다.

기준 방법. (i) 단일 그래프 모델(TransE·DistMult·HolE)을 인스턴스 뷰 또는 온톨로지 뷰 트리플로 각각 학습한 것 — (base). (ii) 두 뷰의 모든 트리플로 학습하고 크로스뷰 링크에 추가 관계 “type_of”를 붙인 것 — (all). (iii) 개념과 인스턴스의 인코딩 과정을 구별하는 최근 연구 TransC [31]. TransC는 온톨로지 뷰에 의미 메타 관계가 포함되지 않는, JOIE-TransE-CG의 단순화된 경우와 동등하므로 온톨로지 뷰 완성에는 적용되지 않는다.

Table 6.2 — KG 트리플 완성 결과
모델YAGO26K-906DB111K-174
GI KG 완성GO KG 완성GI KG 완성GO KG 완성
MRRH@1H@10MRRH@1H@10MRRH@1H@10MRRH@1H@10
TransE 계열 인트라뷰
TransE (base)0.19514.0934.510.14512.2920.590.32722.2649.010.31323.2246.91
TransE (all)0.18713.7335.050.18914.7224.360.31822.7048.120.53947.9061.84
TransC0.25215.7137.790.35924.8349.31
JOIE-TransE-CG0.26416.3835.450.18911.1629.440.39427.7551.200.59853.8471.79
JOIE-TransE-CT0.29218.7244.140.24014.4933.470.44332.1067.890.62258.1072.97
JOIE-HATransE-CT0.30618.6251.720.26316.7238.460.47333.7971.370.59152.0779.65
DistMult 계열 인트라뷰
DistMult (base)0.25322.9128.760.19717.7225.080.26525.9527.630.23515.1829.11
DistMult (all)0.28824.0631.240.15614.3216.540.28027.2429.700.50145.5264.73
JOIE-Mult-CG0.27418.8037.450.19811.1627.910.32023.4449.490.53246.1568.91
JOIE-Mult-CT0.30920.4046.150.20714.7130.430.40426.5560.860.56350.5071.62
JOIE-HAMult-CT0.29619.3945.480.20213.7231.100.36924.8255.860.52138.4677.25
HolE 계열 인트라뷰
HolE (base)0.26525.9028.310.19218.7020.290.30129.2431.510.22718.9132.83
HolE (all)0.25224.2226.560.13811.2914.430.29528.7030.320.43238.8056.05
JOIE-HolE-CG0.25318.7534.110.16713.0422.330.36124.1346.150.46941.8962.16
JOIE-HolE-CT0.31320.4047.800.22920.8528.420.42529.0966.880.51443.2469.23
JOIE-HAHolE-CT0.32722.4252.410.23616.7230.960.46433.1169.560.50340.8071.03
H@1과 H@10은 각각 Hit@1과 Hit@10이다. 같은 인트라뷰 모델을 쓰는 변형 묶음마다 최고 결과를 굵게, 각 데이터셋의 전체 최고 결과를 밑줄로 표시했다.

같은 묶음의 모든 기준 방법 중 JOIE는 MRR에서 평균 6.8%, Hit@10에서 평균 14.8% 눈에 띄게 능가한다. DB111K-174의 온톨로지 뷰에서 특히 유의미한 개선이 달성되며, 온톨로지 뷰 트리플만으로 학습한 개념 임베딩과 비교해 “all” 설정 기준선 대비 평균 10.4% 증가, “base” 설정 기준선 대비 34.97% 증가다. 이는 JOIE가 인스턴스 뷰의 정보를 활용해 온톨로지 뷰의 트리플 완성을 촉진하는 더 나은 능력을 지님을 나타낸다.

인트라뷰 모델을 비교하면 DB111K-174에서 온톨로지 확충과 인스턴스 뷰 KG 완성 모두에 이동 기반 모델이 유사도 기반 모델보다 낫다. 이 그래프들이 희소하고 TransE가 유사도 기반 기법에 비해 희소성에 덜 저해되기 때문이다 [32]. CT와 함께 HA 기법을 인트라뷰 모델에 적용하면 기본 인트라뷰 CT 기반 모델에 비해 대부분의 경우 인스턴스 뷰 트리플 완성 성능이 눈에 띄게 개선되며, 특히 이동 기반과 순환 상관 기반 인트라뷰 모델 변형에서 그렇다.

6.4.3.3 엔티티 타이핑

엔티티 타이핑 태스크는 주어진 엔티티의 연관 개념을 예측한다. 각 데이터셋의 크로스뷰 링크를 60 : 40 비율로 학습·테스트로 분리하고, 각 모델을 전체 인스턴스 뷰·온톨로지 뷰 그래프와 Strain으로 학습한다. 하이퍼파라미터는 통제 변수 아래 평가하기 위해 트리플 완성 태스크에서 그대로 이어온다. 테스트에서 특정 엔티티 eq가 주어지면 개념 임베딩 공간에서 eq의 투영으로부터의 임베딩 거리를 근거로 개념을 순위 매기고 MRR·Hit@1(정확도)·Hit@3을 계산한다. MTransE 외의 기준선에서는 크로스뷰 링크 (e, c)를 트리플 (e, rT = “type_of”, c)로 변환하므로 엔티티 타이핑이 트리플 완성과 동등해진다. MTransE는 개념과 엔티티를 서로 다른 뷰로 취급해 거리 기반 순위로 테스트한다.

Table 6.3 — 엔티티 타이핑 결과
모델YAGO26K-906DB111K-174
MRRAcc.Hit@3MRRAcc.Hit@3
TransE0.1447.3235.260.50343.6760.78
MTransE0.68960.8777.640.67259.8781.32
JOIE-TransE-CG0.82972.6393.350.82870.5895.11
JOIE-TransE-CT0.84375.3193.180.84674.4194.53
JOIE-HATransE-CT0.89785.6095.910.85775.5595.91
DistMult0.41136.0755.320.55149.8368.01
JOIE-Mult-CG0.76262.6287.820.76460.8391.80
JOIE-Mult-CT0.80570.8389.250.79165.3093.47
JOIE-HAMult-CT0.86581.6391.830.77869.3885.71
HolE0.39534.8354.790.50444.7565.38
JOIE-HolE-CG0.77765.3087.890.78466.7589.37
JOIE-HolE-CT0.81372.2788.710.80568.8491.22
JOIE-HAHolE-CT0.88883.6793.870.80872.5189.79
모든 JOIE 변형이 기준선을 유의미하게 능가한다. 원문은 최고 JOIE 모델 JOIE-TransE-CT가 최고 기준선 MTransE 대비 YAGO26K-906에서 정확도 15.4%, MRR 14.4% 개선을, DB111K-174에서 정확도·MRR 각각 14.3%·14.5% 개선을 보고한다. 표의 값에서 계산하면 YAGO26K-906의 MRR 차이가 0.154(15.4%p), 정확도 차이가 14.44%p이므로 원문 문장의 두 수치는 서로 뒤바뀐 것으로 보인다.
  • 다른 기준선의 결과는 모든 엔티티와 개념에 적용되는 크로스뷰 링크가 일반 관계로는 적절히 포착되지 않으며 전용 표현 기법을 요구함을 확인한다.
  • JOIE-TransE-CT가 두 데이터셋 모두에서 일관되게 최고다. JOIE-HolE-CT와 JOIE-DistMult-CT 대비 MRR 평균 4.1%, 나머지 최고 변형(JOIE-TransE-CG) 대비 정확도 평균 2.17% 향상이다. 유사도 기반 인트라뷰 모델과 비교해 이동 기반이 유향 관계·메타 관계를 가진 KG에서 서로 다른 엔티티와 개념을 더 잘 구별한다고 본다 [32].
  • CT 기반이 CG 기반보다 대체로 낫다. 이유는 두 가지다. (i) CT는 두 임베딩 공간이 서로 다른 차원을 갖게 허용하므로, 인스턴스 뷰보다 작고 희소한 온톨로지 뷰를 더 잘 특징화한다. (ii) 두 뷰의 위상 구조가 다소 비일관될 수 있는데, CT는 그런 비일관성에 CG보다 덜 민감하고 잘 적응한다.
  • HA + CT 설정은 엔티티 타이핑을 극적으로 강화해 최고 성능을 달성한다. 온톨로지가 상대적으로 풍부한 YAGO26K-906에서 기본 인트라뷰 설정 대비 MRR 평균 6.0%, 정확도 10.5% 개선이다. DB111K-174에서 유사한 효과가 없는 이유는 이 데이터셋의 온톨로지가 작고 계층 구조가 훨씬 작기 때문이다.
6.4.3.4 사례 연구 — 온톨로지 확충

온톨로지 뷰의 메타 관계와 개념을 임베딩하면 트리플 완성 과정이 이미 알려진 메타 관계로 온톨로지 뷰를 확충할 수 있다. (“Concert”, “Related to”, ?t) 같은 질의에 답해 (“Concert”, “Related to”, “Ballet”), (“Concert”, “Related to”, “Musical”) 같은 트리플을 높은 신뢰도로 재구성할 수 있다. 그러나 이 과정은 메타 관계 어휘에 사전 존재하지 않는 메타 관계를 만족할 수 있는 제로샷 경우를 해결하지 못한다. 질의 (“Office Holder”, ?r, “Country”)에 답해 잠재적 신규 메타 관계 “is Politician of”를 직접 예측할 수는 없다.

JOIE는 두 뷰를 잇는 크로스뷰 연관 모델을 활용해 인스턴스 뷰 관계를 온톨로지 뷰 메타 관계로 이주시키는 실현 가능한 해법을 제공한다. 질의의 개념 임베딩을 엔티티 임베딩 공간으로 변환하고 인스턴스 뷰에서 후보 관계를 선택하는 방식이다. 이동 기반 인트라뷰 모델을 쓰는 변형에서는 fCTinv(ccountry) − fCTinv(coffice)에 가장 가까운 인스턴스 뷰 관계를 찾는다. Fig. 6.8은 이 질의에 대한 상위 10개 관계 예측의 PCA 투영을 보여주며, 상위 3개 관계는 “is Politician of”, “is Leader of”, “is Citizen of”로 모두 합당한 답이다.

Table 6.4 — JOIE-TransE-CT의 온톨로지 확충 예 (L2 거리 최소 상위 5개)
질의확충된 상위 5개 트리플 (거리)
(scientist, ?r, university)scientist, graduated from, university (0.499)
scientist, isLeaderOf, university (1.082)
scientist, isKnownFor, university (1.098)
scientist, created, university (1.119)
scientist, livesIn, university (1.141)
(boxer, ?r, club)boxer, playsFor, club (1.467)
boxer, isAffiliatedTo, club (1.474)
boxer, worksAt, club (1.479)
boxer, graduatedFrom, club (1.497)
boxer, isConnectedTo, club (1.552)
(TV station, ?r, country)TV station, headquarter, country (1.221)
TV station, parentOrganisation, country (1.246)
TV station, appointer, country (1.253)
TV station, broadcastArea, country (1.266)
TV station, principalArea, country (1.271)
(scientist, ?r, scientist)scientist, deputy, scientist (0.204)
scientist, doctoralAdvisor, scientist (0.218)
scientist, doctoralStudent, scientist (0.221)
scientist, relative, scientist (0.228)
scientist, spouse, scientist (0.230)
합당한 답을 굵게 표시했다. 상위 예측 대부분이 인스턴스 뷰에서 이주된 의미 있는 온톨로지 트리플임을 관찰할 수 있다.
롱테일 엔티티 타이핑

KG에서 엔티티와 관계의 빈도는 흔히 롱테일 분포(Zipf 법칙)를 따른다. 전체 엔티티의 75% 이상이 출현 횟수 15회 미만이며, 이런 롱테일 엔티티·유형·관계는 학습 사례가 퓨샷이므로 표현 학습 알고리즘이 포착하기 어렵다. 이 사례 연구에서는 두 KG 데이터셋 인스턴스 뷰의 전체 엔티티 중 약 15–30%에 해당하는, 빈도가 상당히 낮은 엔티티를 선택해 타이핑 태스크를 평가한다(YAGO26K-906에서 8회 미만, DB111K-174에서 3회 미만).

Table 6.5 — 롱테일 엔티티 타이핑 결과
모델YAGO26K-906DB111K-174
MRRAcc.Hit@3MRRAcc.Hit@3
DistMult0.15610.8925.330.21916.4833.71
MTransE0.52646.4567.250.50546.6764.36
JOIE-TransE-CG0.70859.9779.800.74164.4583.05
JOIE-TransE-CT0.73762.0582.600.75866.3583.80
JOIE-HATransE-CT0.80269.6687.750.76067.3489.79
6.4.3.3절 결과와 비교하면 모든 모델의 성능이 하락하지만, JOIE 변형은 CG 모델에서 MRR 평균 12.5%, CT 모델에서 12.3% 하락에 그치는 반면 다른 기준선은 20% 이상 하락한다. 롱테일 엔티티에서는 CG(d₁ = d₂ = 100)와 CT(d₁ = 100, d₂ = 50) 모두 더 작은 임베딩이 연관 개념 예측에 유익하다. 학습 데이터가 충분하지 않은 상태에서 고차원으로 학습하면 롱테일 엔티티에 과적합되기 때문으로 가설한다.
Table 6.6 — 롱테일 엔티티 타이핑 예 (DB111K-174, 상위 3개 예측)
엔티티모델상위 3개 개념 예측
Laurence FishburneDistMultFootball team, Club, Team
MTransEWriter, Person, Artist
JOIEPerson, Artist, Philosopher
Warangal CityDistMultCountry, Village, City
MTransEAdministrative region, City, Settlement
JOIECity, Town, Country
Royal Victorian OrderDistMultPerson, Writer, Administrative region
MTransEElection, Award, Order
JOIEAward, Order, Election
정답 유형을 굵게 표시했다. JOIE(JOIE-HATransE-CT 변형)는 저빈도 엔티티에서도 올바른 예측을 하지만 다른 기준 모델은 부정확한 예측만 출력한다.
6.5

요약과 논의

쌍곡 공간 온톨로지 임베딩 (DGS)  ·  생물학 응용 (Bio-JOIE)

KG의 표현은 두 주요 뷰를 개입시킨다. 온톨로지 뷰는 엔티티 유형과 관계 계층 같은 추상 개념을 기술하고, 인스턴스 뷰는 구체적 엔티티와 그 관계를 담는다. 두 뷰를 통합하는 것은 광범위한 다운스트림 태스크에 이득이 되는 더 포괄적이고 의미론적으로 유의미한 임베딩 생성에 결정적이다. 이 장은 사용하는 링크에 근거해 (1) 크로스뷰 링크를 쓰는 접근과 (2) 인트라뷰 링크를 쓰는 접근으로 크게 분류해 탐구했다.

크로스뷰 링크는 사람·장소·조직 같은 대응 클래스와 엔티티를 결합해 인스턴스 뷰와 온톨로지 뷰 사이의 사활적 연결로 작동한다. 이 링크는 모델이 같은 유형 엔티티 사이의 공통 패턴과 관계를 식별하게 하여, 다양한 인스턴스에 적용해 KG 안의 새로운 관계와 통찰을 밝힐 수 있는 더 나은 일반화로 이어진다.

크로스뷰 링크 외에 온톨로지 뷰만으로도 두드러진 계층 구조를 보인다. 엔티티 유형 계층 주입은 하위 유형과 상위 유형을 포함한 유형 계층 정의를 요구하며, 속성과 관계의 상속·일반화를 허용해 더 정교한 추론 연산을 촉진한다. 관계 계층 주입은 하위 관계와 상위 관계 같은 엔티티 사이 관계 계층을 확립하며, 엔티티 사이의 암묵적 관계 연역을 가능하게 해 진전된 추론 연산을 촉진한다.

크로스뷰 연결과 인트라뷰 구조 모두의 중요성을 고려해, 최신 방법 JOIE는 두 유형의 정보를 모두 사용해 KG 임베딩을 개선한다. 크로스뷰 연관 모델은 온톨로지 개념과 대응 인스턴스 뷰 엔티티의 임베딩을 연결하도록 학습하고, 인트라뷰 모델은 인스턴스 뷰와 온톨로지 뷰의 구조화된 지식을 별도 임베딩 공간에서 포착하도록 공동 학습된다. JOIE는 계층을 가진 온톨로지를 위해 계층 인식 인코딩 기법도 채택한다. 크로스뷰 연결과 인트라뷰 구조의 결합이 인스턴스 뷰 트리플 예측과 온톨로지 뷰 KG의 온톨로지 확충에서 이전 모델을 능가하게 한다.

쌍곡 공간에서의 온톨로지 임베딩

쌍곡 공간은 곡률이 일정한 음수인 비유클리드 공간으로, 유클리드 공간에 비해 온톨로지 뷰의 계층 구조를 더 효율적으로 표현할 수 있게 한다. 쌍곡 공간에서는 원점에서 멀리 떨어진 점을 적은 차원 수로 표현할 수 있다. 이는 계층의 서로 다른 수준의 노드가 뿌리 노드로부터 다양한 거리에 있는 계층 구조에 특히 유용하다.

쌍곡 공간 온톨로지 임베딩의 한 접근은 두 뷰 KG를 위한 이중 기하 공간 임베딩 모델(DGS) [34]이다. DGS는 쌍곡 공간과 구면 공간을 결합해 이중 기하 공간을 만들어 JOIE를 확장한다. 계층 관계를 위한 온톨로지 뷰 개념에는 쌍곡 공간을, 순환 관계를 위한 인스턴스 뷰 엔티티에는 구면 공간을, 순환 구조와 계층 구조에 모두 개입하는 엔티티에는 특별히 설계된 교차 브리지 공간을 사용한다. 쌍곡 공간과 구면 공간을 함께 사용함으로써 DGS는 그래프의 계층 관계와 의미 관계를 모두 포착해 KG의 더 완전한 표현을 제공한다.

쌍곡 온톨로지 임베딩은 여전히 비교적 새로운 연구 영역이며 다수의 열린 질문과 난관이 남는다. 대규모 온톨로지의 효과적 처리와 텍스트 데이터 같은 추가 정보 출처의 결합이 그에 해당한다.

생물학에서의 온톨로지 응용

온톨로지는 생물학 같은 다양한 도메인에서 값진 자원으로 부상했다. 생물학 연구 영역에서 바이러스 연구로 얻어지는 지식은 흔히 제한적이므로, SARS-CoV-2 같은 새로운 종의 분자적 영향을 추론하기 위해 밀접히 관련된 종의 광범위한 생물학 지식을 활용하는 것이 결정적이 된다. 이 필요를 인식해 Bio-JOIE [35]는 JOIE를 확장하여 다수의 생물학 지식 베이스 도메인에 걸친 공동 임베딩 학습을 촉진한다.

Bio-JOIE의 주된 기여는 다양한 생물학 지식 베이스의 정보를 통합해 단백질-단백질 상호작용(PPI) 예측 개선을 가능하게 하는 능력에 있다. 구체적으로 두 필수 모델 구성 요소를 동시에 학습한다. 첫째는 서로 다른 도메인 특화 KG를 별도의 저차원 임베딩 공간에서 특징화하는 지식 모델이고, 둘째는 서로 다른 도메인 사이의 연관과 공유 지식을 포착하는 전이 모델이다.

생물학 외에도 온톨로지 임베딩은 여러 도메인에 응용된다. 헬스케어 정보학에서 SNOMED CT나 Gene Ontology 같은 의료 온톨로지의 임베딩은 의료 개념 사이 관계 포착을 단순화하고, 질병 진단을 돕고, 환자 예후 예측 모델을 강화한다. 나아가 사용자 관심과 항목 속성을 표현하는 온톨로지를 임베딩하면 전자상거래·음악·영화·뉴스에 이르는 도메인에서 추천 알고리즘이 더 정밀하고 개인화된 추천을 산출할 수 있다.

Chapter 06 — 핵심 정리

6장이 확립하는 여섯 가지 결론

  1. 01

    KG는 온톨로지 뷰 GO = (C, RO, OO)인스턴스 뷰 GI = (E, RI, OI)의 두 뷰로 이루어지고, 두 뷰는 크로스뷰 링크 집합 S로 이어진다. 온톨로지는 클래스·속성·관계의 세 구성 요소를 가지며 개별 엔티티 정보를 담지 않는다.

  2. 02

    온톨로지를 결합하면 두 이득을 얻는다. 스키마로 동명이인의 모호성을 해소하고(운동선수 vs. 과학자 Michael Jordan), 클래스 수준 지식으로 연역해 콜드 스타트·롱테일·상식 추론을 다룰 수 있다.

  3. 03

    크로스뷰 링크를 쓰는 방법은 셋이다 — 추가 관계 “IsA”로 통합(Nickel et al. + RESCAL), 정규화 항(SSE의 라플라시안 고유맵 R₁과 국소 선형 임베딩 R₂), 유형 임베딩. SSE는 계층성을 방기하고 단일 범주를 가정한다는 한계가 있다.

  4. 04

    인트라뷰 계층은 두 종류다. 엔티티 유형 계층은 TKRL이 유형별 투영 행렬(RHE의 곱 / WHE의 가중 합)로 다루지만 공간 복잡도가 높다. 관계 계층은 HRS의 3층 구조(클러스터·관계·하위 관계)와 TransRHS의 subRelationOf 기반 일반 구조로 다룬다.

  5. 05

    JOIE는 두 축을 곱한다. 크로스뷰는 같은 공간을 강제하는 CG와 서로 다른 차원을 변환으로 잇는 CT, 인트라뷰는 TransE·DistMult·HolE에 온톨로지 계층용 HA를 더한다. 총 손실은 J = JIntra + ω·JCross이며 두 항을 교대로 최적화한다.

  6. 06

    실험은 CT > CGHA의 효과를 확인한다. 트리플 완성에서 JOIE는 같은 묶음 기준선 대비 MRR 평균 +6.8%, Hit@10 +14.8%이고, 엔티티 타이핑에서 JOIE-HATransE-CT는 YAGO26K-906 MRR 0.897·정확도 85.60을 기록한다. 롱테일 엔티티에서도 성능 하락이 12% 수준에 그쳐 기준선(20% 이상)보다 강건하다.

REF

참고문헌

6장 인용 문헌 35편
  1. [1]J. Hao, M. Chen, W. Yu, Y. Sun, W. Wang. Universal representation learning of knowledge bases by jointly embedding instances and ontological concepts. ACM SIGKDD, pp. 1709–1719, 2019.
  2. [2]S. Auer, C. Bizer, G. Kobilarov, J. Lehmann, R. Cyganiak, Z. Ives. DBpedia: A nucleus for a web of open data. ISWC, pp. 722–735, Springer, 2007.
  3. [3]F. M. Suchanek, G. Kasneci, G. Weikum. YAGO: a core of semantic knowledge. WWW, pp. 697–706, ACM, 2007.
  4. [4]R. Speer, J. Chin, C. Havasi. ConceptNet 5.5: An open multilingual graph of general knowledge. AAAI, 2017.
  5. [5]Wikipedia. Resource Description Framework. [Online].
  6. [6]Wikipedia. OWL. [Online].
  7. [7]J. Lehmann, R. Isele, M. Jakob, A. Jentzsch, D. Kontokostas, P. N. Mendes, S. Hellmann, M. Morsey, P. Van Kleef, S. Auer, et al. DBpedia — a large-scale, multilingual knowledge base extracted from Wikipedia. Semantic Web, 6(2):167–195, 2015.
  8. [8]K. Bollacker, C. Evans, P. Paritosh, T. Sturge, J. Taylor. Freebase: a collaboratively created graph database for structuring human knowledge. ACM SIGMOD, pp. 1247–1250, 2008.
  9. [9]A. P. Taxonomy. Amazon store taxonomy: Definition, importance & best practices. 2023. [Online].
  10. [10]Wikipedia. ACM Computing Classification System. [Online].
  11. [11]Wikipedia. Gene Ontology. [Online].
  12. [12]Disease Ontology. https://disease-ontology.org/
  13. [13]M. Nickel, V. Tresp, H.-P. Kriegel. Factorizing YAGO: scalable machine learning for linked data. WWW, pp. 271–280, 2012.
  14. [14]S. Guo, Q. Wang, B. Wang, L. Wang, L. Guo. Semantically smooth knowledge graph embedding. ACL-IJCNLP, pp. 84–94, 2015.
  15. [15]R. Xie, Z. Liu, M. Sun, et al. Representation learning of knowledge graphs with hierarchical types. IJCAI, pp. 2965–2971, 2016.
  16. [16]Z. Zhang, F. Zhuang, M. Qu, F. Lin, Q. He. Knowledge graph embedding with hierarchical relation structure. EMNLP, pp. 3198–3207, 2018.
  17. [17]A. Bordes, N. Usunier, A. Garcia-Duran, J. Weston, O. Yakhnenko. Translating embeddings for modeling multi-relational data. NeurIPS, pp. 2787–2795, 2013.
  18. [18]B. Yang, W.-t. Yih, X. He, J. Gao, L. Deng. Embedding entities and relations for learning and inference in knowledge bases. arXiv:1412.6575, 2014.
  19. [19]M. Nickel, L. Rosasco, T. A. Poggio, et al. Holographic embeddings of knowledge graphs. AAAI, pp. 1955–1961, 2016.
  20. [20]F. Mahdisoltani, J. Biega, et al. YAGO3: A knowledge base from multilingual Wikipedias. CIDR, 2015.
  21. [21]S. J. Reddi, S. Kale, S. Kumar. On the convergence of Adam and beyond. ICLR, 2018.
  22. [22]A. M. Saxe, J. L. McClelland, et al. Exact solutions to the nonlinear dynamics of learning in deep linear neural networks. ICLR, 2014.
  23. [23]Z. Wang, J. Zhang, J. Feng, Z. Chen. Knowledge graph embedding by translating on hyperplanes. AAAI, pp. 1112–1119, 2014.
  24. [24]D. Krompaß, S. Baier, V. Tresp, et al. Type-constrained representation learning in knowledge graphs. ISWC, 2015.
  25. [25]S. Ma, J. Ding, W. Jia, et al. TransT: Type-based multiple embedding representations for knowledge graph completion. ECML-PKDD, 2017.
  26. [26]J. Ma, P. Cui, X. Wang, W. Zhu. Hierarchical taxonomy aware network embedding. ACM SIGKDD, 2018.
  27. [27]T. Rocktäschel, S. Singh, S. Riedel. Injecting logical background knowledge into embeddings for relation extraction. NAACL-HLT, pp. 1119–1129, 2015.
  28. [28]S. Guo, Q. Wang, L. Wang, B. Wang, L. Guo. Jointly embedding knowledge graphs and logical rules. EMNLP, pp. 192–202, 2016.
  29. [29]A. Bordes, X. Glorot, J. Weston, Y. Bengio. A semantic matching energy function for learning with multi-relational data. Machine Learning, 94(2):233–259, 2014.
  30. [30]Y. Lin, Z. Liu, M. Sun, Y. Liu, X. Zhu. Learning entity and relation embeddings for knowledge graph completion. AAAI, 2015.
  31. [31]X. Lv, L. Hou, J. Li, Z. Liu. Differentiating concepts and instances for knowledge graph embedding. EMNLP, 2018.
  32. [32]J. Pujara, E. Augustine, L. Getoor. Sparsity and noise: Where knowledge graph embeddings fall short. EMNLP, 2017.
  33. [33]M. Chen, Y. Tian, M. Yang, C. Zaniolo. Multilingual knowledge graph embeddings for cross-lingual knowledge alignment. IJCAI, 2017.
  34. [34]R. G. Iyer, Y. Bai, W. Wang, Y. Sun. Dual-geometric space embedding model for two-view knowledge graphs. ACM SIGKDD, pp. 676–686, 2022.
  35. [35]J. Hao, C. J.-T. Ju, M. Chen, Y. Sun, C. Zaniolo, W. Wang. Bio-JOIE: Joint representation learning of biological knowledge bases. ACM-BCB, pp. 1–10, 2020.