중심 발견 — 하나의 숫자가 아니라 하나의 조건
"HRKG의 가치는 분포 이동에 조건부다." 표준 분할에서는 텍스트 인코더만으로 충분하지만, 길이 지름길이 제거되는 순간 구조만이 예측을 지탱한다.
벤치마크는 포화되었다
Full MVGC F1 0.9924 ±0.0054
별도 튜닝된 텍스트 인코더가 전체 멀티뷰 모델과 구별되지 않는다. 전사 텍스트만으로 천장 부근 F1에 도달하므로, 어떤 분포 내 구성요소 비교도 하이퍼릴레이셔널 구조를 어휘 지름길과 신뢰성 있게 분리할 수 없다.
텍스트는 붕괴하고 구조는 버틴다
HRKG 계열 F1 0.60–0.70 유지
가장 짧은 전사 4분위를 테스트 폴드에 격리해 체계적 길이 이동을 강제하면, 텍스트 모델은 F1 0.9905 → 0.4824로 붕괴하고 HRKG를 지닌 모델은 크고 유의한 차이로 강건성을 유지한다 — 구조의 이득이 정확히 필요한 곳에서 분리 측정된다.
진단의 사슬은 이렇다. KorCCVi v2에서 피싱 전사의 중앙값 길이가 정상 전사보다 훨씬 짧아 전사 길이만으로 준결정론적 클래스 신호가 된다. 근중복 감사(TF–IDF 코사인 ≥ 0.9)는 근중복이 0.5%에 불과함을 확인하므로, 누출의 정체는 패러프레이즈 중복이 아니라 길이 지름길이다. 시나리오 시그니처 차단 분할(권위·금융·자격증명·긴급·협박·비밀·대출·가족·배송·잡담·길이로 그룹화)에서도 F1 0.9951이 유지되어, 그룹화 이후에도 고도로 분리 가능한 어휘-시나리오 신호가 존재함을 보인다. 결국 구조적 이득에 대한 어떤 주장도 그 지름길이 부재한 곳에서 검정되어야 하며, OOD 분할이 정확히 그 검정을 제공한다.
역전 현상 — HRKG-only(0.7018)가 Full MVGC(0.6354)를 앞선다
이 역전 자체가 어휘 지름길 의존의 증거다. 분포 내에서 튜닝된 정적 융합은 당시 거의 완벽했던 어휘 뷰를 신뢰하도록 학습되었고, 그 뷰가 붕괴한 뒤에도 계속 가중치를 주어 결합 모델을 끌어내린다. 그럼에도 전체 모델의 ROC-AUC가 높게 유지된다는 사실(HRKG 계열 ≈ 0.96–0.97, 텍스트는 0.90으로 하락)은 구조 신호의 상실이 아니라 융합 가중치와 캘리브레이션의 열화임을 가리킨다 — 입력이 분포 밖일 때 해당 뷰를 하향 가중하는 불확실성 인지·뷰 신뢰도 적응형 융합이 자연스러운 다음 단계다.
세 가지 기여
한정자 인지 HRKG 벤치마크
보이스피싱 탐지를 한정자 인지 HRKG 학습 과제로 재정식화하고 재현 가능한 벤치마크를 공개한다 — 특성 테이블, 분할 식별자, 추출기 감사, 시드별 예측까지. 구조·어휘·엔티티 중심 증거가 주장이 아니라 단일 프로토콜 아래에서 비교된다.
조건부·유의성 검정 발견
별도 튜닝된 단일·이중·전체 뷰 모델의 다중 시드 대응 검정으로 표준 분포 내 분할의 포화를 입증하고, 원인을 전사 길이 지름길로 추적하며, 길이 층화 OOD 분할로 제거한다 — 그 아래에서 하이퍼릴레이셔널 구조가 크고 유의한 강건성 이득을 낸다. 이것이 논문의 중심 주장이다.
대조·강건성 분석
동일 프로토콜에서 대조 손실 제거 어블레이션, HRKG 노이즈 스트레스 테스트, 근중복 감사, 부분 전사 연구를 수행해, 정렬 손실의 기여와 멀티뷰 융합의 회복탄력성을 전제하지 않고 정량화한다.
방법론 — 3단계 파이프라인
데이터 변환(전사 → 한정자 인지 HRKG) → 지식 표현(3개 병렬 뷰 인코더) → 대조 학습(교차 뷰 정렬 + 어텐션 융합).
4.1문제 정식화
통화 전사 T_i = {(x_t, s_t)}는 발화 텍스트와 화자 역할(피해자·가해자·미상)의 시퀀스이고, 레이블 y_i ∈ {0,1}이 피싱 여부를 나타낸다.
탐지기는 예측 정확도와 해석 가능성을 동시에 극대화해야 하며, 이를 위해 중간의 구조화된 이벤트 표현 G_i를 생성한다:
4.2HRKG 구축 — 의도적으로 "노이지"하다고 기술되는 프런트엔드
도메인 정보 기반 추출 파이프라인이 전사를 정규화하고, 화자 턴을 분할하고, 사기 관련 엔티티 멘션(발신자·피해자·검사·은행원·계좌·대출·보안코드·요구행동)을 탐지하고, 관계 후보(사칭·송금 요구·법적 권위 인용·비밀 경고·긴급성 조성)를 유도하며, 문맥 표현을 6개 정준 한정자 패밀리 — 긴급성, 강압, 기관적 구실, 이체 채널, 시간적 압박, 요구행동 유형 — 로 사상한다. 값은 스키마 유도 정규화로 생성된다("지금 즉시"/"오늘" → 긴급성·시간적 압박, "검찰청"/"경찰" → 기관적 구실). 이 단계는 완벽한 의미 파서가 아니라 의도적으로 노이지한 것으로 기술되며, 그렇기에 실증 평가가 240건 실버 샘플에 대한 타입 수준 정밀도·재현율·F1 감사를 보고하고, 후속 노이즈 회복탄력성 분석의 동기와 외부 인간 스팬 주석의 필요를 명시한다.
4.3세 가지 이질적 의미 뷰
보이스피싱 증거는 그래프 위상, 원시 어휘, 희소한 고위험 앵커에 분산되어 있으므로 세 뷰가 필요하다.
구조 뷰 — 한정자 인지 위상
수신 하이퍼릴레이셔널 팩트마다 한정자 표현 q_ε를 어텐션 가중합으로 만들고(식 4), 관계별 변환 메시지에 더해(식 5) 정규화 집계로 노드를 갱신한다(식 6). 노드 전체에 대한 어텐션 풀링이 z^(s)를 산출한다.
어휘 뷰 — 추출에서 유실될 정보의 보존
KoBERT·KLUE-RoBERTa·XLM-R 등 BERT 계열 인코더 + 투영 MLP가 원시 전사를 문맥 임베딩으로 사상한다. 담화 표지, 헤징, 설득, 화용적 의도를 텍스트에서 직접 포착한다. 강한 어휘 모델 단독으로 KorCCVi에서 경쟁력이 있으므로, 결정적 비교에는 반드시 별도 튜닝된 텍스트 전용 베이스라인이 포함되어야 한다.
엔티티 중심 뷰 — 희소 앵커의 증폭
검사·경찰·은행·계좌·사건번호·보안코드·대출상품·결제채널·이체행동 같은 앵커 주변에서 서브그래프를 샘플링하고 어텐션 모듈로 풀링한다. 희소하지만 결정적인 엔티티가 긴 정상 대화 구간에 희석되는 것을 막는다. 프라이버시 민감 환경에서는 앵커를 원시 문자열 대신 정규화 타입이나 솔트 해시로 저장할 수 있다.
4.4교차 뷰 대조 융합
세 표현은 뷰별 헤드로 투영되고, 뷰 쌍 (s,l), (s,e), (l,e)마다 같은 통화가 양성쌍, 미니배치의 다른 통화가 음성쌍인 쌍별 InfoNCE 손실(식 9)을 계산해
평균한 정렬 손실 L_g(식 10)를 얻는다. 정렬된 뷰 벡터는 어텐션으로 융합되고(식 11–12), 교차 엔트로피 분류 손실과 결합된다:
설계의 두 속성이 명시된다. 첫째, 뷰가 언제·왜 시너지를 내는가 — 어휘 뷰는 표면 사기 화법(register)의 준충분 통계량이므로 분포 내에서는 구조·엔티티 뷰가 대체로 잉여이고, 분포 이동 아래에서는 표면 화법이 정확히 변하는 것인 반면 한정자 인지 관계 구성(조작된 권위 × 긴급성 × 요구행동)은 비교적 불변이다 — 그때 뷰들은 상보적이 되며 대조 목적함수가 이 불변성을 융합 표현으로 이전한다. OOD 실험이 이 예측을 확인한다. 둘째, 상보성 대 하이퍼파라미터 상속 — 전체 모델의 튜닝을 물려받는 leave-one-view-out 어블레이션은 내부 의존성만 측정하므로, 별도 튜닝된 단일·이중 뷰 베이스라인만이 진짜 특성 상보성을 반영한다. 클래스 불균형(양성 24%) 때문에 F1과 PR-AUC가 1차 지표이고, 모든 구성은 5시드 평균±표준편차와 대응 검정으로 보고된다.
실험 — 단일 프로토콜 아래의 10개 베이스라인
KorCCVi v2: 2,927건 전사(피싱 695 / 정상 2,232), 층화 70/15/15 분할. 모든 그래프 모델은 단일 PyG 인터페이스로 통일되어 차이가 데이터 처리 방식이 아닌 표현 설계를 반영한다. 전 실험은 Apple M3(128GB RAM)에서 수행되었다.
그래프 중심 비교(Fig. 2)에서 MVGC는 쌍별·이종·경량·하이퍼릴레이셔널 그래프 비교군을 모두 제치고 1위를 차지한다 — 한정자 인지 멀티뷰 정렬이 동일 벤치마크 프로토콜에서 우월함을 확인한다. 그러나 전사 인코더는 그래프 베이스라인이 아니므로 이것만으로 구조적 추론이 분리되지 않으며, 별도 튜닝된 텍스트·융합·전체 모델 대조군(Table 1)으로 넘어간다.
| 모델 | Accuracy | Precision | Recall | F1-score |
|---|---|---|---|---|
| Ent. only (엔티티 뷰) | 0.9650 ± 0.0065 | 0.9161 ± 0.0327 | 0.9410 ± 0.0156 | 0.9279 ± 0.0118 |
| Str. only (구조 뷰) | 0.9764 ± 0.0050 | 0.9395 ± 0.0248 | 0.9638 ± 0.0124 | 0.9512 ± 0.0093 |
| HRKG only | 0.9823 ± 0.0101 | 0.9439 ± 0.0294 | 0.9848 ± 0.0144 | 0.9638 ± 0.0204 |
| Text only | 0.9955 ± 0.0043 | 0.9888 ± 0.0152 | 0.9924 ± 0.0080 | 0.9905 ± 0.0088 |
| Lex.+HRKG | 0.9945 ± 0.0057 | 0.9850 ± 0.0170 | 0.9924 ± 0.0080 | 0.9887 ± 0.0118 |
| Lex.+Str. | 0.9964 ± 0.0034 | 0.9906 ± 0.0114 | 0.9943 ± 0.0052 | 0.9924 ± 0.0072 |
| Full (λ₁=0, 대조 손실 off) | 0.9932 ± 0.0048 | 0.9814 ± 0.0171 | 0.9905 ± 0.0067 | 0.9858 ± 0.0099 |
| Full MVGC (λ₁=0.5) | 0.9964 ± 0.0026 | 0.9887 ± 0.0101 | 0.9962 ± 0.0052 | 0.9924 ± 0.0054 |
| 비교 | ΔF1 | t-test p | Wilcoxon p | d_z |
|---|---|---|---|---|
| Full MVGC vs. Text only | +0.0019 | 0.37 | 0.50 | 0.45 |
| Full MVGC vs. 최고 융합 대조군 | +0.0038 | 0.40 | 0.50 | 0.42 |
| Full MVGC vs. 대조 손실 off | +0.0066 | 0.16 | 0.25 | 0.77 |
결정적 검정길이 층화 OOD — 지름길이 사라진 곳에서의 성적표
가장 짧은 전사 4분위를 테스트 폴드에 격리해 체계적 훈련/테스트 길이 이동을 강제한다. 이동 아래에서 모델들은 보수적으로 예측하므로(정밀도 ≈ 1.0, 재현율 하락) F1 격차는 재현율이 주도한다.
| 모델 | Accuracy | Precision | Recall | F1-score | AUC |
|---|---|---|---|---|---|
| Text only | 0.4140 ± 0.0202 | 0.998 | 0.3185 ± 0.0248 | 0.4824 ± 0.0277 | 0.9032 ± 0.0361 |
| Lex.+HRKG | 0.5108 ± 0.0244 | 1.000 | 0.4306 ± 0.0284 | 0.6015 ± 0.0280 | 0.9689 ± 0.0070 |
| Full (λ₁=0) | 0.4763 ± 0.0488 | 1.000 | 0.3904 ± 0.0568 | 0.5596 ± 0.0606 | 0.9681 ± 0.0028 |
| Full MVGC | 0.5417 ± 0.0355 | 1.000 | 0.4666 ± 0.0413 | 0.6354 ± 0.0392 | 0.9642 ± 0.0057 |
| HRKG only | 0.6057 ± 0.0373 | 0.998 | 0.5420 ± 0.0437 | 0.7018 ± 0.0357 | 0.9690 ± 0.0054 |
대안적 해석도 명시된다 — 짧은 전사에서는 텍스트 인코더가 단순히 읽을 것이 적으므로, 그래프가 버티는 이유가 구조의 이동 불변성 때문이 아니라 희소 입력에 더 잘 버티기 때문일 수 있다. 두 설명은 상호 배타적이지 않으며, 입력이 절단될 때 HRKG를 지닌 융합이 정확히 앞서는 부분 전사 결과(Table 5)는 둘 모두와 정합한다.
진단 실험 — 신뢰성을 정량화하는 다섯 개의 감사
6.1추출기 감사 — 입력의 신뢰성을 측정 가능하게
| 필드 | Precision | Recall | F1-score |
|---|---|---|---|
| Entities | 0.3361 | 0.8711 | 0.4851 |
| Relations | 0.1543 | 0.8405 | 0.2607 |
| Qualifiers | 0.4312 | 0.6438 | 0.5165 |
규칙 기반 추출기는 의도적으로 고재현율(엔티티 타입 87.1%, 관계 타입 84.0%)·저정밀도로 설계되어 관계를 놓치기보다 과생성한다. 따라서 추론 시 지배적 노이즈 모드는 부재가 아니라 잉여 구조이며, 추출 특성을 무작위로 드롭하면 대개 이미 중복인 후보가 제거된다 — 30% 드롭아웃까지 융합 F1이 사실상 평평한(0.9617–0.9637 vs. 청정 0.9626) 이유다. 이 측정된 한계가 멀티뷰 설계의 동기다: 그래프 증거가 노이지할 때 어휘 브랜치가 반드시 가용해야 하므로, MVGC를 완벽히 깨끗한 그래프에서만 평가해서는 안 된다. 단, 이 테스트는 노이즈 수준의 한계 변화가 융합에 영향을 주지 않음을 보일 뿐, 모델이 올바른 소수 관계를 식별함을 입증하지는 않는다(정밀도 0.15의 대부분 허위인 집합에서의 드롭이므로).
6.2부분 전사 — 조기 경보의 가능성
| 모델 | 첫 500자 | 첫 1000자 | 첫 2000자 |
|---|---|---|---|
| Lexical | 0.9042 ± 0.0449 | 0.9343 ± 0.0423 | 0.9451 ± 0.0279 |
| HRKG | 0.8629 ± 0.0051 | 0.9164 ± 0.0050 | 0.9065 ± 0.0113 |
| Lex.+HRKG EF (조기 융합) | 0.9523 ± 0.0123 | 0.9855 ± 0.0049 | 0.9904 ± 0.0049 |
처음 500자만으로 어휘+HRKG 조기 융합이 F1 0.9523에 도달한다(텍스트 전용 0.9042) — 기관적 구실, 요구행동, 압박 한정자가 내러티브 완결 전에 표면화하기 때문이다. 이는 HRKG 표현이 그래프 전용 베이스라인이 온전히 활용하지 못하는 방식으로 사기 증거를 조직함을 보이는 동시에, 천장 부근의 분포 내 F1만으로는 구조적 이득의 충분한 증거가 아님을 명시한다.
6.3대조 손실의 격리 — 일관되게 양(+)이나 아직 유의하지 않은 기여자
"contrastive"가 방법의 중심 단어이므로 그 효과를 직접 격리한다. 동일 훈련·평가 프로토콜에서 대조 손실 제거 변형(λ₁=0)은 분포 내 F1 0.9858 vs. 정렬 시 0.9924 — 증분은 양이지만 포화 분할에서 예상대로 유의하지 않다(p=0.16). OOD 분할에서는 증분이 ΔF1 = +0.076(off 0.5596 → on 0.6354)으로 커지지만 5시드에서 유의성에는 못 미친다(p=0.10). 별도 튜닝된 단일·이중 뷰 베이스라인은 독립 최적화를 통해 진짜 특성 상보성과 하이퍼파라미터 상속을 구별하며, 분포 내에서는 어떤 단일 뷰도 어휘 인코더에 못 미치지만 이동 아래에서는 구조·HRKG 뷰가 지배한다 — §4.4 시너지 논증이 예측한 바로 그 패턴이다.
6.4하이퍼파라미터 민감도 — 취약한 단일점 최적이 아니다
대조 가중치 λ₁, 온도 τ, 엔티티 서브그래프 반경의 국소 민감도 분석(Fig. 3)에서 최강 영역은 λ₁=0.5, τ=0.2, 반경=2 부근으로 기본 설정과 일치한다. 곡선은 평평하지 않지만 기본값에서 멀어질수록 완만하게 저하되어, MVGC가 검증 분할에서 고립된 스파이크가 아닌 국소적으로 안정한 고F1 영역에 있음을 나타낸다.
논의 · 한계 · 재현성
7.1조건부 상보성 — MVGC 가치의 메커니즘
MVGC는 사기 분석을 고립된 토큰에서 한정된 구조적 이벤트로 재구성하고, HRKG가 조작된 권위·기관 맥락·긴급성·강요된 지시의 결합 구성을 형식화한다. 별도 튜닝 비교는 이것이 정확히 언제 도움이 되는지 보여준다 — 분포 내에서는 표면 사기 화법이 (부분적으로 길이 지름길을 경유해) 너무 분리 가능해서 텍스트 인코더가 준충분하고 융합은 유의한 이득을 더하지 못한다. OOD 분할이 그 지름길을 제거하는 순간 이동 불변적 관계 구조가 예측을 지탱하고, HRKG를 지닌 모델은 텍스트 모델이 0.50 아래로 떨어지는 곳에서 0.60–0.70 F1을 유지한다. 지름길이 있으면 잉여, 없으면 결정적 — 이 조건부 상보성이 MVGC 가치의 기저 메커니즘이다.
7.2명시적으로 구획된 경계
길이 이동 아래의 강건성
구체적으로 입증된 것은 길이 이동 아래의 강건성이다. 시간적·출처·적대적 이동에 대한 강건성은 미입증으로 남는다. 그래프 위상은 실측이 아닌 프록시 관측이다(추출기가 고재현·저정밀이므로).
배치 수준 주장에 필요한 것
인간 추출 레이블, 더 강한 인코더(네이티브 한국어 인코더 포함), 시간·출처 기반 분할, 뷰 신뢰도 적응형 융합, 프라이버시·공정성 검증. 데이터 최소화 강제 — 온디바이스 또는 신뢰실행환경 수집, PII 삭제·솔트 해싱, 원시 텍스트가 아닌 정규화 그래프 스키마 보존.
CPU에서 끝까지 재생성되는 파이프라인
원시 전사 CSV로부터 공개 파이프라인이 Table 1–3을 종단간 재생성한다. 헤드라인 분포 내 비교는 단일 CPU 워크스테이션의 클린 클론에서 예산 내 재현되었다. PyG/KoBERT 그래프 베이스라인 그림만 무거운 의존성을 요구하며, 모든 결론은 CPU 재현 가능한 대조군 위에 선다.
7.3결론
MVGC는 통일된 별도 튜닝·다중 시드·유의성 검정 프로토콜 아래에서 평가된 한국어 보이스피싱 탐지용 멀티뷰 HRKG 프레임워크다. 표준 분할에서 벤치마크는 포화되어 있고(텍스트 전용 F1 0.9905가 전체 모델과 p=0.37로 구별 불가), 어떤 분포 내 비교도 구조를 어휘 지름길과 분리할 수 없다. 기저의 전사 길이 지름길을 길이 층화 OOD 분할로 제거하면 하이퍼릴레이셔널 구조의 크고 유의한 이점이 드러난다(F1 0.60–0.70 vs. 텍스트 단독 0.48, p<0.01). 기여는 재현 가능한 파이프라인이 뒷받침하는 정량화된 조건부 발견이다 — 한정자 인지 그래프 구조는 분포 이동 아래에서 분리 가능하고 유의한 강건성을 제공한다.