IEEE TAIAQG · LLM 비교
IEEE Transactions on AI · Vol.7 No.5 · 2026

영상 학습에서
문항을 자동으로 만든다는 것

영상 기반 학습이 늘면서 학습자의 이해도를 어떻게 평가할 것인가가 핵심 과제가 됐다. 이 연구는 영상 스크립트로부터 문항을 자동 생성(AQG)하는 10개 최신 대규모 언어모델을, 4개 문항 유형5개 평가 지표에 걸쳐 체계적으로 비교한다. 어떤 모델이 어떤 문항에 강한지, 그 차이가 통계적으로 유의한지를 밝힌다.

Kang, Forkan, Banerjee, Jayaraman, McCosker, Kim, Wieland, Kollias
Swinburne University of Technology · ETRI · Vidversity  ·  DOI 10.1109/TAI.2025.3620274
10
비교 대상 LLM
4
문항 유형
5
평가 지표
76
고품질 스크립트
§ 01

이 연구의 세 가지 기여

기존 AQG 연구는 대체로 교과서·웹 문서·강의 슬라이드에 집중했고, 영상 콘텐츠 특유의 난점을 다루지 못했다. LLM을 다룬 연구조차 소수 모델·소수 문항 유형에 그쳤다. 이 연구는 그 공백을 폭과 깊이 양쪽에서 메운다.

Contribution 01

평가 프레임워크

12개 학문 분야의 교육 영상 스크립트에서 4개 문항 유형을 생성하는 10개 LLM을, 5개 핵심 지표로 비교한다. 각 문항 유형에 가장 적합한 모델을 식별할 수 있다.

metrics · relevance · comprehension · difficulty · clarity · context
Contribution 02

프롬프트 공개

문항 생성과 평가에 쓴 프롬프트를 모두 공개한다. 재현성을 보장하고 서로 다른 LLM 간 벤치마킹을 가능하게 하며, 후속 AQG 연구의 자원이 된다.

open resource · GitHub 공개
Contribution 03

강점·약점 규명

각 LLM의 개별 강점과 약점을 문항 유형별로 드러내고, 공통 패턴과 한계를 밝힌다. 나아가 AQG 성능의 통계적으로 유의한 차이를 확인한다.

insight · 개선이 필요한 지점 식별
Scope

영상이라는 난제

영상 자료는 텍스트와 달리 명시적 구조와 맥락 단서가 부족하다. 이 연구는 그 난점을 정면으로 다루며, 자동 평가에 AI를 통합하는 폭넓은 흐름에 기여한다.

domain · video-based learning

§ 02

평가 방법론 — 스크립트에서 문항까지

교육 영상을 AWS Transcribe로 텍스트로 변환한 뒤, 각 스크립트를 LLM 문항 생성의 입력으로 쓴다. 키워드와 요약을 먼저 생성하고, 그 결과로 네 유형의 문항을 만든다. 노이즈를 줄이기 위해 각 LLM은 문항 생성을 세 번 반복한다.

STEP 01

영상 → 스크립트

117개 교육 영상을 전사하고, 5분 이하 클립으로 분할해 247개 세그먼트를 만든다.

STEP 02

품질 검수

교육 전문가가 배경 소음·불명확·내용 부족 스크립트를 제외해 76개 고품질 스크립트를 남긴다.

STEP 03

키워드 · 요약

프롬프트로 키워드(SAQ·MCQ용)와 50단어 이하 요약(GFQ·BLQ용)을 생성한다.

STEP 04

4유형 생성 ×3

각 LLM이 네 문항 유형을 세 번 반복 생성한다. 모델당 최대 76×3×4 = 912문항.

STEP 05

5지표 평가

GPT-4o mini 평가자가 다섯 지표로 문항 품질을 채점한다.

§ 02.1

데이터셋 — 12개 학문 분야, 76개 스크립트

영상 길이는 24초에서 57분 13초까지 분포하며 평균 약 12분이다. 학습자 몰입도가 6분을 넘으면 급격히 떨어진다는 선행 연구에 맞춰 5분 이하로 분할했고, 세그먼트 평균 길이는 4분 35초다.

고령자 돌봄언어 교육법률금융·뱅킹리더십비즈니스 개발 안전 교육웰빙직무 교육희망 과학마케팅·인적 요인IT

§ 03

네 가지 문항 유형

각 유형은 지식 인출과 이해의 서로 다른 차원을 평가한다. 아래 색상 코드는 이후 모든 그래프에서 유지된다.

SAQ 단답형 MCQ 선다형 BLQ 참·거짓 GFQ 빈칸 채우기
Short-Answer · SAQ

단답형

학습자가 짧고 초점 있는 답을 하도록 한다. 정답 여부는 교육자가 지정한 핵심 키워드와 학습자 응답이 얼마나 일치하는지로 측정한다. 각 LLM이 스크립트에서 키워드를 뽑아 생성한다.

기반 · 스크립트 + 키워드
Multiple-Choice · MCQ

선다형

정답 하나와 그럴듯하지만 틀린 방해 선지(distractor)로 구성된다. 지식을 빠르고 일관되게 자동 채점할 수 있다. 정답은 각 LLM이 추천한 키워드로 표현된다.

기반 · 스크립트 + 키워드
Boolean · BLQ

참·거짓

true/false 또는 yes/no 응답으로 사실적 이해를 검증한다. 스크립트 요약을 바탕으로 생성되어 핵심 아이디어를 문자 그대로가 아니라 요지 수준에서 짚는다.

기반 · 요약
Gap-Fill · GFQ

빈칸 채우기

주어진 문장의 빈칸을 채우게 하여 누락 정보를 회상·추론하는 능력을 본다. 요약에서 의미 있는 명사 키워드를 비워 생성하며, 빈칸은 밑줄 다섯 개로 표시한다.

기반 · 요약

§ 04

다섯 가지 평가 지표

BLEU·ROUGE 같은 전통적 지표는 어휘 중첩만 본다. 문항 품질의 본질인 의미적 적합성과 명료성을 담지 못하므로, 이 연구는 다섯 지표를 제안한다. 앞의 네 지표는 1–5 척도로 채점한 뒤 [0, 1]로 정규화하며, 맥락 활용도는 수학적으로 [0, 1]에 놓인다.

적합성Relevance
문항이 스크립트 세그먼트의 핵심 주제를 얼마나 정확히 반영하는가. 곁가지 내용 유입 없이 본문 내용과 정렬되는 정도를 본다.
15
읽기 이해도Reading Comprehension
문법적 정확성과 가독성. 문법 오류가 이해를 방해하지 않는지를 본다. LLM이 가장 강한 지표다.
15
문항 난이도Question Difficulty
스크립트를 근거로 답하기 얼마나 어려운가. 표면적 사실 회상과 깊은 추론적 사고를 구분한다. LLM이 가장 약한 지표다.
15
문항 명료성Question Clarity
문항이 얼마나 명확하며 오해를 부르지 않는가. 모호성·구조적 일관성·오독 가능성을 평가한다.
15
맥락 활용도Context Utilization
생성된 답이 제공된 맥락을 얼마나 활용하는가. 관련 맥락 조각이 상위에 잘 랭크되는지를 [0, 1]로 측정한다. 모델 간 편차가 가장 큰 지표다.
01

// 평가자는 GPT-4o mini 단일 모델을 사용해 일관성을 유지하고 변동성을 최소화했다. 맥락 활용도는 Ragas 방식으로 계산했다.


§ 05

결과 — 문항 유형을 골라 성능을 본다

아래 막대는 지표별 상위 모델을 문항 유형별로 보여준다. 위 버튼으로 문항 유형을 전환하면 그래프가 다시 채워진다. 값은 세 번 반복의 평균 점수다.

단답형 · 적합성 상위 모델

Relevance · 최댓값 대비 정규화

지표별로 강한 모델이 다르다. 적합성·GFQ·MCQ는 Qwen, 읽기 이해도·난이도·명료성은 Gryphe, 맥락 활용도는 Llama가 앞선다. 어떤 단일 모델도 모든 지표를 석권하지 못한다.

Best · Relevance

Qwen

네 문항 유형 전반에서 적합성 최고. GFQ 0.89, SAQ·MCQ 0.77로 가장 관련성 높은 문항을 만든다.

RelevanceGFQ 0.89MCQ 0.77
Q
Best · RC · Difficulty · Clarity

Gryphe

읽기 이해도, 난이도, 명료성 세 지표에서 선두. 창작 글쓰기 특화 모델의 문장력이 문항 품질로 이어진다.

RC 0.98–1.0DifficultyClarity 0.77
G
Best · Context

Llama

맥락 활용도 최고. 여러 단서를 통합할 때 강하다. MCQ에서 완벽 점수(1.0)를 냈으나 명료성은 다소 불안정하다.

Context 0.99–1.0MCQ 1.0
L

§ 06

공통 패턴 — SAQ가 가장 쉽고 BLQ가 가장 어렵다

레이더 플롯의 그룹 최소·최대·평균을 종합하면, LLM은 SAQ에서 가장 잘하고 BLQ에서 가장 고전한다. 읽기 이해도만 예외적으로 모든 유형에서 높고 편차가 작다.

01

읽기 이해도는 일관되게 최상위

모든 문항 유형에서 최고 성능을 보이고 모델 간 편차가 작다. LLM이 문법적으로 정확하고 잘 구조화된 텍스트 생성에 고도로 최적화됐음을 보여준다.

02

적합성은 BLQ·MCQ에서 낮다

특히 BLQ에서 그룹 최소·최대 편차가 크다. BLQ는 요약에서 생성되어 맥락적 깊이와 설명 세부가 소실되므로, 문항이 지나치게 포괄적이 되어 부분적으로만 관련되기 쉽다.

03

난이도는 전반적으로 낮다

대부분 문항이 답하기 쉬운 편이라 깊은 추론이나 종합을 요구하지 않는다. 특히 단순 참·거짓 검증인 BLQ가 난이도를 더 낮춘다.

04

맥락 활용도의 편차가 가장 크다

MCQ·BLQ에서 두드러진다. 일부 모델은 맥락 단서를 잘 쓰지만 다른 모델은 근거가 약한 일반적 내용에 의존한다. 문항을 스크립트에 확실히 고정하는 일이 핵심 난제임을 보여준다.

05

BLQ가 가장 큰 도전 과제

부정·조건문 같은 논리 연산자 이해와 간결한 이진 응답 유지가 어렵다. 구조화 프롬프트("YES 또는 NO로 답하라"), 단계적 추론, 검색 증강, 사람 검토 같은 전략으로 완화할 수 있다.


§ 07

통계 분석 — 차이는 대체로 유의하다

Monte Carlo 시뮬레이션(1,000회)으로 각 모델이 지표별 최고 평균일 확률을 추정했다. 아래 표에서 지표별 최고값(★)이 확률적 순위의 선두다. 정규성 위반으로 ANOVA 대신 Kruskal–Wallis H 검정을 사용했으며, 전체 45개 쌍 비교 중 89%(40개)에서 p < 0.05로 유의한 차이가 나타났다.

LLMRelevanceRCQDQCCU
Claude0.11590.08440.05610.00100.1287
ChatGPT0.12690.04080.00910.00100.1681
Databricks0.00210.03940.01620.00000.0000
DeepSeek0.07020.00380.02580.00630.0162
Gryphe0.01290.83570.51100.60930.0000
Llama0.14170.00750.06430.04440.3254
Mistral0.14450.03690.01080.00060.1386
Qwen0.28360.00840.03340.09940.2246
Upstage0.07110.00000.27420.00720.0631
Wizard0.05350.04920.02590.28630.0011

// Table VII · Monte Carlo p-values (각 LLM이 지표별 최고 평균일 확률). ★ = 최고. RC 읽기이해도 · QD 난이도 · QC 명료성 · CU 맥락활용도.
// KW 검정에서 맥락 활용도는 Claude·ChatGPT·Mistral·Qwen이 Llama와 유의차 없음 — 실무에서는 비용·지연·통합 편의로 선택 가능한 동등 성능 군집.


§ 08

실무 적용과 한계

직업 교육·훈련(VET) 맥락 — 고령자 돌봄, 직장 안전 모듈처럼 영상 학습이 핵심인 영역 — 에서 고성능 모델을 골라 형성 평가를 자동화할 수 있다. 다섯 지표는 학습 플랫폼에 문항을 삽입할 때 품질 관리 기준으로 쓴다. 예컨대 맥락 활용도가 낮은 문항은 오도를 피하려 표시하고, 명료성이 높고 난이도가 적절한 문항은 우선한다.

시각 정보 부재

스크립트 텍스트만 사용해 다이어그램·차트·제스처 같은 시각 단서를 놓친다. 텍스트와 시각을 함께 처리하는 멀티모달 모델로 확장할 여지가 있다.

사람 평가 미포함

단일 GPT 모델 평가는 확장성과 일관성이 있으나 편향과 교육학적 뉘앙스 포착에 한계가 있다. LLM 채점과 사람 검토를 결합한 하이브리드 평가가 다음 단계다.

세그먼트 길이 영향

5분 분할은 실용적 기준이었으나 길이별 체계적 비교는 하지 않았다. 확장된 컨텍스트 창을 가진 최신 모델이 긴 세그먼트에서 이득을 보는지 후속 연구가 필요하다.

§ 09 · Conclusion

어떤 단일 모델도 모든 지표에서 일관되게 앞서지 못한다. 특정 문항 유형에 뛰어난 모델은 있으나, 이는 하이브리드 또는 과제 특화 AQG 해법이 필요함을 시사한다. LLM이 진화할수록 교육 적용은 교육학적 정렬·공정성·접근성을 엄밀히 검증해야 한다.