AI Research Notes· SIGMOD 2026 · AI-Native Data Systems · Bengaluru
Conference Research Map / Accepted Papers · 36 Research Sessions

데이터베이스가 AI의 바깥이 아니라 안쪽으로 들어간다

SIGMOD 2026: From Relational Databases to AI-Native Data Systems

Abstract · Program-level synthesis

SIGMOD 2026의 큰 변화는 데이터베이스가 AI를 저장하는 그릇에서 AI를 실행하고 계획하고 검증하는 계산 시스템으로 이동했다는 데 있다.

첨부 자료는 SIGMOD 2026 공식 Accepted Papers 페이지와 실제 발표 세션을 함께 읽어 연구 의제를 재구성한다. Accepted Papers는 네 차례의 PACMMOD 라운드로 구성되고, Research Program은 2026년 6월 2–4일 동안 36개의 Research 세션으로 편성된다. 여기서 가장 눈에 띄는 것은 LLM·agent, vector search, RAG, multimodal data가 별도 응용이 아니라 database system의 first-class citizen으로 들어왔다는 점이다.

2026년의 데이터 시스템은 relation을 저장하고 SQL을 실행하는 엔진에서 관계형·벡터·그래프·문서·멀티모달 데이터를 함께 다루고, LLM/agent가 검색·계획·최적화하며, GPU·cloud·disaggregated infrastructure에서 실행되는 AI-native data system으로 넓어진다.
증거의 경계. 이 글은 개별 논문의 실험 수치를 비교한 메타분석이 아니다. 공식 세션 분류와 발표 논문 제목을 바탕으로 SIGMOD 2026의 연구 의제와 기술적 방향을 재구성한 program-level analysis다.
Part I · §1–§3

첫 번째 변곡점: LLM과 검색이 DBMS의 외부 기능이 아니게 되었다

자연어 front-end를 붙이는 단계에서 data work 자체를 LLM과 agent가 계획·실행하는 단계로 이동한다.

§1 · LLM & Agentic Data Processing

LLM이 데이터 작업의 계획자와 실행자가 된다

프로그램 첫 번째 세션부터 LLM & Agentic Data Processing이 배치된다. DRAMA의 open-domain analytic query, Chatty-KG의 multi-agent knowledge-graph QA, AgenticScholar의 학술 코퍼스 pipeline orchestration, BAT의 LLM 기반 data preparation이 한 세션에 묶인다. agentic workflow를 효율적으로 서비스하기 위한 LLM serving 연구도 함께 등장한다.

중요한 변화는 “LLM을 DB에 연결한다”는 문장에서 동사가 바뀐 데 있다. 이제 LLM은 검색 결과를 말로 설명하는 인터페이스가 아니라 데이터 정제·준비 과정을 합성하고, 문서·표·그래프를 넘나드는 질의계획을 세우며, 여러 검색과 검증 단계를 조직하는 실행 주체로 연구된다.

이 흐름은 autonomous DBMS로 이어진다. AgentTune은 LLM agent를 이용한 database knob tuning을, MCTuner는 LLM-guided exploration을 통한 DB tuning을 다루며, 과거 튜닝 이력을 language model이 활용하는 접근도 프로그램에 포함된다. 자연어 front-end가 DBA의 대체물이 되었다고 말하기는 이르다. 그러나 optimizer와 DBA가 수행하던 의사결정 일부를 language model이 흡수하는 연구축이 분명히 생겼다.

데이터베이스가 LLM을 호출하는 것이 아니라, LLM이 데이터베이스의 일을 조직하기 시작한다.
§2 · Vector Database

벡터 검색은 더 이상 주변부 ML 기능이 아니다

Vector and Nearest Neighbor Search, Learned & Vector Indexing, Vector Search & Indexing, LLM and Vector Retrieval이 독립 세션으로 반복 편성된다. approximate nearest-neighbor search는 관계형 indexing과 join optimization처럼 database systems의 핵심 연구영역으로 굳어졌다고 읽을 수 있다.

문제도 성숙했다. high-dimensional pruning, distribution-aware HNSW, filtered ANN, low-selectivity attribute filtering, multi-vector retrieval, Maximum Inner Product Search, SSD 기반 vector similarity join, distributed vector DB, RDMA 기반 distributed vector search, 서로 다른 embedding model 사이의 vector DB 통합이 각각 세분화된 연구문제로 등장한다. 첨부 자료는 TRIM, PathSeer, Curator, GEM, FAVOR를 대표 이름으로 든다.

특히 database community다운 질문은 vector search와 기존 predicate를 어떻게 함께 처리할 것인가이다. Beyond Vector Search: Querying With and Without Predicates, filtered-ANNS 계열, PostgreSQL 위의 filter-agnostic vector search 분석은 similarity만 빠르게 계산하는 문제에서 metadata predicate와 semantic similarity를 하나의 plan 안에 넣는 문제로 초점을 옮긴다.

\[\text{Relational Predicate}+\text{Vector Similarity}+\text{Semantic Predicate}\]
§3 · RAG as data management

RAG는 모델 기법에서 query processing problem으로 이동한다

SIGMOD 2026이 RAG를 다루는 방식은 꽤 분명하다. 질문은 embedding model 하나의 정확도가 아니라 검색 비용, chunk 선택, context budget, retrieval planning, indexing, long-context 처리다.

Skyline Retrieval meets Set-Cover Chunk Merging은 long-context QA의 비용 효율적 RAG 구성을, SchemaRAG는 Text-to-SQL의 schema-aware retrieval을, SEFRQO는 RAG를 query optimizer와 연결하는 문제를 다룬다.

“어떤 embedding이 좋은가?”보다 “어떤 데이터를 언제 검색하고, 무엇을 버리고, 무엇을 합치며, 어느 단계에서 다시 검색할 것인가?”가 더 데이터베이스다운 질문이 된다.

이때 RAG의 core abstraction은 retrieval model보다 비용과 정확도를 함께 고려하는 반복 query plan에 가까워진다.

Part II · §4–§6

Semantic Query: 생성 가능성보다 신뢰성과 비용을 묻는다

Text-to-SQL, learned optimizer, approximate query processing이 하나의 cost–accuracy–robustness 문제로 수렴한다.

§4 · Text-to-SQL

“SQL을 만들 수 있는가?”에서 “믿고 실행할 수 있는가?”로

Text-to-SQL의 초점은 가능성보다 신뢰성으로 이동한다. 프로그램에는 template-constrained decoding을 통한 반복 질의 정확도 향상, PRISM의 NL2SQL cost–accuracy trade-off, DeepEye-SQL, DIVER, LLM 기반 SQL dialect segmentation, SchemaRAG가 포함된다.

Comparison and Analysis of Value Linking in Text-to-SQL systems처럼 생성 모델 자체보다 자연어의 값과 실제 DB tuple/value를 어떻게 연결하는지를 독립적으로 분석하는 연구도 등장한다. 그리고 Are Your LLM-based Text-to-SQL Models Secure?는 backdoor를 통한 SQL injection 가능성을 연구대상으로 끌어올린다.

\[\{\text{accuracy},\text{robustness},\text{security},\text{cost},\text{explainability}\}\]

NL2SQL이 production system에 들어가려면 execution accuracy만으로는 부족하다. 틀린 SQL이 왜 나왔는지, 비용이 얼마나 드는지, 공격 입력에서 어떻게 망가지는지까지 평가해야 한다.

§5 · Query Optimization

Learned optimizer는 고전 optimizer를 없애기보다 다시 만난다

GenJoin은 generative plan-to-plan optimizer를, CorrBound는 relation 내부·관계 간 correlation을 고려한 cardinality estimation을, APQO는 parametric query optimization을, Divo와 Reqo는 learning-based optimizer를 다룬다. Can Large Language Models Be Query Optimizer for Relational Databases?처럼 LLM 자체를 optimizer로 쓸 수 있는지 직접 묻는 논문도 있다.

그러나 더 중요한 변화는 learned optimizer가 기존 cost model을 전부 폐기하는 방향보다 고전적 optimization theory와 learning model을 결합하는 hybrid로 움직인다는 점이다. NeurBench와 Are Learned DBMS Components Robust to Workload Drift?가 보여주는 질문도 같다.

Research shift
“learned optimizer가 더 좋은가?”보다 “workload와 분포가 바뀌어도 learned component를 신뢰할 수 있는가?”가 더 어려운 질문이 된다.
§6 · Approximate Query Processing

AI predicate의 가격이 AQP를 다시 부른다

과거 AQP가 대규모 OLAP latency를 줄이기 위한 기법이었다면, 이제는 LLM·AI predicate 한 번의 실행 자체가 비싸다는 이유로 approximation이 다시 중요해진다. 100x Cost & Latency Reduction: Performance Analysis of AI Query Approximation using Lightweight Proxy Models라는 제목의 연구는 expensive AI query를 lightweight proxy model로 근사하는 문제를 다룬다. probabilistic tensor algebra 기반 backend-agnostic AQP compiler와 update가 존재하는 approximate query processing도 프로그램에 포함된다.

\[\text{Query Cost}\leftrightarrow\text{Model Cost}\leftrightarrow\text{Approximation Error}\]

AI-native DB의 optimizer는 plan cardinality만 계산하는 것으로 끝나지 않는다. expensive model call을 어느 단계에서 수행할지, 어떤 predicate를 proxy로 근사할지, 어느 정도 오류를 허용할지를 함께 결정해야 할 가능성이 커진다.

Part III · §7–§8

Graph와 ML Systems: 데이터 시스템의 경계가 양쪽으로 넓어진다

한쪽에서는 graph query가 LLM/KG로 올라가고, 다른 쪽에서는 DB 연구가 foundation-model training과 serving의 바닥으로 내려간다.

§7 · Graph Query, Mining & Graph ML

Graph는 query에서 analytics, ML, LLM으로 층을 넓힌다

SIGMOD 2026에는 Graph Query & Mining, Graph Analytics & GNNs, Graph Search & Query, Graph Mining & Graph ML이 별도 세션으로 편성된다. densest subgraph, biclique enumeration/counting, subgraph matching, community search, core/nucleus decomposition, influence maximization 같은 고전 algorithm도 여전히 강하다.

동시에 dynamic/streaming graph로 초점이 옮겨간다. MAVIS, dynamic densest subgraph, continuous subgraph matching, streaming graphlet distribution이 대표적이다. 시스템 계층에서는 Bw-Graph와 RadixGraph가 storage representation을, FaaSBoard가 serverless/disaggregated graph processing을, ACGraph가 out-of-core processing을, NeutronHeter가 heterogeneous cluster의 distributed GNN training을, SWIFT가 single-machine large-scale temporal graph learning을 다룬다.

그리고 LLM-Powered Interactive Graph Search, multimodal LLM 기반 knowledge-graph completion이 등장한다.

\[\text{Graph Query}\rightarrow\text{Graph Analytics}\rightarrow\text{Graph ML}\rightarrow\text{LLM+KG}\]
§8 · Systems for ML

DB 커뮤니티가 AI 계산 자체를 시스템 문제로 다룬다

Systems for ML이라는 독립 research session은 상징적이다. TensorSocket은 deep-learning training의 shared data loading을, NeurStore는 DB 내부의 model management를, Mixtera는 foundation-model training data plane을, DFLOP은 multimodal LLM training pipeline optimization을 다룬다.

Inference도 마찬가지다. KV cache, prefix sharing, batching, scheduling, model selection이 buffer management·caching과 닮은 시스템 문제로 읽힌다. HotPrefix는 KV cache scheduling과 prefix sharing을 다룬다.

Database for AI

vector DB, RAG, multimodal storage, training data plane, model serving을 지원한다.

AI for Database

LLM/ML이 optimizer, tuner, entity matcher, test generator, data-preparation operator가 된다.

Part IV · §9–§10

Cloud와 Hardware: 시스템의 전제가 단일 서버에서 벗어난다

disaggregation, serverless, GPU, RDMA, NVM, NUMA가 특정 최적화가 아니라 architecture assumption으로 들어온다.

§9 · Cloud & Disaggregation

Compute, storage, memory를 떼어 놓고 다시 설계한다

O3-LSM의 disaggregated LSM, serverless cloud DB용 multi-tenant LSM-tree KV store, Marlin의 cloud DB autoscaling, geo-replicated DB의 optimistic concurrency control, hotness-aware consistent hashing이 프로그램에 포함된다. 산업 세션에서도 Azure SQL Hyperscale, tiered storage, large distributed DB, cloud data warehouse가 독립 세션을 구성한다.

\[\text{single-node}\rightarrow\text{distributed}\rightarrow\text{cloud-native}\rightarrow\text{disaggregated/serverless}\]

데이터 시스템은 더 이상 CPU와 local SSD가 고정된 한 대의 기계만을 전제로 하지 않는다. 자원의 위치와 결합 방식 자체가 optimizer와 storage engine의 설계변수가 된다.

§10 · Hardware-aware DB

GPU는 operator accelerator가 아니라 시스템 구성요소가 된다

CMANNS는 compute–memory disaggregation 환경의 GPU-accelerated vector graph-index construction을, VecFlow와 VecFlow-Chamfer는 GPU 기반 filtered/multi-vector search를, Geld는 consumer GPU를 이용한 graph decomposition을 다룬다. L3는 GPU-native learned compression format을, hardware offloading 연구는 stream-processing engine acceleration을 다룬다.

\[\{\text{memory hierarchy},\text{SIMD},\text{GPU},\text{RDMA},\text{NVM},\text{NUMA}\}\]

2026년의 성능 논문은 알고리즘 복잡도만으로 설명하기 어렵다. data placement, memory traffic, accelerator utilization, network fabric를 함께 다루는 hardware-conscious data systems가 하나의 큰 축이 된다.

Part V · §11–§13

신뢰성의 복귀: Testing, Privacy, Causality

AI가 DBMS 내부로 들어올수록 accuracy만으로는 부족하다. bug, attack, privacy, explanation, causality가 같은 시스템 품질 문제로 묶인다.

§11 · Database Testing

fuzzing을 넘어 reasoning과 LLM이 test generation에 들어온다

Testing, Tuning, & System OptimizationTesting, Robustness & Optimization이 별도 세션으로 배치된다. join implementation bug, equivalent prepared statement, differential testing, graph DB query synthesis, automatic bug reproduction이 연구된다. DBugScribe는 community bug report에서 DB bug를 자동 재현하는 문제를 다룬다.

LLM은 testing에도 들어온다. Accepted Papers에는 Automated Discovery of Test Oracles for Database Management Systems Using LLMs가 포함된다.

\[\text{query synthesis}+\text{equivalence reasoning}+\text{LLM}+\text{differential testing}\]
§12 · Privacy & Security

privacy guarantee에서 adversarial robustness로

Data Privacy & Security은 두 개의 독립 research session으로 편성된다. per-record differential privacy, local-DP graph analytics, user-level DP query processing, DP synthetic data, federated private synthesis가 포함된다.

여기에 poisoning attack 방어, PII re-identification 방지, attack investigation이 함께 나온다는 점이 중요하다. 질문은 “DP를 적용했는가?”에서 “실제 공격 환경에서도 privacy·utility·robustness를 동시에 유지하는가?”로 넓어진다.

\[\text{privacy}\times\text{utility}\times\text{robustness}\]
§13 · Data Quality, Repair, Causality

오류를 찾는 것에서 원인을 검증하는 것으로

Data Repair, Causality, & Explanation이라는 세션 이름 자체가 방향을 보여준다. disparate trend의 causal explanation, causal claim의 stress testing, monotonic trend deviation을 DB repair로 분석하는 문제, constraint discovery가 한 연구축에 놓인다. Data Structures, Compression, & Data Quality 세션에서는 time-series cleaning, integrity-constraint 기반 error detection, outlier semantics가 다뤄진다.

\[\text{Error Detection}\rightarrow\text{Repair}\rightarrow\text{Explanation}\rightarrow\text{Causal Validation}\]
Part VI · §14–§16

Integration, Streaming, Compression: AI 시대에도 DB의 바닥은 남는다

새로운 semantic layer가 올라갈수록 데이터 통합, 지속적 update, compact representation 같은 오래된 시스템 문제가 더 중요해진다.

§14 · Data Integration

task-specific matcher에서 foundation model operator로

Data Integration & Exploration에서는 LLM을 이용한 entity resolution, table context selection, automatic dataset description generation, domain-crossing entity matching, near-duplicate text alignment가 다뤄진다. Generalized Entity Matching with Adaptivity via Large Language Models가 보여주듯, task-specific matching model 대신 general-purpose foundation model을 data integration operator로 활용하려는 방향이 강하다.

동시에 semantic-aware multimodal analytics와 multi-modal DBMS가 등장한다. 앞으로 integration의 단위는 table만이 아니다.

\[\text{table}+\text{text}+\text{document}+\text{vector}+\text{graph}+\text{multimodal object}\]
§15 · Temporal, Spatial & Streaming

정적인 dataset보다 계속 변하는 state를 전제로 한다

Spatial, Temporal, and Streaming, Temporal, Spatial, & Streaming Data 세션에는 time-series compression, terrain shortest path, time-dependent road networks, streaming outlier detection, vector streams, streaming graph maintenance, spatio-temporal repair가 포함된다.

공통점은 static dataset보다 continuous update를 전제로 한다는 데 있다. vector database와 knowledge graph도 batch-built static index가 아니라 update가 계속 들어오는 system으로 설계해야 한다는 요구와 연결된다.

§16 · Compression & Data Structures

AI 주제가 커져도 DB의 바닥은 사라지지 않는다

LZ4 개선, adaptive sketch, range filter, minimal perfect hashing, floating-point compression, persistent adaptive radix tree, learned inverted-index compression 같은 고전적인 systems 문제가 여전히 강하다.

Learned index의 평가 기준도 변한다. self-designing index, mixed-workload hybrid learned index, metric-space similarity search용 learned index, workload drift robustness가 연구된다. 단순 lookup latency가 아니라 update·mixed workload·distribution shift·hardware locality까지 함께 본다.

AI-native system의 화려한 위층을 떠받치는 것은 결국 더 적게 읽고, 더 작게 저장하고, 더 안정적으로 갱신하는 데이터 구조다.
Part VII · Meta Trends & Research Map

SIGMOD 2026을 관통하는 다섯 문장

16개 세부 흐름을 압축하면 AI-native data system이라는 하나의 큰 architecture가 드러난다.

1 · AI와 DB의 관계가 양방향이 된다

\[\boxed{\text{Database for AI}}\qquad+\qquad\boxed{\text{AI for Database}}\]

한쪽에서는 vector DB, RAG, LLM training/serving을 DB가 지원한다. 다른 쪽에서는 LLM·ML이 optimizer, tuner, entity matcher, test generator가 된다.

2 · Semantic query가 relational query와 합쳐진다

SQL predicate, vector predicate, LLM predicate, graph query가 각각 별도의 silo에 머무르기보다 하나의 복합 query plan으로 통합되는 방향이다. 첨부 자료는 Beyond Relational: Semantic-Aware Multi-Modal Analytics with LLM-Native Query Optimization을 이 변화의 직접적인 사례로 든다.

3 · 핵심 metric이 cost–accuracy–latency로 바뀐다

LLM API, embedding, vector retrieval, semantic filtering의 비용이 크기 때문에 approximation, caching, proxy model, batching, cost-aware optimization이 핵심 연구문제가 된다.

\[\text{accuracy}\leftrightarrow\text{latency}\leftrightarrow\text{cost}\]

4 · Robustness가 learned DB의 필수 평가가 된다

workload drift, out-of-distribution query, adversarial attack, noisy federated data, update-heavy workload가 반복해서 등장한다. 평균 accuracy가 높은 모델보다 환경이 바뀌었을 때 얼마나 망가지지 않는가가 중요한 기준이 된다.

5 · Hardware/software co-design이 다시 중심에 선다

GPU, NUMA, NVM, RDMA, SSD, disaggregated memory, serverless infrastructure가 algorithm과 함께 설계된다. AI-native DB는 논리적 query plan과 물리적 hardware path를 더 강하게 연결한다.

Research Map · 10 axes

연구자 관점에서 본 SIGMOD 2026 핵심 연구지도

연구축2026년의 핵심 질문
LLM / Agentic DBLLM이 데이터 작업을 계획·실행·검증할 수 있는가
Vector / RAGbillion-scale semantic retrieval을 DB 수준에서 어떻게 최적화하는가
Semantic Query ProcessingSQL·vector·LLM predicate를 어떻게 하나의 query plan으로 결합하는가
Autonomous DBMSoptimizer·index·configuration을 ML/LLM이 얼마나 안정적으로 자동화할 수 있는가
Graph / Graph ML동적·대규모 graph와 GNN을 어떤 storage/execution architecture로 처리하는가
AI Systemsfoundation-model training·serving의 data plane과 memory hierarchy를 어떻게 최적화하는가
Cloud / Distributed DBdisaggregation·serverless·RDMA·geo-replication 환경에서 일관성과 성능을 어떻게 달성하는가
Reliability / SecurityLLM 시대의 DB bug·attack·privacy·OOD workload에 어떻게 대응하는가
Data Qualityrepair·causality·explanation을 어떻게 통합하는가
Hardware AccelerationGPU/NVM/NUMA/SSD를 고려해 DB operator와 index를 어떻게 재설계하는가
Synthesis · One sentence

관계형 DBMS에서 AI-native data system으로

Program-level interpretation
SIGMOD 2026은 관계형 데이터를 빠르게 처리하는 DBMS에서, 관계형·벡터·그래프·문서·멀티모달 데이터를 통합하고 LLM/agent가 계획·검색·최적화하며 GPU·cloud·disaggregated infrastructure 위에서 실행되는 AI-native data system으로 데이터베이스 연구의 중심이 넓어지고 있음을 보여준다.

특히 RAG·Agentic AI·Knowledge Graph·Graph ML을 함께 보는 연구자에게 중요한 메시지는 “새 RAG 알고리즘 하나”보다 retrieval–planning–query optimization–vector/graph index–LLM serving을 아우르는 end-to-end data-system architecture가 더 큰 연구공간이라는 점이다. 이 문장은 공식 프로그램을 종합한 해석이며, 특정 한 논문이 독립적으로 입증한 결론은 아니다.

다음 연구로 확장할 세 갈래

Taxonomy

SIGMOD 2026 전체 논문을 약 15–20개 세부 연구분야로 분류하고 제목·저자·핵심기술·분야를 정리하는 program atlas.

Deep Dive

LLM/RAG/Agentic AI/Graph 관련 논문만 추출해 retrieval, orchestration, semantic query, graph grounding을 깊게 비교하는 분석.

Longitudinal

SIGMOD 2025 ↔ 2026을 비교해 AI-native DB, vector/RAG, robustness, hardware-aware systems의 변화속도를 측정하는 trend study.

References · Primary sources in the attachment

공식 프로그램 출처

[01]
The 2026 ACM SIGMOD/PODS Conference — Accepted Papers for SIGMOD
SIGMOD 2026 · Official accepted papers
[02]
The 2026 ACM SIGMOD/PODS Conference — SIGMOD Detailed Program
SIGMOD 2026 · Official detailed research program
이 게시물의 논문명·세션명·연구축은 첨부 메모가 위 두 공식 페이지를 근거로 정리한 내용을 재구성했다. 개별 논문 full text를 별도로 다시 검증하거나 실험 결과를 추가하지 않았다.