AI Research Blog / Omni Interaction AgentGander · 2026-09-13
Full-Duplex · Omni Perception · Agent Orchestration · Long-Horizon Work

턴을 기다리는 비서에서,
대화하며 일하는 지속형 협업자로

Gander: From Turn-Taking Assistants to Full-Duplex Omni Interaction Agents

SOURCE · Omni Interaction Agent Technical Report · arXiv:2609.08977v2 · 28 pages
FRONT CEREBELLUMPerceive · Listen · Speakstreaming audio · video · interruptionlow-latency control tokensAGENT ORCHESTRATION RUNTIMETask Ledger + Gatewaybind · track · fence · validate · deliverProject · Task · Run · Event · DeliveryLIVE INTERACTION ↔ ASYNC EXECUTIONBACK BRAINReason · Retrieve · ActCodex / Claude Code class workerslong-horizon task executionUSER CAN KEEP TALKING WHILE THE TASK KEEPS RUNNING

Gander가 겨냥하는 문제는 음성입력이 아니다. 사람과 AI가 대화의 턴을 번갈아 기다리는 구조 자체를 깨고, AI가 보고 듣고 말하는 동안 장기 작업도 동시에 계속 수행하게 만드는 것이다.

논문의 해법은 두 계층을 결합한다. 저지연 상호작용은 Front Cerebellum이 담당하고, 복잡한 reasoning과 tool-based execution은 Back Brain이 비동기로 수행한다. 중간의 Agent Orchestration Runtime은 이 둘을 단순 연결하는 메시지 버스가 아니라 task state, permission, worker, memory, delivery를 관리하는 harness이다.

Source Boundary

이 글은 28페이지 전체와 Figure 1-5, Table 1-6을 검토해 재구성했다. 성능 수치는 논문의 평가조건을 그대로 보존한다. 논문이 직접 실험하지 않은 장기 안전성이나 일반지능 수준으로 주장을 확장하지 않는다.

Training corpus2.7M

speech, audio-visual, agentic, robustness/negative data

Streaming context128 chunks

1초 단위 chunk, 약 2분 rolling receptive field

Full-Duplex Bench100%

Take-turn, 100 scenarios

Interrupt8.0%

표의 비교 시스템 중 가장 낮은 premature speaking rate

Part I · Paradigm

왜 turn-based assistant만으로는 협업자가 되기 어려운가

사람은 듣기와 말하기를 겹치고, 화면을 보며, 중간에 수정하고, 작업결과가 나오기 전에 다시 묻는다.

기존 음성 assistant는 사용자가 발화를 끝낸 뒤 VAD나 ASR이 경계를 정하고 모델이 응답하는 request-response 구조에 가깝다. 이 구조는 질문응답에는 충분하지만 hesitation, pause, overlapping speech, interruption, backchannel, multi-party conversation처럼 실제 대화의 동적인 상태를 모델 내부에서 다루기 어렵다.

관련 연구는 세 방향으로 진화해 왔다. BayLing-Duplex·Qwen-Audio-3.0-Realtime·Audio Interaction Model·Seeduplex·GPT-Live 같은 연구는 언제 듣고 언제 말할지를 모델의 autoregressive decision으로 내부화했다. Qwen Omni·MiniCPM-o 4.5·JoyAI-VL-Interaction·SeedRealtime은 visual stream까지 결합해 omni interaction을 확장했다. Qwen Audio Agent, GPT-Live+Codex, Claude Voice Mode 계열은 continuous voice와 backend task execution을 결합하는 방향으로 나아갔다.

하지만 논문이 제기하는 핵심 문제는 여전히 남는다. 대화 중 사용자가 새 제약을 추가하거나 작업을 취소하면 어떻게 해야 하는가. agent가 몇 분 동안 코드를 고치는 동안 사용자는 계속 대화할 수 있는가. 화면의 변화가 task state에 영향을 주면 누가 이를 반영하는가. Gander는 이 셋을 interaction state, environment state, task state의 공동관리 문제로 본다.

핵심 전환은 “speech를 agent의 입출력 인터페이스로 붙이는 것”이 아니라, 실시간 상호작용과 비동기 작업실행을 하나의 지속적 process로 만드는 데 있다.

Part II · Brain-Cerebellum

반응속도와 긴 추론을 한 모델에 강제로 넣지 않는다

Figure 2의 구조는 세 요소로 나뉜다. Front Cerebellum은 streaming speech·camera·screen input을 계속 받아 listen, speak, brief feedback, interruption, tool invocation을 결정한다. Back Brain은 information retrieval, code/file manipulation, document processing 등 긴 작업을 수행한다. Agent Orchestration Runtime은 둘 사이의 transport와 execution state를 관리한다.

Cerebellum은 low latency, Brain은 long horizon이라는 계산 요구의 차이를 architecture 자체에서 분리한다. simple conversation과 short-horizon search는 front가 직접 해결하고, multi-step reasoning·external tool use·sustained execution은 back brain으로 넘긴다.

Back Brain은 training-free plug-and-play component이다. 논문은 Codex나 Claude Code 같은 general-purpose agent를 예로 든다. 평가에서는 Codex worker provider를 통해 GPT-5.6을 사용한다. 이 설계는 stronger reasoner를 core interaction model 재학습 없이 교체할 수 있다는 장점을 가진다.

Analysis

이 구조의 의미는 모델 하나의 크기보다 계층 간 계약이 중요해진다는 데 있다. front가 언제 delegate하고 어떤 context를 넘기며, back의 중간결과를 언제 말로 전달할지가 전체 사용자경험을 결정한다.

Part III · Streaming Thinker-Talker

대화의 ‘턴’ 대신 1초짜리 세계상태 chunk를 처리한다

Perception을 기다리지 않고 계속 갱신한다

Front Cerebellum은 visual stream과 acoustic stream을 동시에 인코딩한다. visual pathway는 SigLIP 기반 any-resolution slicing 뒤 query-based resampler를 사용해 raw patch grid 대비 약 16배 줄인 visual token을 만든다. realtime budget을 위해 최대 해상도는 448×448로 제한한다.

audio pathway는 약 50 frame/s의 streaming speech feature를 5× temporal downsampling해 약 10 audio tokens/s로 낮춘다. 목적은 audio가 shared context budget을 과도하게 점유하지 않으면서 phonetic·prosodic cue를 보존하는 것이다.

한 chunk 안에서 먼저 ‘말할지’를 정하고 그 다음 ‘무엇을 말할지’를 정한다

Figure 4의 핵심은 audio·video input과 model output을 하나의 causal token stream에 flatten하는 것이다. 연속 interaction을 1초 단위 window로 나누고 각 chunk를 perceptual tokens → control token → optional text tokens 순서로 직렬화한다.

CHUNK C_t = [ VIDEO_t + AUDIO_t ] → CONTROL_t → OPTIONAL TEXT_t CONTROL ∈ { LISTEN, SPEAK, INTERRUPT } CONTEXT = 128 CHUNKS ≈ 2 MINUTES (SLIDING WINDOW)

LISTEN이면 현재 window에서 아무 말도 하지 않는다. SPEAK이면 text를 생성해 speech synthesis로 보낸다. INTERRUPT이면 진행 중인 발화를 중단한다. proactive behavior가 외부 VAD trigger가 아니라 chunk-level prediction 자체에서 발생한다는 것이 중요하다.

speech generation은 semantic planning과 acoustic realization을 분리한다. LLM은 text-domain reasoning을 유지하고, 작은 autoregressive speech-token decoder와 streaming flow-matching decoder가 waveform을 생성한다. reference audio에 따라 zero-shot voice control도 가능하며 waveform은 utterance 전체를 기다리지 않고 chunk-wise로 출력된다.

Part IV · Orchestration Runtime

대화 중에도 task는 살아 있고, task가 바뀌면 execution lineage도 바뀐다

Figure 3은 사용자가 오류수정을 맡긴 뒤 대화를 계속하고, 실행 중 “Python 3.12 compatibility도 유지하라”고 제약을 추가한 뒤 결과를 전달받는 흐름을 보여준다. 이때 단순 메시지 전달이 아니라 task lifecycle과 stale execution을 구분하는 state machine이 작동한다.

Front Cerebellum이 runtime에 보내는 세 핵심 operation은 다음과 같다.

task_start

새 background task를 만들고 현재 user turn과 연결한다.

task_send

추가 지시를 기존 task에 보낸다. main은 primary execution을 수정하고 fork는 read-only side inquiry를 만든다.

task_resolve

cancel, allow_once, allow_session, deny로 task lifecycle과 permission을 결정한다.

Runtime의 Gateway는 Project, Task, Run, WorkerEvent, Delivery 다섯 persistent entity를 관리한다. task state transition, worker scheduling, workspace isolation, concurrency, permission, delivery가 이 계층의 책임이다.

두 control mode도 제공한다. lean mode는 front의 분류를 바로 실행해 latency와 failure point를 줄인다. coordinator mode는 별도 control-plane model이 reasoning intensity, questioning policy, permission policy, delivery strategy를 선언한다. 다만 coordinator는 file/shell/network를 직접 만지지 않고 gateway의 structured validation을 통과해야 한다.

Source Fact

Runtime은 task_start/task_send/task_resolve를 transport layer에서 확인된 최종 user turn에 bind한다. 이는 model-generated tool parameter가 사용자 의도를 독립적으로 바꾸지 못하도록 하는 grounding 장치이다.

Back Brain은 runtime-specific interface인 context_fetch, memory_search, share를 사용할 수 있다. 각각 현재 lineage context, cross-session multimodal memory, 검증된 progress/result 전달을 담당한다.

Part V · Data Curriculum

2.7M 데이터는 ‘무엇을 말할지’보다 ‘언제 말하고 언제 침묵할지’를 가르친다

FamilyCategoryExamplesFractionMain supervision
Speech InteractionFoundational dialogue539.4K20.00%General spoken dialogue
Basic capabilities26.9K1.00%Math, instruction following, logic
InteractionSpeech260.8K9.67%Full-duplex turn-taking, interruption, multi-turn interaction
Spoken QA165.1K6.12%Short-form spoken QA
Simultaneous speech translation19.0K0.70%Incremental bilingual translation
Audio-Visual InteractionStreaming video QA / narration / proactive response1.1M40.66%Temporal event grounding and realtime visual interaction
Agentic InteractionAudio agentic interaction320.2K11.87%Speech-driven delegation and lifecycle interaction
Omni agentic interaction36.0K1.33%GUI-based multimodal agent interaction
Tool-assisted reasoning3.4K0.13%Tool-grounded spoken STEM reasoning
Robustness & NegativeIrrelevant video robustness116.2K4.31%Ignore irrelevant visual context
No-command environments40.0K1.48%Remain silent under nondirected input
Anti-interference64.7K2.40%Noise and overlapping distractors
Multi-party interaction8.8K0.33%Speaker and addressee tracking
Total2.7M100%

Duplex behavior는 별도 supervision으로 합성한다

Speech interaction은 corpus의 약 37%이다. 11.2K scene/topic seed와 45개 everyday/task scenario를 사용하고, 8~18 turns·총 발화 96초 이하로 대화를 합성한다. 기존 dialogue를 spoken style로 변환할 때는 markdown, code, URL, 수학표기, 지나치게 긴 발화를 걸러낸다.

InteractionSpeech는 competitive interruptionsupportive backchannel을 명시적으로 구분한다. backchannel은 Chinese 8자/English 6단어 이하 조건과 bilingual lexicon을 사용하며, lexicon은 중국어 266개·영어 170개 표현, 11개 intent category로 구성된다. rendering 단계에서는 onset·duration·overlap interval을 explicit timing supervision으로 만든다.

Audio-visual interaction은 JoyAI-VL, LiveCC, Streamo에서 수집한 뒤 Qwen3.5-297B-A17B로 temporal alignment를 보정해 약 1.1M pair를 만든다. target response는 DeepSeek-V4-Pro로 평균 약 8 tokens/s가 되도록 조정한다.

Figure 5의 agentic data pipeline은 long-horizon execution 중 multi-turn request, constraint update, progress query, cancel task, final delivery를 backend state와 interleave한다. audio-agentic 320.2K와 omni-agentic 36K는 user speech, Cerebellum response, Back Brain trajectory를 함께 합성하고 task validity, interaction coherence, lifecycle completeness, query validity, TTS/timeline quality로 filter한다.

Part VI · Experimental Evidence

Gander는 interaction timing을 얻었지만 task accuracy와 표현품질에서는 비용을 지불한다

ModelToolSel↑ArgAcc↑RespQual↑Pass@1↑Take-turn↑Interrupt↓Filler↓
GPT-Realtime0.8760.6800.7920.60096.013.516.9
Gemini Live 3.10.8170.5880.7180.54078.019.231.7
Cascaded Whisper→GPT-4o→TTS0.8030.5620.6000.450100.033.026.9
Grok0.7970.5420.6170.43094.025.544.3
Ultravox v0.70.7940.5130.5100.41096.047.988.0
Gemini Live 2.50.7860.5930.5540.49092.014.18.9
Gander0.7590.5030.4900.400100.08.051.6
Gander, back brain only0.9340.5900.7400.520

Full-Duplex-Bench v3의 100개 scenario에서 Gander는 Take-turn 100%와 Interrupt 8.0%로 timing 측면에서 가장 강한 결과를 낸다. 반면 Pass@1 0.400, RespQual 0.490으로 task accuracy는 비교군보다 낮다. 상호작용의 자연스러움과 task correctness를 동시에 얻었다고 해석하면 안 된다.

Back Brain만 transcript에서 직접 구동하면 ToolSel 0.934, RespQual 0.740, Pass@1 0.520으로 올라간다. 논문은 이를 execution tier 자체보다 delegation decision과 speech/ASR path가 end-to-end 정확도의 주요 병목일 수 있음을 보여주는 진단으로 해석한다.

Full-duplex modelLlama Q.Web Q.AlpacaEvalSD-QA
Moshi 7B62.2026.302.0115.01
Audio-Interaction 3B67.3154.344.2852.14
Gander 9B75.6059.303.9646.84

SpokenQA에서는 full-duplex group을 이끌지만 VoiceBench open-ended response와 accented speech 관련 지표에서는 Audio-Interaction보다 낮다. 논문은 short conversational turn 중심의 interaction supervision이 긴 서술형 응답과 accent coverage를 충분히 가르치지 못한 결과로 해석한다.

BenchmarkGander AVVideo onlyAudio onlyFusion gain
WorldSense49.6244.6143.32+5.01
Daily-Omni78.5359.4057.81+19.13
Overall57.5448.6647.29+8.88

MiniCPM-o 4.5 초기화와 비교하면 WorldSense는 55.70→49.62로 6.08p 낮아지고 Daily-Omni는 80.20→78.53으로 1.67p 낮아진다. 동시에 audio-video joint input의 fusion gain은 WorldSense +5.01p, Daily-Omni +19.13p이다. interaction training은 시간축의 audio-visual alignment는 잘 보존하지만 static fine-grained attribute inspection에는 trade-off를 남긴다.

Evaluation Detail

Full-Duplex-Bench는 실제 synthesized speech를 ASR로 다시 transcription한 end-to-end 결과다. Omni understanding 평가는 back brain 없이 front cerebellum만, greedy decoding과 exact letter matching으로 측정한다. 서로 다른 표의 숫자는 직접 비교 가능한 하나의 metric이 아니다.

Part VII · Open Problems

Omni Interaction Agent는 모델보다 시스템 경계에서 더 많은 미해결 문제를 남긴다

Data & Model Scaling

agent invocation과 conversational behavior가 data distribution에 민감하다. 복잡한 omni scenario에서 robustness/generalization을 더 검증해야 한다.

Stable Post-Training

현재 Gander는 long-horizon omni agent scenario에서 on-policy distillation이나 RL을 충분히 최적화하지 않았다. reward design, credit assignment, stability가 열려 있다.

Brain–Cerebellum Communication

현재 전달은 주로 ASR-derived text와 relevant final video frames에 의존한다. 더 풍부한 structured bidirectional communication이 필요하다.

Memory & Long Context

long multimodal history, tool calls, evolving task state를 장시간 유지·검색하는 효율적 memory mechanism이 필요하다.

Unified Evaluation

현재 benchmark는 understanding, duplex interaction, agent execution을 따로 본다. Brain–Cerebellum coordination을 평가하는 unified benchmark가 없다.

End-to-End Bottleneck

Full-Duplex accuracy gap과 51.6% filler rate는 user-facing timing과 backend task quality를 함께 최적화하기 어렵다는 현재 한계를 보여준다.

가장 흥미로운 지점은 Gander가 하나의 monolithic “더 똑똑한 voice model”을 제안하지 않는다는 데 있다. 실시간 상호작용 모델, 장기 reasoning agent, deterministic orchestration state를 분리한 뒤 하나의 persistent collaboration loop로 묶는다.

이 구조는 향후 desktop assistant, coding companion, multimodal workplace agent, physical/embodied assistant로 확장될 수 있는 시스템 설계 패턴을 제공한다. 그러나 논문 자체가 말하듯 아직 초기 exploration이다. 실제 장기 배포의 신뢰성은 memory, post-training, permission, evaluation, cross-component communication이 얼마나 체계적으로 개선되는가에 달려 있다.

Gander의 가장 중요한 메시지는 “AI가 사람처럼 말한다”가 아니다. 사람과 대화하는 동안 작업을 멈추지 않고, 작업이 진행되는 동안에도 사람이 계속 개입할 수 있게 만드는 것이다.

References

Primary sources and evaluation assets

01
Omni Interaction Agent Technical Report

Gander의 architecture, data construction, experiments, future work를 다루는 원문. arXiv:2609.08977v2.

02
Gander Project Page

논문이 제시한 project page.

03
Gander Code Repository

논문이 제시한 공개 code repository.

04
Full-Duplex-Bench v3

논문의 end-to-end full-duplex tool-use 평가에 사용된 benchmark.