← 文章 / AI技术
The Decoder 3小时前 · 2026-09-21 01:27:45 · 4 阅读

腾讯 Gander:在后台处理任务时保持实时对话

图片说明

要点

  • 腾讯的 Gander 旨在边进行实时对话、边在后台处理复杂任务。它能同时处理语音、图像和文本,用户可随时打断。
  • 一个"小脑"逐秒管理对话,一个可替换的"大脑"负责复杂的 agent 任务。这种拆分设计是为了在保证响应速度的同时不牺牲规划深度。
  • 测试中,Gander 打断用户的次数少于竞品模型,但任务准确率落后,且在视频和音频理解方面存在短板。团队计划开源模型权重和训练数据,代码的 GitHub 仓库已上线。

腾讯的研究模型 Gander 把实时对话和 AI agent 能力结合在一起:由"小脑"负责对话,可替换的"大脑"处理复杂任务。用户可以随时打断,但测试显示,对话节奏与任务准确率之间存在权衡。

腾讯混元语音团队联合多所高校的研究人员推出了 Gander,这是一个能在处理复杂任务的同时持续聊天的 AI 模型。技术报告显示,它可同时接收语音、图像和文本输入。

研究人员指出,如今的语音助手大多只能和用户一问一答、轮流说话。而真实对话中,人们会互相打断、即时反馈,甚至边说边听。Gander 的设计目标正是应对这种你来我往的交流:它能持续处理视频、语音和文本,即使在说话时也不例外。用户可以随时插话,模型也会主动追问或汇报任务进展,无需用户提示。

腾讯的企鹅吉祥物坐在显示器前,周围环绕着五个 Gander 使用场景。这些场景包括询问屏幕内容、对话期间的后台代理工作、反馈与中断、嘈杂环境下的群组对话,以及关于视觉内容的主动警报。
Gander 旨在在实时对话的同时处理后台任务,例如修复 bug 或等待特定幻灯片出现。| 图片来源:腾讯

Gander 在“大脑”工作期间维持对话

对话需要即时响应,但搜索文件或编写代码需要时间进行规划。研究人员认为,单一模型必须在响应速度和推理能力之间寻求平衡,因此 Gander 将工作拆分给两个角色。

借鉴人体解剖学概念,他们将其称为“小脑”和“大脑”。“小脑”负责实时对话,而“大脑”则处理后台的推理和复杂任务。

“大脑”部分可以替换为 Codex 或 Claude Code 等代理系统,且无需重新训练对话模型。在测试中,OpenAI GPT-5.6 系列中一款未具体命名的模型承担了这一角色。随着底层模型的改进,整个系统都能受益。

一张工作流图表展示了四个阶段:委托、继续对话、修订任务和交付结果。顶部显示对话摘录,中间显示任务状态,底部显示后台代理的步骤。过时的运行会被丢弃并标记为“Fenced”。
当后台代理修复 bug 时,用户可以继续提问,并在任务中添加 Python 3.12 兼容性要求。| 图片来源:腾讯

Gander 时序准确,但任务准确率稍逊一筹

Gander 将对话切分为一秒的片段,由小脑模块根据用户是否打断来决定何时聆听、发言或停止。它无需单独的模块来检测语音起止,而是利用过去两分钟的对话内容作为记忆基础。

目前尚无专门针对 Gander 这类模型的测试,研究人员因此采用了现有的基准测试。报告指出,在测试语音助手在不同任务场景中表现的全双工基准 Full-Duplex-Bench v3 上,Gander 的时机把握最佳。

Gander 在所有 100 个场景中都能恰当时机开口,在 8% 的情况下打断用户。相比之下,GPT-Realtime 的打断率为 13.5%,而表现最弱的竞品则接近 48%。报告称,Gander 使用相对较小的模型,却能与 GPT-Realtime、Gemini Live 和 Grok 等商业系统相竞争。

Full-Duplex-Bench v3 针对 GPT-Realtime、Gemini Live 3.1 和 2.5、级联流水线、Grok、Ultravox v0.7 和 Gander 的测试结果。表格详细列出了工具选择、参数准确性、响应质量、Pass@1 以及三个交互指标。
Gander 打断用户的频率低于所有受测系统,但其任务准确率略低于表现最弱的竞品。 | 图片来源:腾讯

在任务准确率方面,Gander 略逊一筹。研究人员表示,部分原因在于测试是对整个系统评分,因此语音识别和输出误差都会被计入。如果直接提供文本输入,其“大脑”部分的得分要高得多。

视频和音频理解能力也受到影响:在一项测试中,Gander 的表现甚至不如其基础模型。研究人员将此归咎于训练偏向流畅对话而非精确感知,这影响了诸如在图像中计数和定位物体等任务。

腾讯计划发布 Gander 的权重和训练数据

据报道,Gander 的训练数据约包含 270 万个样本,其中一部分教它在有背景噪音或群里没人跟它说话时保持安静。

研究人员表示,这项工作仍处于早期阶段。如何扩大 Gander 的规模还是个未解的问题,目前也没有评估这类系统的标准方法。

团队计划在完成"开源发布流程"后公开模型权重和训练数据。代码的 GitHub 仓库已经上线,项目页面上也提供了演示。

越来越多公司开始把 Agent 工作拆分给多个模型

Gander 是继腾讯 7 月发布 Hy3 之后的又一动作。Hy3 是一款开源语言模型,据报道已大幅缩小与竞争对手的差距,在 Agent 任务上表现尤其突出,目前已应用于 WorkBuddy、元宝和微信。此外,在北京叫停 Meta 的收购之后,腾讯还在谈判收购 Agent 创业公司 Manus 的最大股权。腾讯认为这笔交易符合自身规划,包括在微信中嵌入 Agent。

其他公司也在用编排器(orchestrator)把任务分派给不同模型。OpenAI 的 GPT-Live 把对话和推理分开,在聊天继续进行的同时,把网页搜索和 Agent 任务交给后台模型处理。Sakana AI 的 Fugu 则是一个可从可扩展的模型池中调用其他模型的独立语言模型。OpenAI 还在测试能够主动创建后续任务、无需用户提示就主动联系的主动式 Agent

如何处理中断、避免延迟仍是现实挑战。一项 Anthropic 的分析显示,资深用户在工作流程中的打断率约为 9%,而新手用户约为 5%。据一项调研报告,团队在开发对话语音和聊天 agent 时,延迟问题尤为突出。

原始来源: The Decoder

评论 (0)