一个反直觉的实验结果
腾讯混元语音团队联合多所高校最近发布了一个实时交互Agent模型 Gander,最有意思的不是它能做什么,而是它在一个基准测试上的表现组合:在 Full-Duplex-Bench v3 的全部 100 个场景中,它的说话时机判断全部正确,打断用户的比例仅 8%——作为对比,GPT-Realtime 是 13.5%,最弱的竞品接近 48%。
但与此同时,它的任务准确率略低于全部竞品,包括最弱的那个。
一个在时机把握上碾压所有商业系统的模型,却在任务完成质量上垫底。这个看似矛盾的结果,恰恰是理解下一代 Agent 架构的钥匙。
单模型的死结:快与深不可兼得
对话和任务执行对计算的要求是根本冲突的。
对话需要毫秒级的反应:你说到一半停顿了,对方要知道你是没说完还是在思考;背景有噪音,要知道该闭嘴还是继续。这些判断必须在几百毫秒内完成,否则交互就会变得「不像人」。
而任务执行——搜索文件、修一个 bug、规划一次重构——需要的是深度推理,动辄数十秒的思考时间。
如果用单一模型同时承担两个职责,你只能在两个方向上妥协:要么模型够快但推理浅,要么推理够深但对话卡顿。今天大多数语音助手选择了前者,这就是为什么和它们说话总有一种「回合制游戏」的感觉:你说完,它沉默,然后逐字吐出回答,中间你插不进话。
Gander 团队的解法是彻底放弃单模型幻想,把系统拆成两层:
- 小脑:一个相对小的模型,以 1 秒为单位对对话流做分段决策——这一秒该听、该说、还是该停。它不做深度推理,只管时序,用最近约两分钟的对话作为工作记忆,不需要独立的语音端点检测模块。
- 大脑:后台执行复杂任务的推理系统。关键在于,这是一个可插拔的插槽——测试中插的是 GPT-5.6 系列的某个模型,但你完全可以换成 Codex 或 Claude Code,且不需要重训对话模型。
这个设计带来一个直接后果:底层大脑每升级一次,整个系统免费获得一次能力跃迁。对话层和推理层各自独立演进,互不拖累。
为什么任务准确率垫底反而不是问题
回到开头的矛盾。Gander 任务准确率低,研究者自己的解释是:评测打分的是整个系统,语音识别和语音输出的误差都被算进去了;如果直接给大脑喂文本,它的得分要高得多。此外,为了训练流畅的对话,模型在感知精度上做了牺牲——在数数、定位图中物体这类任务上,它甚至不如自己的基座模型。
换句话说,短板不在架构,而在「小脑-大脑」之间的信息传输损耗,以及多模态训练目标之间的相互挤压。这是工程问题,不是范式问题。
而范式本身——时机判断 100% 正确——才是真正难以追的东西。Anthropic 的一项分析发现,有经验的用户在约 9% 的工作步骤中会打断 Claude Code,新手约 5%。打断是真实交互的常态而非异常。一个不能优雅处理打断的系统,无论任务能力多强,交互体验的上限已经被锁死了。
这不是孤例:分层正在成为行业通行解法
把视野放大一点,会发现 Gander 只是一个更普遍趋势中的一次亮相。
OpenAI 的 GPT-Live 同样把对话和推理分离,网络搜索和 Agent 任务交给后台模型,聊天继续进行。Sakana AI 的 Fugu 是一个独立的小模型,专门负责从可扩展的模型池里调用其他模型。再看今天的另一条新闻,Runway 的实时流式视频生成——用户边描述边看视频像直播一样流式输出,逐帧生成的小模型负责跟帧率,世界模型 GWM-1 在后面扛质量,用自生成的带瑕疵数据训练模型自我纠偏、抑制误差累积。
三个不相干的领域——语音 Agent、多模型编排、视频生成——收敛到了同一个结构:一个快的、小的、管时序的组件,在前台;一个慢的、大的、管质量的组件,在后台;两者解耦,可独立升级。
这几乎就是操作系统设计的复刻:中断处理必须是快的、确定性的、常驻的;而复杂的计算可以慢,可以排队,可以换实现。当年的操作系统把「响应中断」从应用程序中剥离出来交给内核,今天的 Agent 系统正在把「响应时机」从推理模型中剥离出来交给专用组件。
延迟的性质变了:从交付属性到交互属性
这个趋势背后有一个更深层的变化:延迟的定义被改写了。
在回合制范式中,延迟是一种交付属性——你提交任务,等待,拿到结果,总时间越短越好。优化手段很直接:推理加速、流式输出、投机解码。所有优化都指向「把整段时间压短」。
但在全双工范式中,延迟变成了一种交互属性。重要的不再是总时间有多短,而是在每一个交互时刻,系统是否做出了正确的时序决策:现在该说还是该听?用户的停顿是结束还是思考?新任务来了该立刻确认还是先记下来?
这类决策无法通过「整体加速」来解决。一个推理再快的模型,如果以回合制的假设运行,永远无法在你说到一半时判断出「你在等我回应」。时序决策需要的是专门的架构位置——这正是「小脑」存在的意义。
对 Agent 开发者而言,这意味着一个实际的设计维度变化:响应时机的编排能力,正在成为与推理能力同级的架构考量。你的系统里有没有一个专职的、以亚秒级粒度运行的时序决策组件?你的推理层能不能在不阻塞对话的情况下被替换、升级、回滚?这些问题在一年前还只是语音团队的事,现在正在变成所有实时 Agent 的必答题。
冷静的一面:这条路还没走通
需要泼冷水的地方也很明确。
首先是评测缺失。Gander 团队自己承认,目前没有针对这类系统的标准评测方法,他们只能借用为回合制语音助手设计的基准。一个范式如果没有专属的度量衡,就很难做系统性比较和迭代——时机和任务能力的权衡点在哪里,现在全凭各家手感。
其次是规模化未知。小模型做时序决策的效果出乎意料地好,但当对话历史超出两分钟、多模态输入叠加、多个后台任务并行时,这个架构的扩展性还没有答案。
最后是拼装复杂度。分层系统意味着更多的组件、更多的接口、更多的一致性维护成本。Gander 在感知精度上的退化已经提示了代价:优化对话流畅性时,其他能力是被挤压的。工程上如何隔离这些挤压效应,是所有分层系统的长期负担。
结语
Gander 值得关注的点,不在于它今天比 GPT-Realtime 强或弱,而在于它用一次干净利落的架构实验证明了:交互时机和任务智能可以、而且应该被拆开解决。
当行业里最强的一批玩家——OpenAI、腾讯、Runway、Sakana——在互不商量的情况下收敛到同一个分层结构时,这通常不是巧合,而是约束条件下的必然解。操作系统史上演过的那一幕,正在 Agent 架构上重演:快慢分离,各司其职,独立演进。
对于正在构建 Agent 系统的团队,我的建议是:别再问「哪个模型最适合我的 Agent」,开始问「我的系统里,谁负责时序,谁负责智能,它们之间的契约是什么」。前者是回合制时代的问题,后者是全双工时代的问题。而时代已经在换挡了。