📰 AI洞察日报

2026年9月16日 · 星期三
👁 阅读量加载中…
🏆 头条

Google发布Gemini 3.8 Live:语音Agent登顶Speech-to-Speech榜,价格仅为GPT-Live-1十分之一

Google DeepMind发布音频模型Gemini 3.8 Live及3.8 Live Extended Thinking,面向开发者通过Gemini API与AI Studio提供。Extended Thinking变体在Artificial Analysis语音对语音榜以82.6%登顶,超越OpenAI最新GPT-Live-1;支持97种以上语言,可在说话同时后台调用API并处理视觉输入。定价音频输入每分钟0.005美元、输出0.018美元,一小时语音对话约1.38美元,而OpenAI为至少3美元,但OpenAI全双工对话仍更自然。

📰 今日动态
1

RSIAgent让开源模型递归自我提升:不更新参数,OSWorld 2.0达78.98%超越GPT-6 Astra

Aether AI发布RSIAgent框架,让AI通过自主探索新环境实现递归自我提升,全程不更新模型参数。开源模型Kimi-K3、GLM-5.3在OSWorld 2.0达到78.98%、Agents' Last Exam达84.82%,在多项高难度基准上超越GPT-6 Astra等闭源模型。代码与论文已开源,为「经验积累优于参数训练」路线提供了新证据。

2

Apple重构版Siri AI正式发布:基于Google Gemini,但欧盟用户无缘

Apple在多年延期后开始交付重构的「Siri AI」,底层采用Google Gemini模型,部分端侧运行、部分经云端处理。该版本暂不对欧盟用户开放,延续Apple因DMA监管在欧盟延迟AI功能的策略。这是Gemini首次大规模进入iOS核心入口,也意味着Apple放弃自研前端模型、转向供应商集成路线。

3

NVIDIA详解Groq 3 LPX确定性执行:Vera Rubin上实现高交互低功耗推理

NVIDIA发布技术博客,介绍Groq 3 LPX确定性执行架构如何在Vera Rubin平台上驱动高能效、高交互性推理。确定性执行消除了调度不确定性,使延迟可预测,适合大规模并发语音与Agent工作负载。该文是理解下一代AI工厂「功耗墙」下推理架构演进的一手材料,与NVIDIA同期发布的NVLink 6多层容错设计共同构成Vera Rubin软件栈拼图。

4

Agility发布人形机器人Digit 5:可与人类并肩工作,无需安全围栏

Agility Robotics发布面向仓储与工厂场景的第五代人形机器人Digit 5,宣称可在无安全围栏防护的情况下与人类共同作业。相比前代,Digit 5在安全认证与作业灵活性上进一步逼近工业部署门槛,是「人形机器人从示范区走向产线混行」路线的最新节点。

5

Meta开放WhatsApp Business MCP服务器:编码Agent可直接配置商家账号

Meta推出WhatsApp Business MCP服务器,开发者可用Claude、Cursor、Codex、ChatGPT等AI编码Agent自动完成商家账号设置、消息模板与业务接入等原本繁琐的配置流程。MCP生态从开发者工具扩展到商业基础设施,中小商家接入门槛显著降低。

6

AEF-1第三方评估标准成形:xAI、OpenAI、Anthropic联合签署

Latent Space报道,针对AI模型的AEF-1第三方评估标准正在成形,xAI、OpenAI与Anthropic均已在标准文本上联合签署。该标准为独立第三方评估机构(Third Party Evaluators)提供了统一操作框架,与近日头部实验室倡议的AI独立监督机制形成配套——评估权正从厂商自测走向制度化外部审计。

🛠 技术实践
1

IBM开源ALTK-Evolve一致性指南:Agent成功率77%背后的24.4分可靠性缺口

IBM研究团队在HuggingFace发布一致性评估与改进方法:AppWorld上GPT-4.1 ReAct Agent平均成功率77.4%,但五次重复全部通过的任务仅53.0%,一致性缺口达24.4个百分点。其Consistency Analyzer仅用一条轨迹、无需真值即可定位易翻转决策点,自动生成的一致性指南将缺口从24.4pp压缩至12.0pp,且不损失平均精度。附arXiv技术报告与开源工具。

2

Dense还是MoE:NVIDIA用Nemotron 3.5 Lightning拆解参数激活与吞吐取舍

NVIDIA开发者博客系统对比Dense与MoE架构的选型问题:以Nemotron 3.5 Lightning为例,解释30B参数模型如何每token仅激活3B仍能利用全部容量,并给出激活参数、吞吐与部署成本三维度决策框架。对推理延迟敏感、显存受限或需要稳定批吞吐的场景,文章给出了可操作的判断路径。

3

Grab开源LLM-Kit:500+内部Agent服务的生产化框架

Grab在InfoQ详解其Agent框架LLM-Kit,该框架标准化了超500个内部Agent服务,统一服务集成、评估与上线流程。东南亚高频出行/外卖场景下的多Agent治理经验——包括灰度发布、回归评估和服务复用——对中型团队搭建Agent平台有直接参考价值。

📌 行业快讯
🔭 技术趋势观察