Google DeepMind发布音频模型Gemini 3.8 Live及3.8 Live Extended Thinking,面向开发者通过Gemini API与AI Studio提供。Extended Thinking变体在Artificial Analysis语音对语音榜以82.6%登顶,超越OpenAI最新GPT-Live-1;支持97种以上语言,可在说话同时后台调用API并处理视觉输入。定价音频输入每分钟0.005美元、输出0.018美元,一小时语音对话约1.38美元,而OpenAI为至少3美元,但OpenAI全双工对话仍更自然。
Aether AI发布RSIAgent框架,让AI通过自主探索新环境实现递归自我提升,全程不更新模型参数。开源模型Kimi-K3、GLM-5.3在OSWorld 2.0达到78.98%、Agents' Last Exam达84.82%,在多项高难度基准上超越GPT-6 Astra等闭源模型。代码与论文已开源,为「经验积累优于参数训练」路线提供了新证据。
Apple在多年延期后开始交付重构的「Siri AI」,底层采用Google Gemini模型,部分端侧运行、部分经云端处理。该版本暂不对欧盟用户开放,延续Apple因DMA监管在欧盟延迟AI功能的策略。这是Gemini首次大规模进入iOS核心入口,也意味着Apple放弃自研前端模型、转向供应商集成路线。
NVIDIA发布技术博客,介绍Groq 3 LPX确定性执行架构如何在Vera Rubin平台上驱动高能效、高交互性推理。确定性执行消除了调度不确定性,使延迟可预测,适合大规模并发语音与Agent工作负载。该文是理解下一代AI工厂「功耗墙」下推理架构演进的一手材料,与NVIDIA同期发布的NVLink 6多层容错设计共同构成Vera Rubin软件栈拼图。
Agility Robotics发布面向仓储与工厂场景的第五代人形机器人Digit 5,宣称可在无安全围栏防护的情况下与人类共同作业。相比前代,Digit 5在安全认证与作业灵活性上进一步逼近工业部署门槛,是「人形机器人从示范区走向产线混行」路线的最新节点。
Meta推出WhatsApp Business MCP服务器,开发者可用Claude、Cursor、Codex、ChatGPT等AI编码Agent自动完成商家账号设置、消息模板与业务接入等原本繁琐的配置流程。MCP生态从开发者工具扩展到商业基础设施,中小商家接入门槛显著降低。
Latent Space报道,针对AI模型的AEF-1第三方评估标准正在成形,xAI、OpenAI与Anthropic均已在标准文本上联合签署。该标准为独立第三方评估机构(Third Party Evaluators)提供了统一操作框架,与近日头部实验室倡议的AI独立监督机制形成配套——评估权正从厂商自测走向制度化外部审计。
IBM研究团队在HuggingFace发布一致性评估与改进方法:AppWorld上GPT-4.1 ReAct Agent平均成功率77.4%,但五次重复全部通过的任务仅53.0%,一致性缺口达24.4个百分点。其Consistency Analyzer仅用一条轨迹、无需真值即可定位易翻转决策点,自动生成的一致性指南将缺口从24.4pp压缩至12.0pp,且不损失平均精度。附arXiv技术报告与开源工具。
NVIDIA开发者博客系统对比Dense与MoE架构的选型问题:以Nemotron 3.5 Lightning为例,解释30B参数模型如何每token仅激活3B仍能利用全部容量,并给出激活参数、吞吐与部署成本三维度决策框架。对推理延迟敏感、显存受限或需要稳定批吞吐的场景,文章给出了可操作的判断路径。
Grab在InfoQ详解其Agent框架LLM-Kit,该框架标准化了超500个内部Agent服务,统一服务集成、评估与上线流程。东南亚高频出行/外卖场景下的多Agent治理经验——包括灰度发布、回归评估和服务复用——对中型团队搭建Agent平台有直接参考价值。