NVIDIA研究院的Agentic Variation Operators(AVO)在交互推理基准ARC-AGI-3公开集25个环境183个关卡全部完成,取得100.00 RHAE得分。同一架构此前在GPU内核优化中连续自主运行7天,探索500多个优化方向,生成的注意力内核在DGX B200上比cuDNN快至高3.5%、比FlashAttention-4快至高10.5%。AVO依靠持久记忆与监督者机制维持长时程进展,证明评估模型不等于评估Agent——外围系统决定模型能力能否转化为持续自主进展。
DeepSeek发布实验性多模态模型V4-Flash-Vision-Exp,在V4-Flash文本能力上加入图像理解,内部多模态Agent基准得分接近Claude Opus 4.8。支持截图取文、图表分析与工具调用组合,兼容OpenAI与Anthropic两套API;单图最多384 token,单请求最多600张图,可选用512×512降采样省token,定价沿用V4-Flash,配套Harness框架0.1.1同步支持。
Mistral推出Agentic Search,为传统一次性RAG补上「检索后推理」:模型通过search、open、navigate、read、grep五个工具在长文档与多数据源间多步检索、查验与交叉验证。FinanceBench金融财报问答正确率从26.7%升至86%,表格密集型OfficeQA Pro基准提升45.6个百分点(6.3%→51.9%),p90延迟最多降39.6%,重复搜索减少使token消耗最多省三分之一。支持云端与本地部署,可接入既有搜索索引。
商汤开源轻量级统一多模态模型SenseNova U1.5 Lite正式版(8B参数MoT架构),针对真实视觉交付流程重训:原生支持3-4k字符复杂指令(多数开源模型超1k即崩溃),强化布局文字、图像编辑的区域保持与Bounding Box、多图参考等精细控制,输出原生4K。权重已上架GitHub、HuggingFace与魔搭。
NVIDIA安全团队发文界定Agent栈各层安全职责:模型/harness层属「行为控制」,影响Agent想做什么但无法硬性约束;运行时(OpenShell)等基础设施层掌握身份、策略与审计,才决定Agent能做什么,是唯一权威控制点。文中例举今夏OpenAI、Anthropic与英国AI安全研究所报告的前沿Agent越界案例,并给出五层参考栈:分发层、编排层、harness层、安全运行时、推理数据面。
Anthropic宣布安全扫描器Claude Security改用其最强、未公开发布的Claude Mythos 5模型驱动,向企业客户开放公测。扫描按正常token计费,每个漏洞发现附CWE分类、严重级别与修复建议,所有补丁须人工批准后生效。Mythos 5此前通过英国AI安全研究所全部网络攻击模拟,Anthropic同时将其接入保护医院、水电与银行的合作伙伴产品,终端用户不直接接触模型。
OpenAI在API中预览GPT-Image-2的透明背景生成能力:alpha通道在图像生成阶段原生写入而非事后抠图,边缘细节保留更好。该功能面向设计工作流(图标、贴纸、素材合成)开放,与此前ChatGPT端的功能补齐API侧能力。
DeepMind回顾15年游戏AI研究脉络(DQN→AlphaGo→AlphaStar→SIMA 2)并宣布深化与游戏工作室的合作:与Fenris Creations(EVE Online开发商)建立研究伙伴关系,SIMA 2由Gemini驱动,在No Man's Sky等3D世界实现类人游玩与实时对话。DeepMind定位三个落地方向:AI同伴NPC、开发期QA自动化测试、以及无API接入任意游戏的通用Agent。
Cloudflare为开源框架Astro部署全自动issue分诊流水线:复现、诊断、验证、修复四阶段各由独立子代理承担,通过report.md文件传递上下文而非共享执行环境,以GitHub issue标签驱动状态机流转,修复经报告者确认后自动开PR。Astro未关闭issue从200+降至约30(-85%),目标清零。每个子代理单一职责、文件化交接的设计可直接借鉴到自有项目维护。
Hume AI在HF博客发布ASR基准优化测量方法:对11个主流开源语音识别模型施加三类测试——音频与文本矛盾、关键词静音、双转录歧义。多个榜单头部模型在音频内容已被破坏的情况下仍输出VoxPopuli/LibriSpeech的基准转录文本,说明其高分部分来自记忆测试集而非真实听力能力。作者建议评测引入held-out私集(已在Real World VoiceEQ等榜单落地)。选型时应关注私集指标而非公开榜排名。
微软Azure DevOps远程MCP服务器正式GA,托管端点mcp.dev.azure.com经Entra ID认证,零本地部署即可让AI助手访问工作项、仓库与流水线。但Claude Desktop/Code、ChatGPT、Cursor暂无法连接:卡点在客户端尚不支持Entra要求的动态OAuth客户端注册。换个角度,这份严格性正是企业安全要的——无PAT令牌落盘、权限精确继承开发者身份。对接微软生态MCP的架构师需要把客户端OAuth能力纳入选型清单。