杰富瑞分析师对8款全球主流AI Agent进行真实办公任务实测:5项任务涵盖多文件年报摘要、联网数据比较、桌面浏览器操作、英文PPT制作与营销海报生成。阿里千问办公综合得分95分排名第一,是唯一在所有测评维度均超过90分的产品;报告首次将Agent能力拆分为模型与Harness两层,千问办公的隐含Harness分同样居首。其底层Qwen 3.8 Max的API价格明显低于海外头部模型,Cost per Task优势显著。
晚点LatePost消息,字节跳动大模型部门Seed完成新一轮组织调整:Seed Foundation Model成立Pretrain Data、Horizon RL、Product Posttrain-Work、Product Posttrain-Chat四个一级部门,统一多模态预训练数据、整合分散的强化学习团队,并将应用后训练按B端任务与C端对话拆分,负责人均向吴永辉汇报。调整被视为为传闻中参数规模超5万亿、超过Qwen 3.8-Max(2.4万亿)与K3(2.8万亿)的模型铺路。
Mistral宣布主权AI三方面落地:Regional Endpoints正式GA,客户可指定推理在欧洲或美国区域完成,对齐数据驻留与监管要求;Priority Tier进入公测,为关键负载提供自定义速率限制并附带正常运行时间SLA,Mistral称其为唯一同时提供区域选择与SLA承诺的欧洲AI实验室;同时扩大第三方开源模型在其基础设施上的接入,并正联合企业与机构锁定欧洲算力的长期承诺。
Cloudflare发布WriteGuard(私有测试版),为MCP服务器提供细粒度安全控制:在基础Access策略之上,可针对单个工具的写操作配置审批与差异化限制,防止Agent经MCP越权执行破坏性操作。配合其基于协议级启发式的MCP流量识别能力,安全团队可以发现影子MCP流量并对工具调用实施准入治理,目标是在Agent访问外部工具时让企业保留控制权。
斯坦福STAIR实验室等推出公开平台AI Observatory,聚合7个经用户同意收集的真实对话数据集,独立评估人们如何使用生成式AI。研究发现:若按Anthropic经济指数的工作场景过滤口径,48%的对话会被排除;这些非工作对话中健康与人际关系类占44.2%(Anthropic口径为31.2%)、含骚扰仇恨内容的占27.5%(对方口径5.66%)。厂商自报使用数据的选择性偏差首次被系统量化。
Vercel公布AI Gateway七月数据:Anthropic拿走65.1%的支出份额但仅占30%的token量,单token成本是其他厂商平均的4.4倍;Fable 5快速升至13.2%的支出份额,当月使用该模型的团队90%为新增客户。全平台token量环比增长59%、支出增长37%,平均token价格下降13.6%;按token量计DeepSeek已超过Google,企业正明显转向更低价的模型层级。
OpenAI发布面向国家安全领域的民主监督计划,提出三项原则:AI应强化而非取代人类与机构判断、政府AI使用应对授权监督者可追溯、应以AI赋能监督机构本身。具体行动包括未来一年投入500万美元为民主政府监督机构提供培训、技术支持与OpenAI额度;与监督机构试点审查工具,供授权审查者检视AI辅助决策的输入、输出与工具使用记录,工具尽量模型无关,证据与结论由参与机构掌控。
IBM研究团队在8个模型(从30B dense到前沿闭源系统)上评估自学习记忆方法ALTK-Evolve:从Agent自身历史轨迹蒸馏可复用guideline,再注入推理时上下文,无需权重更新与人工标注。结论是记忆用量需按模型能力校准:DeepSeek-V3.2(671B MoE)注入完整guideline集任务完成率提升9.5个百分点;gpt-oss-120b用紧凑核心集加按任务检索提升16.1个百分点且token仅增5%;已接近能力上限的模型则无可见收益。
NVIDIA开发者博客展示用Claude Code加ALCHEMI Toolkit构建机器学习原子间势模拟的完整工作流:用uv在本地创建可运行环境安装工具包、下载与安装版本严格匹配的agent skills(.claude/skills目录)、并让Agent实际执行自己生成的脚本。在最终45条生成管线的测试活动中,该配置实现零坏导入、零对不存在API的引用,结果在H200 GPU上完成验证,给出了让编码Agent可靠产出GPU加速科学计算代码的环境配置范式。
机器之心IJCAI 2026系列访谈:ETH Zürich秦浩桐团队专注1比特量化,面对大模型规模与端侧硬件内存之间高达20倍的鸿沟,在不重新训练的前提下将千亿参数模型压缩进微型设备。访谈覆盖1比特量化的技术路线、可行性边界与工程落地考量,是端侧模型部署与量化方案选型的一手参考。