📰 AI洞察日报

2026年8月21日 · 星期五
👁 阅读量加载中…
🏆 头条

Anthropic披露内部模型Model 2:能力超过所有公开Claude版本,暂不发布

Anthropic在8月风险报告中首次证实,公司内部运行代号「Model 2」的未发布模型,属Mythos级别,在内部能力指数AECI上比Claude Mythos 5高约1.5分,整体略强但部分领域更弱。该模型已用于内部编码、数据生成与研究工程,Claude编写了Anthropic生产系统中的大部分代码。内部评审未发现新的错位风险,整体错位风险评级为「低」,目前没有对外发布计划。

📰 今日动态
1

OpenAI为零数据保留前沿模型预览Private Safety Processing

OpenAI重申为符合条件的API客户提供零数据保留(ZDR):请求处理完成后不留存提示词与响应,人员不可查看,默认不用于训练。同时预览Private Safety Processing,通过跨相关交互的模式识别检测滥用——客户内容可存于自有基础设施,或用客户掌控密钥加密存于OpenAI侧,系统仅返回有限的安全信号,OpenAI人员始终无法接触底层内容。方案正与早期客户测试,Glean CISO公开背书。

2

智谱唐杰谈Scaling Law:参数时代终结,后训练是下一个扩展方向

Z.ai创始人唐杰在X发文系统阐述对Scaling Law的最新理解:GLM-5.3是一次「受控实验」,验证后训练方向仍有最大提升空间,能力提升不再依赖参数规模扩张。Latent Space以「参数之死」解读这一表态——开源模型正通过后训练强化学习快速逼近闭源前沿,Kimi K3与GLM-5.3距美国最佳模型仅一步之遥,西方实验室则归因于蒸馏并称有实证支持。

3

GEN-1.5:机器人看一次演示就能学会新任务,零训练成功率59%

机器人创业公司Generalist AI发布GEN-1.5:把3-12秒的操作演示作为「物理提示词」载入上下文窗口,机器人无需任何训练即可执行新任务。在开罐、从钱包取钞等10项测试中平均成功率59%;再用5分钟数据训练10步后升至83%。演示链式组合、仿真演示迁移、部分模仿人手动作等能力在8个月预训练中自行涌现。结果均为公司自测,尚无独立验证。

4

图灵奖得主Sutton:用合成数据扩展LLM是「大错误」

强化学习奠基人、图灵奖得主Richard Sutton在介绍新公司Oak Lab时直言,合成数据无法突破LLM的扩展瓶颈:世界无限复杂,任何模拟都只是微观近似,「无法为他人心智生成合成数据」;判断合成数据好坏仍需人类专家把关,路线最终受限于人类。他的替代方案是让agent从自身经验中学习、自建并持续修正世界模型,而非依赖人类写死的模拟器。

5

Liquid AI发布LFM2.5-DSpark,推理速度最高提升3.2倍

Liquid AI在Hugging Face官方博客发布LFM2.5-DSpark,官方基准显示推理速度最高提升3.2倍。该模型延续Liquid AI端侧高效架构路线,主打长上下文与高吞吐推理场景,为端侧部署与多并发服务的工程团队提供新的推理选型。相关模型卡与技术报告已在Hugging Face同步上线。

6

腾讯云发布AI数据底座TDSQL Nexa,数据库加速面向Agent重构

腾讯云在2026 DTCC中国数据库技术大会发布面向AI时代的数据底座TDSQL Nexa:通过统一入口连接企业分散的多源数据,为Agent提供业务语义理解与权限治理能力,多项AI数据库能力已进入生产环境,同期还展示了配套的Agent数据服务。数据库这一有60多年历史的基础软件,正围绕Agent的数据访问范式加速重构。

🛠 技术实践
1

NVIDIA:用CLI、Skills与AI编码Agent开发Holoscan边缘应用

NVIDIA开发者博客发布实践教程,展示如何将Holoscan平台API封装为可复用Skills,配合HoloHub CLI让AI编码Agent在仓库内完成边缘实时AI应用(医学影像、机器人)的传感器管线搭建与部署。核心方法论:把平台能力写成agent可理解的技能描述,由agent编排调用,减少手写样板代码。边缘AI开发工作流正被编码Agent重构的又一实例。

2

2026年AI编码Agent十大开源基准盘点

KDnuggets盘点评测AI编码Agent的10个开源基准:除SWE-bench、Terminal-Bench外,还覆盖SlopCodeBench、ProgramBench等新兴项目,维度包括真实issue修复、终端任务执行与代码质量。文章对比各基准的评测口径、数据规模与适用场景,可为团队选型编码Agent或自建评测体系提供参照——在Agent能力快速迭代期,选错基准比不测更危险。

3

NVIDIA SkillEvaluator:量化评估Agent技能描述的质量

Agent效果高度依赖所喂上下文。NVIDIA发布SkillEvaluator,用于量化技能文档对agent完成任务的帮助程度:让agent在「有/无技能」两种条件下执行同一任务,对比额外步骤数与完成情况,从而给技能描述打分。适合维护大型技能库的团队做回归测试,避免技能文档更新后悄悄劣化agent表现而无人察觉。

📌 行业快讯
🔭 技术趋势观察