Anthropic发布新一代首个模型Claude Opus 5.5,官方基准显示其Terminal-Bench 4.0达66.4%(Fable 5.1为55.8%、GPT-6 Astra为57.9%),Humanity's Last Exam达67.7%,多数任务领先更贵的GPT-6 Astra。定价降至每百万token输入4美元/输出20美元(降20%),缓存读取成本降60%,叠加token用量减少与输出提速30%以上,综合运营成本较Opus 5低约40%。写作风格同步改进以减少「Claudish」式套话,Sonnet 5.5与Haiku 5.5将在数周内跟进。
OpenAI发布GPT-6系列新成员Sol与Luna,采用与GPT-6 Astra相似的方法训练,将Astra在专业工作、事实性、编码、计算机使用与对齐方面的性能带入更低价位,API价格降低50%。The Decoder评测认为两款模型在性能上提升有限,主要价值在于token价格减半。发布当天在Hacker News获804分、432条讨论,被视为对低价中国模型的正面回击。
OpenAI宣布一个8月28日才启动训练的内部模型,在约一个月内解决了横跨多数数学领域的100余个长期开放问题,其中据称包括第二道千禧年大奖难题Hodge猜想(此前Navier-Stokes解已引发学界激辩)。同日OpenAI成立挂靠高等研究院(IAS)的数学与AI顾问组(AGMAI),回应数学家公开信「以解题数量衡量AI损害概念理解」的批评,顾问组可独立发声并公开建议。
Anthropic正在建设自营生物实验室,目标是将AI驱动的药物研发从计算机模拟推进到真实湿实验:由Claude规划并指挥机器人完成药物实验操作。此举使Anthropic从模型供应商向「AI+自动化科学」纵向延伸,与OpenAI在数学领域的推进相呼应。此前Anthropic已推出生命科学验证计划(Life Sciences Verification Program),对通过审核的机构开放模型用于生物研究。
The Decoder报道,小米旗舰开源模型MiMo-V2.6-Pro在开放权重模型中登顶,同时以远低于竞争对手的API定价发起价格攻势。耐人寻味的是Anthropic表示Claude在小米的训练流程中发挥了作用。此前MiMo系列已以「数小时级自主编码」对标Claude Opus,此次升级使中国厂商在开源榜单与成本两端的挤压进一步加剧。
OpenAI提出应为递归自我改进(recursive self-improvement)建立国际标准——即AI系统独立构建下一代AI的开发模式。OpenAI认为缺乏统一标准将带来失控与安全风险,其首席科学家此前已表示团队当前重点正是递归自我改进而非数学优化。该提议与同日发布的第三方安全评估原则相呼应,显示头部实验室正试图在能力跃迁前预置治理框架。
Biological Computing Co.计划与AWS合作,推出基于实验室培育神经元与薄软件层的文本生视频模型,宣称运行速度可达传统GPU方案的5倍、成本降低约80%。该方案将生物计算硬件引入AI推理赛道,属于罕见非硅基路线的商业化尝试,但实际性能与可复制性尚待独立验证。
Hugging Face宣布Transformers库现可直接加载并运行llama.cpp格式的量化模型(GGUF量化检查点),省去在两套推理栈之间转换模型的步骤。对端侧与本地部署场景,这意味着量化产物可直接进入主流训练/推理生态复用其工具链,量化模型从「部署末端产物」升级为一等公民,本地Agent与隐私敏感场景的选型成本进一步降低。
OpenAI的Vinoth Govindarajan在InfoQ演讲中系统讲解生产环境AI Agent为何在「模型幻觉之外」失败:缺少控制面、不变量约束与审批边界。演讲以OpenClaw等真实案例为基础,给出Agent Harness的工程骨架:把模型当作不可靠组件,用控制平面管理状态、用不变量守护安全边界、用分级审批替代全有全无的人工确认,是Agent上线前的自查清单。
Multiverse Computing在Hugging Face博客介绍一种结构化剪枝方法:将LLM的Transformer块移除问题建模为Ising自旋优化问题,用物理系统能量最小化的思路搜索「删哪些块损失最小」的组合空间,替代昂贵的逐块重训练评估。该方法为大规模模型的推理瘦身提供了组合优化视角,适合算力受限下的部署前压缩。