OpenAI发布GPT-6 Astra,正向部分组织开放,数日内覆盖ChatGPT Plus/Pro/Business/Enterprise、API及AWS。官方数据显示:FrontierMath Tier 4得分98%、ARC-AGI-3达99.9%、ExploitBench 100%,多项基准饱和;OSWorld 2.0上以约40分钟/任务取得72.6%,较GPT-5.6 Sol提速约47%;受HF事件启发的越权评估中越界率为0%(Sol为48%)。总裁Greg Brockman称其开启『AGI时代』。
NVIDIA宣布以约129亿美元收购Hugging Face。该平台汇聚超1800万开发者、300万个模型、50万数据集与100万应用,逾20万企业依赖。黄仁勋承诺收购后平台保持开放:不要求NVIDIA硬件、继续支持其他云与芯片,联合创始人Thomas Wolf称用户侧无任何变化。在Google、Amazon、OpenAI、Anthropic纷纷自研加速器的背景下,NVIDIA借此次交易握住开放模型生态的核心分发入口。
Meta五个月内推出第四款Muse Spark模型。Artificial Analysis实测Intelligence Index达61(xhigh)/62(max),七月为53;τ³-Bench Banking以52%登顶当前榜首;Terminal-Bench 2.1从80%升至85%。定价维持每百万token输入$1.25/输出$4.25,同分段任务成本约$0.55,低于对手的$0.94-1.23。GPQA Diamond升至94%,仍落后Gemini 3.8 Flash的95.3%。开放权重版本已在筹备中。
Google DeepMind与Google Research发布WeatherNext 3,经Brightband独立实时评测为当前最准确的全球天气模型。模型直接从逐小时静止卫星原始数据学习,实时刷新预报;关键地表变量分辨率达5公里,较WeatherNext 2的25公里网格精细约5倍。单一FGN mesh transformer统一输出网格场、气旋轨迹与站点级稀疏坐标,新增清洁能源变量,已接入Search、Gemini、Maps与Cloud。
据The Decoder报道,Anthropic与NVIDIA投资的云服务商Lambda签署价值350亿美元的云计算协议,用于支撑Claude系列模型的推理算力需求。这是近期AI实验室锁定长期算力的又一大额交易,显示头部模型厂商在推理需求爆发期提前锁定GPU产能已成为常规操作,云算力供应商的格局也随之向少数具备大规模交付能力的厂商集中。
Mistral发布企业检索产品Agentic Search:模型通过search、open、navigate、read、grep五种工具组成的多步循环,在长文档与多数据源间定位并交叉验证信息,可接入企业现有搜索索引,支持云与本地部署、不跨越数据隔离边界。官方数据显示FinanceBench正确率从26.7%提升至86%,OfficeQA Pro表格类多文档问题提升45.6个百分点;p90延迟最多降低39.6%,token消耗减少约三分之一。已内置于Studio与Vibe的Libraries。
9月3日晚间,ChatGPT、Codex、Claude、Grok、Cursor等多款AI服务同时突发故障,Codex请求返回404,多家状态页亮红灯,数小时后陆续恢复。HN相关讨论帖获274分、489条评论,用户追问多家实验室同步宕机是否指向共同上游依赖,各家均未给出统一解释。同期GPT-6 Astra正分批推送,稳定性和扩容压力成为关注焦点。
funes是单一二进制的Agent记忆层:本地完成嵌入与重排序、无外部ML运行时依赖,一条命令接入Claude Code、Codex、pi、Hermes,为Agent注入recall与get两个工具。索引按会话turn增量构建,新会话只追加不重嵌全史;记忆以数据集形式存储,可同步到用户自有的私有HF数据集,实现跨机器、跨Agent复用。核心理念是『记忆是数据集而非服务』,代码开源于GitHub,另发布handoff-recall基准数据集。
Meta工程博客详述ZGateway:为服役于全球每秒数十亿次操作的KV存储ZippyDB统一前置代理。直连模式下单个客户端可持有数万条TLS出站连接,形成无界的many-to-many网状拓扑;代理层将其收敛为可控的扇入扇出,并集中实现请求批处理、准入控制、负载均衡与跨区容错。对『客户端舰队庞大且不可控』的基础设施团队,这份复盘展示了共享代理层的完整取舍与落地路径。
NVIDIA开发者博客介绍PAIR虚拟推理路由器:当主Agent将复杂任务拆分给多个专职子Agent时,PAIR把局域网内多台机器的GPU算力聚合为单一虚拟推理池,扩展本地可用算力。文章给出多机协同的组网架构与配置步骤,面向希望在本地网络内横向扩展Agent推理、不依赖云端的开发场景,适合算力分散在多台工作站上的小团队与实验室参考落地。