OpenAI发布由未公开内部模型(性能显著强于GPT-6 Astra)生成的Navier-Stokes存在性与光滑性问题解:初始光滑的三维不可压流体可在有限时间内发展出奇点。约1万个并发Agent协作88小时找到证明,过程中发送270万条消息、消耗约1300亿输出token,随后17小时完成Lean形式化验证。OpenAI声明不领取百万美元奖金,称发布目的是向世界报告AI进展速度。
DeepMind预计算人类基因组全部约90亿个单核苷酸变异的分子效应预测,构建1PB级AlphaGenome Atlas(超AlphaFold数据库30倍),学术研究免费开放。同步推出AVI评分,融合AlphaGenome与AlphaMissense预测,首次系统性覆盖占基因组98%的非编码区。Broad研究所用它定位了此前漏检的DNM1癫痫脑病变异;Exeter大学分析5.4万英国生物银行样本,多发现22%的非编码遗传关联。
DeepSeek开放约150个HC,仅设服务端开发与Agent弹性计算研发两类岗位,面向2-10年资深工程师,团队规模或扩大三分之一。Agent弹性计算方向首次公开DSec平台(V4技术报告披露):三个Rust组件(Apiserver/Edge/Watcher)跑在3FS上,要改整个系统栈从OS、VM到网络存储,目标是把某些OS组件性能压到硬件极限。服务端六个方向覆盖Agent框架组件、DeepSeek API、数据工程等全链路。招聘要求本身也是信号:候选人须日常深度用Agent开发,「当Agent提供有问题的方案时能敏锐发现并及时介入」。负责人崔添翼称之为团队规模的Scaling Law——模型能力扩张产生复杂度,复杂度反过来要求扩规模。
新图像模型Images 2.5在参考图保真、多轮编辑一致性上显著增强,生成延迟较Images 2.0降低最多50%,支持透明背景与复杂排版。ChatGPT端新增Sketch(手绘草稿作生成参考)、模板与图片圈点批注;API同步推出GPT-Image-2.5 Flare与Sunburst两款模型。OpenAI披露ChatGPT平台当前每周生成超30亿张图片。
NVIDIA推出CUDA Rust双轨道:SIMT轨道cuda-oxide是自定义rustc编译后端,Rust MIR经Pliron与LLVM IR编译到PTX;Tile轨道基于Tile IR编译器,由编译器决定tile到硬件的映射,官方建议优先选Tile、需精细控制时降回SIMT。NVIDIA的Nova Linux驱动与Dynamo推理框架已采用Rust,CUDA Rust工具链将建设至2027年以后,AI系统层(推理引擎、serving、Agent运行时)的Rust化至此补上内核这块短板。
基元律动联合无问芯穹、清华、北大、阿里推出NeoHorse-1(4B/9B,基于Qwen3.5底座后训练),核心做法是把Routing Harness产生的Agent执行轨迹(含能力预测、路由选择、工具调用、环境反馈)经质量评估后作为训练语料,结合在策略蒸馏更新模型。11项Agent/代码/指令基准上,NeoHorse 4B在4B级平均分最高,5项超过Qwen3.5-9B底座;团队称这是RSI(递归自我改进)的单轮工程验证。
NYU教授Buckmaster发表公开声明:他与Anthropic员工Alpöge用Claude和Codex在Navier-Stokes相关问题上取得突破后,消息流入OpenAI,后者数日内连续施压要求即时通话,并要求从论文移除Anthropic合作者。OpenAI否认接触过其工作,称自证证明由内部模型独立产出并完成Lean验证,主动提议共同发布并承认对方在Euler问题上的优先权;Buckmaster则质疑OpenAI用其Codex会话数据训练了模型。研究负责人Mark Chen披露该证明仅算力成本就达数百万美元。
Perplexity新推的本地Agent产品Portable Computer采用阿里开源Qwen3.8-27B,并在英伟达DGX Spark上针对性优化PPLX 27B系列算法;Qwen3.8-27B因智能密度被社区称为「本地Opus 4.6」。HuggingFace夏季报告称千问已成全球开源AI基座模型,Airbnb大量业务依赖Qwen,Pinterest用其搭建AI购物助手,路透社基于Qwen开发自有模型。
GitLab发布安全分析指出,把编码Agent关进沙箱不等于安全:Agent仍可通过网络把仓库代码、密钥外传,也可能被外部通过回调通道间接操控,沙箱只解决了文件系统隔离这一层。建议做法是对沙箱实施出网管控与代理白名单、工具权限最小化、对Agent的网络行为做审计。对自建编码Agent平台的企业,网络边界设计比沙箱本身更关键。
Meta曾把AI工具使用量纳入工程师绩效评估,结果催生tokenmaxxing——为凑指标刷高token消耗的行为,官方现已撤回该考核项。教训直接可复用:AI采用率这类代理指标一旦变成KPI就会被博弈,工具消耗量与工程产出没有因果关系;衡量AI转型效果应看交付结果与质量,而非用量。对正在推行AI编码考核的组织,这是目前最清晰的反面案例。
MIT TR专访Dreamer系列作者Danijar Hafner:他离开DeepMind创业,路线是模型式强化学习——先在学到的世界模型内训练Agent规划行动,再零样本迁移到真实环境。DayDreamer已验证机器人能在未经训练的场景中自主恢复(如被推倒);Dreamer 2首个用世界模型达到Atari人类水平,Dreamer 3独立解出Minecraft钻石挑战,Dreamer 4更进一步从离线游戏视频学策略、完全不与游戏交互。对具身智能团队,这条「先仿真后零样本」路线值得跟踪。