📰 AI洞察日报

2026年9月10日 · 星期四
👁 阅读量加载中…
🏆 头条

MIT研究者用GPT-5.6 Sol自主运行量子计算实验:AI Agent接管实验室校准流程

MIT EQuS小组研究生Beatriz Yankelevich将GPT-5.6 Sol接入Codex与实验室测控软件,让Agent自主完成超导量子比特实验:选择测量参数、操作硬件、分析数据、决定下一步实验。在未校准的六比特芯片上,Agent能以极少人工干预完成跃迁频率识别、控制脉冲校准与相干时间测量;弱信号场景仍需有经验研究者介入。EQuS已常态化让Agent整夜跑测量,研究者可从手机查看进度并远程纠偏。

来源:OpenAI Blog
📰 今日动态
1

Mistral完成30亿欧元D轮融资:三星领投,估值超210亿欧元

Mistral宣布完成30亿欧元D轮(投后估值超210亿欧元),为欧洲科技公司史上最大股权融资。三星电子领投,EQT管理的Scaleup Europe Fund与PSG Equity联合领投,Advent、贝莱德、卢森堡大公国等新投资人入场。公司称资金将用于扩展前沿研究、训练算力与基础设施,现已在20个国家运营,服务空客、ASML、汇丰等125家企业,主打「主权开放权重AI」全栈路线。

2

Meta正式推出个人AI Agent应用Muse:Secure VM自带浏览器替你办事

Meta发布个人AI代理Muse(iOS/Android双端上架),核心是Muse Secure VM——运行在持久专用虚拟机上的安全浏览器环境,可自主完成订票、填表、处理客服事务等任务。Muse定位跨生活场景的「代办型」助手,内置隐私与安全控制,用户可随时接管。这是Meta从超级智能实验室走向消费级Agent产品的关键落子,HN讨论热度622分、683条评论。

3

Anthropic经济场景推演:三种未来下美国2030年GDP最高增32.4%

Anthropic经济团队基于Korinek等2026年技术报告发布交互式经济场景模型:温和/实质性/极端三种情景下,AI对美国2030年GDP的拉动分别为+1.6%(34.1万亿)、+8.3%(36.3万亿)、+32.4%(44.4万亿美元)。多数情景中失业率维持历史区间,但极端情景(递归自我改进+快速普及)下失业率或飙升至历史高位、知识工作者工资承压。配套调查覆盖10980名美国人,典型受访者预期接近「实质性变化」情景。

4

Suno发布v6音乐模型:与华纳、BMG、Believe共建,旧模型全部下线

AI音乐公司Suno推出v6代模型,分三个版本:旗舰v6面向Pro/Premier付费用户,主打全曲风精准 polished 输出;v6-wild面向实验创作;v6-mini免费开放。三版本对 vocals、配器、曲式、情绪与参考的理解均超上代,支持用文本指令只改歌曲局部(如仅副歌换成福音合唱),也可在单次请求中混合多首歌的人声、鼓组与新歌词。伴随v6上线,Suno将下线全部旧模型。

5

AWS与高通互换角色:高通为AWS定制AI推理芯片,AWS Bedrock反哺芯片设计

高通将为AWS跨多个产品世代设计定制芯片,聚焦AI推理负载,双方还将合作1.6Tbps光互连。这是高通6月以来第三个大型数据中心客户(Meta采用其Dragonfly C1000服务器处理器,微软Azure部署其HBC内存架构),高通目标2029年数据中心营收达150亿美元。反向合作中,高通使用Amazon Bedrock等AWS服务加速芯片设计流程;AWS则在高自研Trainium/Graviton之外补充第三方推理算力。

6

Hugging Face推出ML Intern:聊天式跑ML实验,6小时训练成本低于0.5美元

Hugging Face在自家聊天产品中上线「ML Intern」AI助手:用户用自然语言描述想法,助手自动检索Hub、GitHub与网络找模型和数据集,预估算力成本并给出预算上限(批准后不超支),随后自主完成数据集创建、模型训练、任务监控、结果上传Hub、撰写报告与构建demo,每次训练有独立仪表盘。官方演示中一次约6小时的训练花费不到0.5美元。该工具大幅降低了在HF平台发起ML项目的门槛。

🛠 技术实践
1

MERIT基准:给Agent长期记忆算账,换记忆实现成功率差60个百分点

现有LoCoMo/LongMemEval等记忆基准只测对话回忆,不测记忆是否改变工具型Agent的行为。MERIT基准用带泄漏校验的分幕工具任务+难度阶梯+记忆损坏注入+全程token/美元计量:在23440个评分回合中,记忆使依赖任务成功率从0.00提升至0.55-1.00;但更新事实场景下向量检索不稳定(0.30-0.95,种子间最大差0.45),update-on-write存储稳定在0.70-1.00;全量重放永不经济,最优条件下记忆的边际效用/美元达2.7-3.9倍。

2

HF Transformers新特性:Packing与Flash Attention 2兼得,训练吞吐最高翻倍

指令微调中把多条样本拼包(packing、无padding)本与FA2不兼容——旧实现忽略样本边界造成跨样本注意力,损害收敛。HF现在通过position_ids与cumulative_seq_lengths保持边界感知,配合新DataCollatorWithFlattening实现无损拼包:FLAN数据集上llama2-7B/mistral-7B/granite-8B-code吞吐提升2倍、峰值显存降20%,OrcaMath上吞吐1.4倍、显存降6%,且保持相同优化步数、验证损失与padding基线完全一致。已支持Llama 2/3、Qwen2、Phi-3等14类模型。

3

NVIDIA多模态推理EPD分离架构:TTFT最高快5倍,但三类场景别用

NVIDIA开发者博客详解Encode-Prefill-Decode(EPD)分离式推理的适用边界:将视觉编码器从prefill/decode中拆出独立扩缩,配合开源推理框架Dynamo,多图/视频重负载下TTFT最高提升5倍、端到端响应快7倍。最佳场景为图像密集提示、中短输出与量化MoE模型;而单图轻负载、输出超长或未量化稠密模型下不推荐。文中给出编码器worker与PD worker的部署拆分方法与实测数据。

📌 行业快讯
🔭 技术趋势观察