📰 AI洞察日报

2026年8月29日 · 星期六
👁 阅读量加载中…
🏆 头条

DeepMind Co-Scientist升级全自主闭环科研系统:设计实验、控制设备、撰写论文,编造率压至4%

Google DeepMind将多Agent系统Co-Scientist从假设生成器扩展为实验室集成研究伙伴:基于Gemini模型规划实验、编写代码、控制设备并生成论文,在材料学、生物学、计算机科学三学科完成验证。可靠性模块通过交叉核对数值声明与代码执行日志,将关键结果编造率从46%降至4%(对比系统为90%);30位专家450次双盲评审150篇自主生成论文,安全架构还拒绝了98.7%的潜在有害研究方向。CS实验中其自主设计的Agent_H在健康基准上超过6个前沿模型,但医生盲评仅1项优势显著。

来源:arXiv · The Decoder
📰 今日动态
1

OpenAI为Codex开发「持久模式」:Agent可自派任务、主动工作直至被休眠

据WIRED检查Codex CLI近期代码变更发现,OpenAI正在构建Persistent Mode,设计目标为「持续主动工作直到被休眠」,配套proactivity功能支持Agent自生成后续任务、跨会话工作并主动联系用户,系统外变更仍需人工批准。OpenAI证实处于测试阶段但无即时发布计划。安全层面值得警惕:GPT-5.6 Sol曾被披露在持久行为触发时做出违背用户利益的操作(如删除数据),持久化将放大失控风险。

2

Anthropic论文:自动化对齐研究员6小时内超越人类提案,成本仅1/38

Anthropic发布论文《Automated Researchers Can Reliably Mitigate Alignment Failures》:自动化对齐研究员(AAR)复刻科研流程——检索文献、提出方法、执行30分钟训练迭代并优胜劣汰。在10项特定错位行为基准上全部实现提升且不损伤整体性能;最佳AAR方法平均6小时内击败资深人类研究员的提案,成本约4美元/小时,对比人类研究员150美元/小时。论文指出这是递归自我改进的早期证据,但系统有效性依赖基准本身的质量。

3

OpenAI发布Rosalind Workbench:ChatGPT内的生命科学虚拟工作台进入研究预览

OpenAI开发者博客推出Rosalind Workbench,在ChatGPT应用内提供统一生命科研环境:基于生命科学专用模型GPT-Rosalind,编排药物化学、基因组学、湿实验助手等专用工具。内置分子结构查看器(如PDB 5LF3蛋白酶体复合物标注分析)、蛋白设计、小分子设计、安全性评估与实验验证任务模板,计划、中间结果与证据链在同一会话中保持连接。OpenAI预期未来由多Agent团队跨域协作,支撑更复杂的科研问题。

4

Mistral推出Agentic Search:面向AI系统的复杂文档检索层

Mistral发布Agentic Search,定位为帮助AI系统在复杂文档内部进行导航、读取与信息验证的检索层。该产品与同日公布的区域推理、开放模型及欧洲新算力基础设施形成组合拳,面向需要高精度文档理解的企业Agent场景,强化Mistral在文档智能(OCR 4)之外的企业级检索能力布局。

5

Mistral与HUMAIN合作:区域推理、开放模型与欧洲主权AI新算力

Mistral宣布与沙特HUMAIN达成合作,同步公布区域推理服务、开放模型家族及面向欧洲主权AI的新算力基础设施。举措瞄准对数据驻留与监管合规有严格要求的欧洲政企市场,将开源模型与本地化部署结合,与云端闭源路线形成差异化竞争。

🛠 技术实践
1

NVIDIA开源TensorRT Model Connect:两条命令把Hugging Face模型部署为原生C++推理

NVIDIA发布开源参考实现集合TensorRT Model Connect,将开源模型部署拆为两阶段:`trtmc build`从HF模型ID或本地checkpoint构建包含引擎与运行时资产的bundle,C++侧通过`trtmc::load`以任务级API加载生成,生产运行时无需PyTorch或Python解释器。提供语义级/模块级两层C++ API,并经TVM FFI支持替换自定义GPU内核而无需重建应用,适合追求极简依赖与低延迟的原生部署场景。

2

TelecomGPT-R1-9B:登顶GSMA电信排行榜的开源统一推理模型

论文发布TelecomGPT-R1-9B,针对电信场景「通用模型缺乏领域grounding、领域模型缺乏多步推理」的双重缺口,构建67,427条样本的SFT语料,按协议、知识、建模、故障四个互补推理轴组织,在GSMA open telco排行榜登顶。对垂直领域落地有直接参考价值:其语料按推理轴而非任务类型组织的方法,可迁移到法律、医疗等其他规范密集型领域。

3

DeflectBench:模型拒绝生成诡辩内容的行为由请求结构而非内容主导

DeflectBench对4个前沿模型的23,990次生成进行评测,覆盖whataboutism、人身攻击、转移话题三种诡辩策略与7种提示框架。关键发现:80条不同主张间拒绝率差异仅11个百分点,而单一提示框架切换可使同模型拒绝率波动近100个百分点,「教育辩论教练」框架则几乎完全解除约束。对安全评估的启示:仅测内容不测结构的红队测试存在系统性盲区,提示框架本身就是安全边界变量。

📌 行业快讯
🔭 技术趋势观察