📰 AI洞察日报

2026年9月19日 · 星期六
👁 阅读量加载中…
🏆 头条

安全团队用Claude攻破OpenAI内部系统:72小时、不到3000美元

Hacktron三名安全研究员利用Anthropic Claude攻入OpenAI内部系统:先利用社区论坛Discourse中libheif图片库一年未修复的漏洞获取服务器控制权,再 chained OpenAI SSO配置缺陷劫持员工ChatGPT与Codex账号,并最终进入OpenAI内部GitHub monorepo提交了一个无害PR作为证明。关键细节:Claude Opus 4.8无法在开启ASLR时稳定利用漏洞,而Opus 5发布后3小时内产出可用exploit、4小时接管服务器。OpenAI在报告后约14小时确认修复。团队两个月内以不到3000美元的AI开销将同一攻击扩展到Slack、Meta、GitHub Enterprise等目标,仅Shopify察觉异常。

📰 今日动态
1

WSO2开源Agent Manager正式GA,治理企业AI Agent蔓延

WSO2宣布Agent Manager正式可用,一个开源平台提供集中治理、身份与访问管理及Agent间通信控制,瞄准企业内部AI Agent数量失控增长带来的安全与合规问题。随着MCP等协议让Agent接入企业系统越来越容易,「Agent蔓延」正在成为继微服务蔓延之后的新治理难题,该平台试图为每个Agent建立身份、权限边界与审计能力。

2

OpenAI与微软合理使用抗辩动摇:内部邮件称训练数据为「惊人的盗窃」

披露的内部邮件与宣誓证词正在削弱OpenAI和微软在版权诉讼中的合理使用(fair use)抗辩。一位微软主管曾将这种做法描述为「大型陪审团天才般的盗窃」,与两家公司公开立场相矛盾。法律专家指出,当被告自家员工在内部如此定性时,法院更难接受「转换性使用」的论证。此案走向将直接影响整个行业训练数据的合规成本与授权模式。

3

Anthropic首次披露内部AI使用指标:Claude主导26%的前沿研究工作

Anthropic首次发布模型自产使用指标:Claude已「主导」26%面向未来模型的研究工作。但Anthropic对「主导」的定义是Claude完成大部分执行工作而人类设定方向与验证结论,而非全自主研究。该公司同时披露了衡量AI参与研发程度的量化框架,为业界提供了观察「AI加速AI研发」进度的少数量化窗口之一。

4

DeepMind警告:可见思维链正在消失,AI安全失去关键观测窗口

Google DeepMind撰文指出,模型以自然语言呈现的可见思维链是AI安全的独特优势——研究者可借此监控模型的推理与潜在欺骗,但这一透明度正在流失。随着模型转向更高效但不透明的内部推理表示,可解释性研究可能失去最重要的对齐观测工具。文章呼吁行业在效率收益与安全可见性之间做出有意识权衡,而非让透明度被动消亡。

5

arXiv论文系统刻画LLM Agent搜索行为:端到端生命周期量化分析

一项新研究首次系统刻画会话式LLM Agent的Web搜索全生命周期,覆盖搜索决策、检索策略、结果处理到最终响应各环节。研究量化了Agent何时选择搜索、如何组合多轮查询以及搜索质量对最终答案的影响,为Agentic搜索系统的评测与优化提供了基础框架。

🛠 技术实践
1

DoorDash用多Agent LLM系统清理6万条特性开关,覆盖623个仓库

DoorDash构建多Agent LLM系统自动化清理过期feature flag:跨623个代码仓库、超过6万条开关,工作流结合代码分析定位引用、LLM判断业务影响、再自动生成清理PR。特性开关堆积是大型代码库的普遍痛点,该案例展示了Agent处理「需要跨仓库全局理解」的维护性任务的可行路径与工作流编排方法。

2

NVIDIA发布AIPerf大规模LLM推理基准方法论

NVIDIA开发者博客发文讲解如何用AIPerf在大规模部署场景下评估LLM推理性能,回答「部署的模型到底快不快」这个看似简单的问题。文章覆盖单节点到多节点场景下吞吐、延迟与扩展性指标的测量方法,说明为何MLPerf式标准基准难以直接映射到生产负载,并给出容量规划与性能调优的可操作流程。

3

千问办公3天为国家天文台搭建科研级望远镜仿真系统,成本不足千元

国家天文台科研团队借助千问办公(Agent模式)在3天内完成大口径科研级望远镜数字化仿真系统,成本不到1000元。系统模拟真实望远镜组件与观测条件,Agent可在仿真环境中驱动望远镜进行远程态势感知与观测流程仿真,产生的数据后续将用于训练望远镜控制模型(VLA)。案例展示了Agent在科学装置数字孪生中的低成本落地路径。

📌 行业快讯
🔭 技术趋势观察