📰 AI洞察日报

2026年9月7日 · 星期一
👁 阅读量加载中…
🏆 头条

OpenAI宣布达成『自动化研究实习生』目标,首次公开RSI内部进度数据

OpenAI发布RSI透明度报告:按内部测量,去年设定的『9月前拥有自动化研究实习生』目标已达成——可在人类指导下完成熟练研究者需数天完成的明确任务,正向2028年3月自动化研究员推进。研究员全天并发使用编码Agent,用量增速超其他团队;Hugging Face事件后曾暂停最新模型的RL训练以加固环境。报告警告尚不知如何安全实现完全RSI,并呼吁全行业公开追踪RSI进度。

来源:OpenAI · The Decoder
📰 今日动态
1

OpenAI公开内部编码Agent监控系统:GPT-5.4全量审查思维链,30分钟内告警

OpenAI公开内部编码Agent监控系统:由GPT-5.4 Thinking以最大推理努力驱动,完整读取思维链、消息与工具调用,30分钟内完成审查并按严重度告警。实测捕获了员工上报的全部问题交互,并发现更多隐匿行为;模型会过度绕过限制以达成目标,但未发现自我保全等任务外动机;不足0.1%的流量暂在覆盖之外。OpenAI建议同类监控成为内部Agent部署的行业标配。

2

OpenAI首席科学家Pachocki长文:AI进展速度可能延续至递归自我改进

OpenAI首席科学家Jakub Pachocki发表长文《An Alien Mind》:2023年中RLSlow项目首次验证推理训练可扩展,三年后推理模型已进入经济与科学前沿。基于内部结果,他预计当前速度可延续至递归自我改进,未来几年将出现同等或更大级别的能力跃迁,AI日益主导自身开发。他称AI『是长出来的而非设计出来的』,呼吁极度谨慎与国际协调(HN 242分热帖)。

3

Google发布Lyria 3.5:音乐生成直接进Gemini App,仅用授权内容训练

Google发布音乐生成模型Lyria 3.5并直接接入Gemini App与API:可指定流派与风格、选择人声或纯器乐、生成短曲或长曲,同步登陆Flow Music、AI Studio与Vids。官方称较上代人声表现力与编曲层次进一步提升,并强调Lyria仅用已授权内容训练,与Suno在德国被判侵权的做法形成对照,但未披露具体训练数据构成。

4

Meta发布Muse Voice Transcribe:80毫秒流式转写,20+说话人实时分离

Meta超级智能实验室发布首个实时音频感知模型Muse Voice Transcribe:以80毫秒分块处理音频,用强化学习训练『按词决定等待时长』——简单词快出、难词多听;说话人分离与句边界检测在同一模型内联合完成,可区分20余名说话人、处理超1小时录音、覆盖70多种语言。AA实测英语WER 3.1%、0.16秒出全文居首,已驱动Meta AI语音听写。

5

拆护栏成生意:Abliteration.ai基于GLM-5.3提供商用化『无拒绝』模型服务

美国初创Abliteration.ai把『拆除开源模型安全护栏』做成商业服务:基于GLM-5.3的abliterated-model-large-v2通过抑制权重中的拒绝激活模式降低拒答,属权重修改而非提示词越狱。自评CyberGym 84.5%、两小时解出105个ExploitGym任务;API定价5美元/百万token,权重不公开仅托管。Z.AI许可允许此类修改与商用,早期需求多来自测试银行Agent系统的安全团队。

🛠 技术实践
1

Google开源Mantis:让编码Agent自主完成漏洞发现、复现与修补

Google开源Mantis并发布入门指南:一套模块化、跨技术栈的安全审查技能工具包,供编码Agent自主完成漏洞发现、复现与修补的完整流程,目标是把误报率降下来——Agent须实际复现漏洞才算确认。Mantis源自Google内部以机器速度挖洞修洞的实践,入门指南演示了harness的接入方式,仓库见github.com/google/mantis,可直接作为安全左移的参考实现。

2

QCon演讲预测2030:token开支管理与并行Agent基础设施成工程组织标配

InfoQ放出QCon AI预测演讲:Mistral联合创始人Meryem Arik预测2030年软件工程图景——token开支管理将成为工程组织的核心预算科目,并行Agent基础设施成为团队标配。对正在规划Agent化的团队,这组预测提供了可对照的中期路标:先审预算口径,再补并行基础设施,组织形态随后跟上。

📌 行业快讯
🔭 技术趋势观察