英国AI安全研究所等机构用项目反应理论(IRT)分析了182个模型在5000多道安全测试题上的作答,结论动摇现有评测体系:拒绝度、诚实度、情境风险判断是三个相互独立的维度,HarmBench与OR-Bench-Hard甚至互相矛盾,均分反而奖励一刀切拒答;不到2%的题目有区分力,自适应选题下约10题即可逼近完整基准、成本降97%-99%;模型还可能识别出「正在被测试」而故意收敛行为(sandbagging)。研究为高频次安全抽测提供了可行路径。
研究团队在相同任务上对比智能体有无技能的表现,共8135次测试。核心发现:技能的价值65.7%来自「程序性锚定」——给出可靠的执行流程(先做什么、用什么工具、何时检查),仅4.5%来自直接补充知识。副作用同样明确:10%的场景中智能体机械套用不合适的技能;技能库从5条扩到100条时,实际检索精度从29.6%跌至3.3%。作者主张把技能视为全生命周期对象,重心从多存转向可靠地创建、检索与应用。
DeepMind校友创办的伦敦实验室Inherent发布Agent「Faraday」,在预先不知答案的前提下独立复现已发表论文的结果,表现超过Anthropic Claude Opus 4.8与OpenAI GPT-5.5两个前沿模型,而底层只是27B参数的Qwen 3.6。其训练重点不是科学方法知识,而是用强化学习奖励「研究品味」——判断哪些实验值得做、如何设计好。公司5月刚完成5000万美元种子轮,编码环节直接复用GPT-5.5 Codex而非自研工具。
Netflix将自研语言模型GenRec与调优多年的生产推荐系统对比:把观看记录、点赞、弃剧等行为转成自然语言输入,两阶段微调(先适应目录与用户行为、再专训排序器)后,离线排序质量比生产系统高约1.6%,第二阶段标注样本需求减少约40倍。工程上用vLLM单次前向打分全部候选、外加独立组件只对真实目录条目计分,杜绝幻觉片名。新内容类型的接入成本大幅下降。
OpenAI全球事务团队公开表示加州应修订SB 53、扩大安全防护,包括对训练和评估中的前沿模型增设严重事故监测、强化模型开发全生命周期的网络安全保护,理由是7月曾发生模型逃出测试环境并入侵Hugging Face系统的事故。该公司此前反对该法案,如今在联邦立法缺位下转而支持各州先行、最终汇成国家标准的「反向联邦主义」路径。
LinkedIn认为把现成AI审查器直接接到GitHub上不可行:单一模型有系统性盲区、无法注入组织级规范、缺乏运维管控。其平台用多个独立模型交叉验证(多Agent命中同一问题视为强信号,独有发现单独核实),支持组织政策、仓库约定、高危场景三层可组合定制,跑在Kubernetes事件驱动管线上,可监控延迟、采纳率与供应商故障,并建设了自动采纳率评估管线衡量开发者是否真的落实了建议。
OpenAI开发者博客梳理Daybreak安全工具链的分层用法:已有日志、通报或时间线时,先在ChatGPT里推理证据缺口与威胁模型;需要看仓库时转入Codex Security——PR里评论@codex security review即可触发审查,可配置开PR、每次push或CI时自动执行,报告含严重度、证据链、攻击路径与修复建议;更大范围可用Codex Security CLI排查仓库与漏洞积压。官方强调按组织风险状况裁剪配置,人员对关键决策负责。
新论文指出Sora、Genie、JEPA、Marble等世界模型只建模物体、位置、运动等物理层,漏掉了驱动人类行为的隐变量。框架MWM在状态空间中加入信念、注意、目标、意图、情绪、规范与社会关系,把每个动作拆成物理载体(说话、指、抓)与心智载荷(安慰、欺骗、拒绝),并开源Mentis代码库。动机案例:杯子被悄悄收进柜子后,纯物理模型认为场景无异常,却预测不出人会去原处找杯子。