Anthropic在8月安全风险报告中披露,用于拦截生化武器危险知识的分类器自2025年5月至2026年4月停摆近一年,期间约5万名外部反馈承包商与模型进行的约1.33亿次对话全部绕过该过滤层,涉事人员仅经外部供应商审核且筛查常不充分。内部调查称未发现实际滥用证据,公司已收紧承包商准入要求。
据金融时报报道,OpenAI已于7月底解散负责评估前沿模型灾难性风险的Preparedness团队,生物与网络安全评估被拆分并入现有业务团队,前负责人Dylan Scandinarano转向研究可递归自我改进AI的风险。首席伦理官Chloe Bakalar等多名安全人员近期相继离职,内部人士称员工对安全投入不足存在担忧。
AWS开源Dogwood策略语言,在Cedar基础上扩展时序条件,使策略可基于Agent先前的工具调用序列做判断,支持前置条件、频次限制等序列约束,弥补Cedar只能孤立评估单次请求的局限。该语言源于Bedrock AgentCore Policy的生产实践,定位为Agent工具调用边界的运行时治理层,延续Cedar可自动推理分析的确定性决策保证。
菲尔兹奖得主Timothy Gowers与普林斯顿数学家Peter Sarnak分别撰文评估LLM数学能力:Gowers认为模型擅长组合已知方法与大规模并行搜索,但缺乏在巨大搜索空间中锁定少数有效路径的直觉;Sarnak指出现有理论推导尚可,从初等问题出发构建全新抽象的能力不足。两者均将瓶颈指向原创性假设的提出,DeepMind研究员Zahavy称之为缺失的操纵性溯因能力。
Artificial Analysis发布Optima平台,支持用自有数据、工作流描述或Agent轨迹(兼容Arize、Braintrust、Langfuse导出)构建定制基准,在质量、单任务成本、单任务耗时三个维度横向对比模型,提供规则打分与成对比较两种评测方式。早期用户用它筛选出成本降低10倍且质量无明显损失的财务Agent模型,计价仅按实际token成本加少量评审费。
AWS为DynamoDB引入原生向量检索能力,开发者可将embedding与应用数据存储在同一张表中并执行近似最近邻(ANN)查询,无需为向量负载单独部署和维护向量数据库。新能力以托管服务形式直接嵌入DynamoDB,简化RAG与语义搜索场景的存储架构,对中小规模向量场景的独立向量库选型构成替代选项。
Epoch AI联合Ipsos于7月10日至19日调查1106名美国在职成年人:20%受访者表示至少一项原由同事或外包完成的工作已交给AI,且多数人直接采用输出不做修改。按任务看,软件开发AI使用率最高达57%,数据分析46%,文档阅读39%;仅软件开发中AI完成全部任务的比例达到10%。AI承担大部分工作时,53%的任务报告节省了时间。
Astro创始人Fred Schott发布Agent框架Flue 2首个稳定版,引入React风格Agent Hooks:Agent表示为每轮对话前重新执行的JavaScript函数,16个内置Hook(useTool、useSkill、useSubagent等)支持运行时动态挂载工具、技能与状态,使Agent能力配置可随任务进程演化,同时开放自定义Hook扩展机制。