Anthropic公开了一项研究成果,其未发布的Claude模型在数学界最重要未解问题之一的黎曼猜想上取得进展。该模型找到了一种新方法,将黎曼zeta函数非平凡零点密度的下界估计从此前已知的0.69提升至0.72(数值为近似),距完全证明仍有距离。这是首次有AI系统在纯数学前沿推理上取得实质性突破,表明大模型推理能力正从模式匹配向抽象数学推理延伸。
安全研究人员发现OpenAI、Anthropic和Google的API中存在漏洞,可通过特定技术提取模型的加密推理链(hidden reasoning traces),泄露内容包含密码片段等敏感信息。测试覆盖o3、Claude Opus 4.1、Gemini 2.5 Pro等6个推理模型,三大厂商均受影响。该研究揭示推理透明性与隐私保护之间的根本矛盾,直接影响使用推理模型API的开发者的安全架构设计。
Anthropic宣布从2026年8月起所有新发布的Claude模型将在生成文本中嵌入不可见水印,采用C2PA标准进行数字签名。水印可抵抗一定程度的编辑修改,帮助区分AI生成与人类原创内容。这是首个全量部署文本水印的大模型厂商,可能成为行业标配,直接影响内容平台和下游应用的集成策略。
NVIDIA发布Nemotron 3.5 Lightning,300亿参数MoE模型,仅激活36亿参数即可匹配gpt-oss-120b在IntelligentGeek基准上的表现,推理速度达500+ tokens/s。该模型专为Agent高频执行层(工具调用、结果验证、子代理委派)设计,采用NVFP4量化,为Agent架构中的执行层模型选型提供了新选项。
HuggingFace与IBM Research联合发布ALTK(Adaptive Language Tokenization Kit),在Agent代码执行(ACE)任务中通过自适应token化策略(SLDD方法)将token消耗降低40%以上,同时保持任务完成质量。为高频调用场景下的Agent成本控制提供了新路径,对Agent开发中的token预算优化有直接参考价值。
在DeepMind CEO Demis Hassabis离任后,Google联合创始人Sergey Brin亲自接管Gemini团队。据量子位报道,原定Gemini 3.5 Pro已被取消,团队将直接推进下一代模型。Google可能放弃渐进迭代策略转向跳跃式发布,依赖Gemini API的开发者需关注接口和能力的非连续变化。
北京深度求索公司注册了"Deepseek Harness团队"公众号,明确对标Claude Code,研发代码智能体产品。该团队由资深研究员陈德里领衔,已在北京启动招聘。此前DeepSeek以开源大模型闻名(DeepSeek-V3/Coder系列),此次组建专门的Harness团队标志着其从模型层延伸到Agent工程层,与Kimi CLI、Claude Code形成三方竞争。
Kimi前CLI负责人在访谈中详细阐述了Agent工程实践经验,指出当前行业过度关注模型能力而忽视工程层。生产环境中落地Agent需要深厚的CLI设计、Agent Swarm编排和工具链工程——模型决定能力上限,Harness决定可靠性和成本效率。这一观点与DeepSeek组建Harness团队的动向相互印证。
InfoQ发布了Meryem Arik关于低成本LLM推理架构的演讲,讨论面向高吞吐、非实时工作负载的推理成本优化策略,涵盖批处理优化、硬件利用率提升(从60%到85%+)、推理引擎调优等可落地方法。为需要大规模低成本推理的工程团队提供了一套从软件层到硬件层的系统性成本压缩方案。