一周一枚信号:三家公司做了同一件事
10 月 8 日,OpenAI 发布 Decisions API;几乎同一时间,Cloudflare 在 Birthday Week 上开源了开放权重决策模型 Clef;紧接着 LiquidAI 发布 d1-3B 与多模态实验版 d1-omni-600M,宣称在 10B 以下决策基准拿下第一。三家公司,路线各异——闭源 API、开源权重、边缘部署——却在同一周押注了同一个命题:AI 系统里大量的「选择」类任务,根本不需要生成式大模型。
这不是巧合,而是一个新品类破土的典型时刻。回顾历史,当一个技术方向同时被 API 巨头、基础设施厂商和开源社区在数天内各自落地时,通常意味着上游共识已经形成,剩下的只是扩散速度问题。
Cloudflare Clef 的定位尤其值得玩味:它被明确设计为「在预定义选项之间做出选择,而非生成自由文本」。LiquidAI 的 d1 则给出了硬指标——不逐 token 生成,单次前向给出答案,d1-3B 在 Decision Index 0.2.1 得 48.57 分,超过所有 4B/9B 模型乃至 Decider 35B-A3B 的 47.11;在 Jetson AGX Thor 上回答仅需 16ms,Orin Nano 上 50ms。这些数字指向的场景只有一个:Agent 编排里的高频、低粒度、延迟敏感的小决策。
技术本质:把「选哪个」从语言建模中剥离出来
要理解决策模型的价值,先要看清生成式大模型在决策任务上的浪费。
一个 Agent 在运行过程中,真正需要「自由文本生成」的环节其实很少——写代码、起草邮件、总结文档。而大量环节是选择性的:这条请求路由给哪个专家模型?这条内容要不要升级审核?这个用户的风险等级是高还是低?这个工具调用该不该放行?传统做法是把这类问题也扔给 LLM,让它生成一段推理再吐出答案。问题在于:
- 延迟:逐 token 生成意味着几百毫秒到数秒的响应,而路由决策需要的往往是 10ms 级别;
- 成本:为了输出一个枚举值,付出的 token 计费与为写一篇文章相同量级;
- 不确定性:生成式模型可能输出格式漂移、拒绝回答、甚至自由发挥,工程上要包一层解析与重试。
决策模型的解法是釜底抽薪:既然任务是在 N 个预定义选项中选一个,那就不需要自回归生成,只需要一次前向传递,输出层直接对选项打分。这在架构上更接近分类器时代的思路,但能力来源仍是大规模预训练——d1 基于 LFM2.5 骨干训练,说明它继承了大模型的世界知识,只是把「表达」压缩成了「判断」。
这里有一个容易被忽略的深层含义:决策模型是对 LLM 输出做信息论层面的压缩。「选 B」这个答案的信息量只有几个比特,用数万 token 的生成过程去承载它,本身就是冗余的。决策模型把这个冗余砍掉了。Cloudflare 的开源公告里用「决策压缩」这个词,我认为是准确的。
为什么是现在:Agent 经济学把问题逼出来了
技术上,用小模型做分类和路由并不新鲜——早年的 BERT 分类器、规则引擎都在干类似的事。为什么 2026 年这个时间点它突然成为一个「品类」?答案是 Agent 的规模化让经济学问题再也藏不住了。
一个面向消费者的 Agent 产品,单次会话可能触发几十次内部决策:意图分类、模型路由、安全分级、工具选择、成本控制。当日调用达到千万级,这些「隐形决策」的推理成本会超过真正的内容生成。Spotify 在 QCon AI 上分享的 Ads Manager 多 Agent 生产架构里,成本控制被列为核心工程课题,正是这个背景的注脚。
与此同时,Agent 的决策场景还有一个特点:预定义选项是存在的。路由目标是一个有限集合,风险等级是一个枚举,审核动作是固定的几档。这恰好是决策模型最擅长的输入形态。生成式 LLM 的自由度在这里不是资产,而是负债。
于是行业自然走向分层:「大模型负责规划与生成,小模型负责高频决策」。这个双层架构对成本结构的改变是数量级的——边缘侧 16ms 出答案意味着决策环节可以下沉到端侧,连网络往返都省了。
三家的牌:API 巨头、基础设施与开源生态的合围
把三个发布放在一起看,能读出各自的战略位置:
OpenAI Decisions API 是从收入侧切入——既然客户用 GPT 大量做选择题,那就把这类调用单独定价、单独优化。这是 API 巨头对自身调用结构的精细化管理,也间接承认了「生成式调用做决策」的浪费。
Cloudflare Clef 是基础设施逻辑——Cloudflare 长期押注「推理算力分布到边缘」,决策模型是其 Agent 战略里缺失的一环。开源权重意味着客户可以自托管,这与 Cloudflare Workers 的数据驻留叙事完全自洽:高频决策在你的机器上跑,敏感数据不出域。
LiquidAI d1 是硬件路线——16ms/50ms 的边缘延迟数据是明牌:瞄准的是 Jetson 这类端侧平台,机器人、车载、工业场景里「本地毫秒级决策」是刚需。
三条路线覆盖了云端 API、自托管、端侧三种部署形态,一个新品类的生态位在几天内被三家同时占位。这种合围本身比任何单个产品都更能说明方向的确定性。
冷思考:边界、陷阱与真正的变数
当然,决策模型不会吞噬所有决策场景,它的边界也很清晰:
第一,它只适用于选项可枚举的任务。「选哪个」可以,「怎么写」不行。开放性规划、多步推理仍然是生成式大模型的地盘。d1 的基准成绩也主要落在分类与选择类任务上,不要指望它写出下一篇推理链。
**第二,「预定义选项」本身就是工程负担。**选项从哪来?谁维护?当环境变化、新工具加入时,选项集合的更新机制会比模型本身更难治理。历史上规则引擎的教训在这里会以新形式重演——决策模型可能继承分类器时代「分布漂移」的老问题:训练时的选项分布与线上真实分布脱节。
**第三,可解释性与审计仍未解决。**单次前向给出的判断比链式推理更难归因。在风控、医疗分诊这类受监管场景,一个没有理由的「选 B」可能过不了合规审查。这一层可能需要额外的归因机制来补。
真正的变数在于谁掌握决策数据的回流闭环。决策模型的上限由训练数据中「选项—结果」配对的质量决定。OpenAI 通过 API 天然回收决策效果数据;Cloudflare 与 LiquidAI 走开源路线,赌的是生态广度。这场比拼的胜负手不在模型架构,而在闭环运营——这与当年推荐系统的演化路径惊人相似。
判断:Agent 技术栈的下一次拆分已经开始
我的判断是:决策模型的独立,是 Agent 技术栈走向成熟的必然一步,其意义类似于微服务架构中「网关层」从业务逻辑中拆分出来。
短期(未来半年),最直接的受益场景是模型路由与内容审核——这两个场景选项有限、调用高频、成本痛感最强,「用小模型决定何时调用大模型」会迅速成为标准做法。中期,决策模型会进入 Agent 的编排内核,成为 planner 与 executor 之间的常驻裁决层,「大模型规划 + 小模型决策」的双层架构会固化为主流设计模式。长期看,如果端侧决策模型足够强,Agent 的形态本身可能改变——不需要每一步都问云端的「大脑」,本地「小脑」就能处理大部分反射动作。
对从业者的具体建议:现在就审计你的 Agent 系统里有多少 LLM 调用实际只在做选择题;把决策延迟和决策成本作为独立指标纳入观测;在架构上预留决策层的替换接口——它很可能是你下一个季度优化 ROI 最高的单点。
一周三连发不是新闻周期,是范式信号。当「选择」被从「生成」中剥离出来单独定价、单独优化、单独部署时,我们正在见证 Agent 基础设施的第一次真正的分层。