一个反直觉的开场
39毫秒和524毫秒,差了13倍。前者是Cloudflare本周开源的决策模型Clef-flash返回一次完整结构化判断的中位延迟,后者是同类开创者TypeSafe AI Jev的数字。但今天这篇文章真正想讨论的不是"又快了多少"——在AI行业,速度数字的通货膨胀比法币还快。真正值得停下来想一想的是这件事背后的架构信号:一批不生成文本、只输出概率的模型,正在从Agent的执行链里剥离出一个此前被通用大模型垄断的环节——决策。
Cloudflare发布Clef与Clef-flash两款决策模型,输入一条客服消息,模型同时回答多个预定义问题并给出每一项的概率,下游代码直接据此路由工单、升级人工或静默处理。Clef基于Qwen3.8-27B(flash版本是Qwen3.5-9B),不改基座权重,Apache 2.0开源,API与Jev完全兼容。在43项自测基准中决策质量综合最高,中位延迟209毫秒(flash仅39毫秒),64K上下文是Jev的两倍,还带视觉编码器。
如果把这条新闻只看作"Cloudflare跟风Jev发了个竞品",就错过了它真正的信息量。我们从头拆。
决策模型到底是什么
先厘清概念。分类器(classifier)是机器学习最古老的任务形态之一,逻辑回归、随机森林、BERT微调,本质上都是决策模型的前身。那Jev开创的"决策模型"新在哪?
关键在三点。第一,泛化的类别空间:传统分类器每加一个类别就要重训一次,而决策模型像大模型一样接受任意自然语言定义的问题集合——你可以今天问"这条消息是否紧急、该 routed 到哪个团队",明天换一套完全不同的schema,模型不用重新训练。第二,结构化的概率输出:它不写一段话给你,而是返回严格类型约束(typed schema)下每个选项的概率分布,例如"95%是电商网站、85%是时尚类、<1%是钓鱼"。第三,为热路径(hot path)设计:延迟和成本被压到能塞进Agent主循环的水平。
用一个具体例子感受。Cloudflare的威胁情报团队用Clef(配合浏览器渲染)对域名做分类:抓取、渲染、分类全流程2.2秒,而他们最快的通用模型gpt-oss-120b做同样的事要4.7秒,且只返回两个分类结果。注意这里的对比结构——决策模型不是替代通用LLM,而是在"判断"这个环节上,用1/10的参数量和1/2的延迟,干掉了通用模型的"顺便一判断"。
这背后的架构判断是:过去两年大家把Agent的每一环——感知、检索、判断、规划、生成、执行——都塞给同一个大模型,本质上是一种偷懒的过度设计。判断环节不需要生成能力,它需要的是快、便宜、可校准、可验证。用通用LLM做判断,就像开着房车去买菜:能到,但你为不需要的功能付了油费和时间。
技术上Clef是怎么做到39毫秒的
Clef最值得技术人读的部分,是它对"如何让一个大模型底座不再逐token生成"的工程回答。
非自回归的决策步骤。 Clef推理时对冻结的Qwen底座只做一次prefill(预填充)前向传播,不进入自回归解码。所有合法的schema选项并行打分,直接从backbone的内部表示导出各选项的概率,中间没有任何token逐个吐出。这就是39毫秒的来源:省掉的是整个解码循环。这个思路并不神秘——本质上接近传统NLP里" MLM打分/并行选项排序"与"LLM表示能力"的杂交,但把它工程化到生产级、且保持schema泛化性,是新的。
两阶段注意力路由。 每个候选选项先从上下文中抽取与自己相关的证据,再通过跨字段交叉注意力让schema的不同字段互相对齐(比如"紧急程度"字段可以参考"产品线"字段抽取的证据),最后回到原始载荷统一打分。外加一个词法先验(lexical prior)保持选项间语义不漂移。这套设计解决了多字段联合判断时的证据错位问题——这正是传统分类器各自独立打分时最大的短板。
训练侧的校准哲学。 Cloudflare冻结Qwen底座,只联合优化一个路由头加rank-256的LoRA适配器。损失函数是标签平滑交叉熵叠加Brier损失——这个细节很能说明问题:Brier损失惩罚的不是"分错",而是"概率不诚实"。一个说"我85%确定"但实际上只有60%时候对的模型,会Brier失分。决策模型的生命线就是概率可信,因为下游代码要用这些概率设置阈值:90%以上自动执行,60%-90%人工复核。概率校准差的模型,置信度数字毫无意义,分层策略就是空中楼阁。
RLCD(校准决策强化学习)。 在监督训练之外,Clef用强化学习做二次优化:对相邻的序数选项给部分信用(把"中等紧急"判成"高度紧急"比判成"无关"错得更轻),奖励完整精确的记录输出,同时施加参考惩罚防止分布漂移。这种对"错误的价格"建模的做法,明显吸收了RLHF的成功经验,但目标从"人类偏好"换成了"决策质量"。
为什么这是一件比速度更重要的事
回到架构层面。我认为Clef(以及整个决策模型品类)标志着Agent技术栈正在发生一次分层解耦,其意义类似于微服务对单体应用的拆分。
回顾一下Agent的经典痛点:Agent每一步都要"决定"做什么——调用哪个工具、要不要追问用户、何时放弃——而这些决定目前要么硬编码成if-else(脆弱),要么每次都调用通用大模型(慢、贵、不稳定,而且同一个问题今天答明天不答)。决策模型给出第三条路:把高频、可枚举、需要一致性的判断固化成一次39毫秒的概率查询。生成留给大模型,判断交给决策模型,执行交给普通代码。Agent的"大脑"从一个器官,变成了一组器官。
Cloudflare的措辞更激进:“人类不再需要留在Agent的循环里”(humans no longer need to be in the loop)。这句话要谨慎听。它的准确含义不是"AI全面接管",而是:当判断环节的概率足够可信,人工介入可以从"每步都在"退化为"低置信度时才在"——从质检员变成例外处理器。这其实是把"human-in-the-loop"从一个架构必需品,降级成了一个可调参数。
第二层意义是商业模式上的卡位。Cloudflare明说自己要做"agent cloud"。看它的布局:Workers AI提供边缘GPU推理,AI Gateway捕获企业AI流量(天然是决策微调的数据来源),Containers做RL沙箱,加上收购Replicate得来的BYO模型能力,再配上这次新发布的Trainer和FDE(前向部署工程师)微调服务——一条"决策模型+RL微调+边缘部署"的完整闭环。Jev API完全兼容这个细节尤其露骨:迁移成本为零,摆明了要虹吸先行者的客户。用开源打商业竞品,这是Cloudflare从Workers时代就玩熟了的剧本。
第三层,也是最容易被忽略的一层:这是通用大模型"去能力化"趋势的又一证据。过去一年,我们看到embedding、重排序、代码补全陆续从通用模型剥离成专用小模型,现在轮到"判断"。通用大模型最终可能只剩下它不可替代的核心——开放式的推理与生成。每一次剥离,都是对"规模万能"叙事的一次修正。
冷静的部分:三个没被解决的问题
写文章不能只当传声筒,说三点我的保留意见。
一,基准的独立性存疑。 43项基准是Cloudflare"自测"的,Clef恰好综合第一——自家考试自家出题是行业惯例,但参考价值要打折。更值得注意的是Clef在When2Call(判断"何时该调用工具")上明显落后Jev十个百分点,而这恰是Agent场景里最微妙的判断。
二,概率校准在分布漂移下的表现未知。 Brier损失在训练分布内保证了诚实,但客服话术、攻击模式、业务规则都在漂移。决策模型的概率在三个月后是否还可信,才是生产环境的真问题。这也解释了为什么Cloudflare急着上RL微调平台——不是增值服务,是刚需补丁。
三,“泛化类别"有其边界。 决策模型不需要为新类别重训的前提,是任务本身在基座模型的理解范围内。真正冷门的领域知识(复杂金融合规、小语种医疗术语),零样本概率的可信度存疑,最终还是走向微调,而微调又回到了数据飞轮的军备竞赛。
我的判断
短期(一年内),决策模型会成为Agent框架的标配组件,就像今天的向量数据库——每个严肃的Agent栈里都会有一个39毫秒级的判断层,LangChain之类的框架会出现对应的抽象。中期,竞争焦点从模型本身转向数据闭环:谁能让企业用自己的历史决策数据低成本微调并持续校准,谁就赢,这也是Cloudflare RL平台和FDE团队的真正赌注。
至于更远的问题——当判断、生成、执行彻底分层之后,“Agent"这个概念本身会不会消解成一堆互相调用的专用模型加一段编排代码——我认为答案是肯定的,而且那未必是坏事。智能系统的历史反复证明:工程化的分层,比一体的"通用智能"更能穿越周期。
39毫秒很短,但它标记的架构转向,会比大多数人预期的更长久。