一个反直觉的数字
Vercel 刚发布的 AI Gateway 八月生产指数(统计七月数据)里,藏着一段容易被当成花边的数据:
Anthropic 只处理了全网关 30% 的 token 量,却收走了 65.1% 的支出。它的单 token 均价,是其他所有厂商平均值的 4.4 倍——而这个倍数上个月还是 3.4。
一边是均价全线上涨,一边是全平台平均 token 价格在七月下降了 13.6%。这两个数字同时为真,而且互相解释。
过去两年,关于"模型价格战"的叙事一直很粗:开源模型把价格打下来、闭源厂商守着溢价。但 Vercel 这份月度报告给出了更细的颗粒度,足以看清推理市场真实的运行机制——它已经不是一条价格曲线,而是一个按任务分层定价的市场结构。而这个结构,正在越来越像电力行业。
七月到底发生了什么
先把数据摊开。Vercel AI Gateway 每月路由数万亿 token 的生产流量,是少有的能反映企业真实用模行为的公开样本:
- 全平台 token 量环比增长 59%,支出增长 37%,平均 token 价格下降 13.6%;
- DeepSeek 七月超越 Google,成为按 token 量计的第二大厂商,跑掉了全网约四分之一的流量,是 Google(11%)的两倍多;
- Google 的份额从四月的 40% 跌到七月的 11%,丢掉的份额几乎全部流向 DeepSeek,且集中在个人助手类消费场景;
- 开源权重模型占了 36% 的 token 量,但只拿走 8.6% 的支出;
- 四大前沿厂商合计的支出份额七个月来首次跌破 93%,降到 89%。
最有信息量的是这一句:81% 的七月 token 跑在六个月前还不存在于网关上的模型里。
这不是一个"大家换了个便宜模型"的故事。这是一个市场用半年时间完成了重新分层的故事。
分层:企业不是在买"模型",是在买"任务"
报告里有一个被 Vercel 自己点破的行为模式:采购方先按任务要求给模型分层,再在层内按价格选择。 “DeepSeek 和 Opus 从来就不在竞争。"(DeepSeek and Opus were never competing.)
具体表现:
- 三分之四月消耗量超过千万 token 的团队,至少调整了十分之一的模型组合;五分之三调整了四分之一以上;
- OpenAI 新增流量的 85% 跑向了 GPT-5 家族里最便宜的 GPT-5-Nano;
- Google 丢掉的消费级份额,大部分流向 DeepSeek 的 V4 Flash——这个全网最便宜的模型之一,七月单模型跑的 token 比 Google 全部模型加起来还多。
用电力行业类比就非常直白:没人会因为"工业高压电更先进"就给手机充电接一万伏。电压等级由用电器决定,模型等级由任务决定。 批量分类、摘要、嵌入这类高并发任务跑便宜模型,就像工厂机器接工业电;编码 Agent 这种长链路任务跑 Opus 级模型,就像精密设备接稳压电源。价格差不是缺陷,是市场在给"可靠性"定价。
一个佐证:在编码 Agent——网关按 token 计最大的单一用例——里,Anthropic 拿走了超过 80% 的支出。跑长任务的 Agent 对模型失误的容忍度极低,一次 derail 的成本远超省下的 token 钱,所以最贵的模型反而拿走最多的钱。
溢价:4.4 倍的经济学
Anthropic 能收 4.4 倍均价,靠的不是模型榜单,而是两个结构性位置:
第一,卡住了付费意愿最强的场景。 编码 Agent 是目前验证最充分的 AI 付费场景,Anthropic 在这个用例里的支出份额超过 80%。Claude Code 已经成为其核心收入引擎——外部报道显示 Anthropic 年化收入从 2025 年底的约 90 亿美元涨到 2026 年七月的超过 650 亿美元,编码工具是第一驱动力。当你的 Agent 在生产环境里每天跑几小时,模型的可靠性和 harness 的纠错能力直接决定任务成功率,此时单价的重要性急剧下降。
第二,高端供给的稀缺性被监管放大了。 报告里轻描淡写地提了一句:Fable 5 七月一日回归,此前因出口管制被暂停三周。恢复当月它就冲到网关支出的 13.2%,仅次于 Opus 4.8,而且当月使用 Fable 5 的团队 90% 是新客户。被禁三周的高端模型,解禁当月就吸引九成新客户——高端推理是卖方市场,这个信号比任何定价策略都硬。
但溢价不是没有代价的。Anthropic 的支出份额连续数月超 60% 的同时,token 份额在掉(30%,环比降两个点)。它守住的是每 token 最值钱的那 30% 流量。这是一场主动的退守:放弃量、守住价,靠编码 Agent 和企业工作流的高粘性变现。
结构:从卖模型到卖"每任务成本”
这份报告里,真正值钱的是"Cost per Task"这个视角的浮现。
当企业按任务分层、按价格路由,采购的核心指标就从"每 token 多少钱"变成了"每任务多少钱、成功率多少"。这对行业有三个直接推论:
推论一:模型路由成为默认架构。 报告里四分之三的团队在一个月内调整了模型组合,说明"模型组合"本身已经是工程对象。网关、路由器这类中间层的价值会继续上升——它们的职责就是把"什么任务跑什么模型"从人工决策变成自动决策。杰富瑞同日的另一份 Agent 实测报告也指向同一件事:Agent 竞争的胜负手正从模型分转向 Harness 分(驾驭模型的外围工程),评估会从"模型榜"走向"任务榜"。
推论二:开源权重的商业模式跑通了,但跑的是"量"的逻辑。 K3 七月十六日发布后,日流量三周翻了三倍,到月底单模型流量追平 Claude Opus 4.8;开源权重支出份额首次翻倍到 8.6%,增量几乎全部来自 Moonshot 和智谱。注意 Vercel 的原话:K3 和 GLM 5.2 是"第一批在闭源厂商传统领地里跑出有意义份额的开源模型"——不是靠更便宜抢低端,而是靠够用的能力+明显更低的价格切走了中端任务。11 倍于 DeepSeek 的单价还能放量,说明"够好+不贵"的中间带是真实存在的市场。
推论三:规模路线和成本路线同时加码,并不矛盾。 同一天的新闻里,字节 Seed 为传闻中超 5 万亿参数的模型重组了预训练数据和 RL 团队。表面看,一边 token 均价暴跌、一边参数规模暴涨,像是行业精神分裂。实际是同一枚硬币的两面:极致便宜的高压电(超大规模 MoE 摊薄推理成本)和极致精密的稳压电源(前沿闭源模型收溢价)都在扩张,中间的"通用型"模型被两头挤压。电力行业一百多年前就演过这一幕。
判断:token 会消失在账单里
把这个结构外推几年,我的判断有三条:
第一,token 定价会被"任务定价"逐步包裹。 就像没人按"度"买电、而是按用电套餐付费一样,当路由层成熟后,企业看到的报价会越来越是"每千次成功任务"而不是"每百万 token"。token 会沉到账单底层,成为基础设施的内部计量单位。先行者已经在做:各大云厂商的 Agent 平台报价里,任务成功率开始和单价并列出现。
第二,溢价会收窄但不会消失,因为它的来源是风险定价而非性能定价。 Anthropic 的 4.4 倍里,有多少是"能力溢价"、多少是"免检溢价"(高端客户不愿在生产链路里做质量验证的替代品),值得拆开看。当开源模型在编码场景的可靠性数据积累足够,倍数会下来——但只要长链路任务的失败成本居高不下,愿意为确定性付钱的买家就一直在。
第三,最大的赢家是掌握路由的中间层。 在电力行业,发电厂(不管烧煤还是核电)利润率长期远低于电网。如果分层结构固化,模型厂商会滑向发电厂的位置,而网关/路由/harness 层拿走客户关系和定价权。Vercel 发这份报告本身就是一种位置宣示:我在计量表的位置上。
尾注:一份月报的稀缺性
最后值得说一下这类数据本身的价值。训练侧的叙事(参数、benchmark)从来是厂商自报,而推理侧的真实流量数据极度稀缺——Vercel、Ramp 这类平台各自只看到切片,但每一个切片都在修正我们对中国模型"只有量没有钱"的旧印象:K3 用 11 倍于 DeepSeek 的单价拿到了真实的企业支出。
下次看到"某模型屠榜"或"某模型价格击穿地板"的新闻,可以先问一句:它跑在哪一层?对推理市场来说,层比榜重要。
数据来源:Vercel AI Gateway Production Index(2026年8月)、The Decoder、Reuters 相关报道。