8月13日,三个价格信号

把8月13日这几条新闻放在一起看,会发现一件很有意思的事。

同一天,Google发布了Gemini 3.7 Flash——距离上一代只有三周,编程能力大幅提升,在Artificial Analysis的指数上逼近GPT-5.6 Sol,价格直接砍半。这已经不是降价,是价格战。

同一天,OpenAI预览了Ultrafast模式:由Cerebras晶圆级芯片驱动,GPT-5.6 Sol的推理速度提升至标准版的14倍,最高750 tokens/秒。注意两个细节:没有公布价格,且只面向"精选的企业API客户"。

再往前一天,DeepSeek发布V4 Pro正式版和开源Agent框架Harness,同时把API缓存命中费用上调至原来的6倍——一家以价格屠夫著称的公司,开始从自己的价格战里往回收钱了。

降价50%、溢价14倍(价格未定)、缓存涨6倍。三个信号方向看似矛盾,其实指向同一个结论:token市场正在裂成两半——一半在打价格战,拼命把自己变成大宗商品;另一半在制造稀缺,把"快"包装成新的奢侈品。

而最能说明问题的背景数据来自Ramp:Anthropic最强的模型Fable 5,只占Anthropic API总支出的6%。尽管它在多项基准测试里被评为"市面最强",企业客户就是不愿意为最强的那个模型付最强的钱。

聪明,已经卖不动溢价了。

为什么聪明卖不动了

Fable 5的6%不是孤例,它是整个行业的体检报告。

过去两年,前沿模型之间的能力差距在快速收窄。当Gemini 3.7 Flash能在编程基准上逼近GPT-5.6 Sol,当开源的DeepSeek和GLM系列在后训练上追平闭源中坚型号,“最强模型"这个头衔的持有人换得比手机发布会还勤。基准测试的分数差异,已经小于企业切换供应商的迁移成本。

经济学上这叫同质化。一旦商品同质化,定价权就转移给买方,价格向边际成本收敛。Google显然想明白了这一点,所以它的策略是加速:三周一代的迭代节奏加上每次降价,本质上是抢着把自己变成"默认商品”——反正都一样强,那就买最便宜最顺手 的。

但OpenAI选了另一条路。Ultrafast的产品哲学藏在官网那句话里:“Until now, getting real-time speed typically meant choosing a smaller or more specialized model. Ultrafast points to progress in a new direction: more useful work per second.”

翻译一下:过去你要快,就得牺牲聪明(换小模型或蒸馏模型);现在OpenAI把完整的、未经裁剪的GPT-5.6 Sol跑在Cerebras上,同一份智能,不同的时间密度。智能不变,压缩时间。

这就把竞争轴从"智力"挪到了"时间"。

为什么"快"能卖钱,而"强"不能

这里有一个值得深挖的问题:为什么企业不愿意为强10%的模型多付10倍的钱,却可能愿意为快14倍的模型付溢价?

答案在于两种溢价的可计算性完全不同

为智力付溢价,买的是基准测试分数的提升。但基准分数不是钱。一个模型在HLE上多对几道PhD级问题,对企业客户的损益表没有任何直接影响——它需要经过"也许能做出更好的产品"这种模糊的因果链才能变现。模糊的因果链,在采购预算里就是可以砍的项。Fable 5的6%占比,就是千万个CFO共同投票的结果。

为速度付溢价,买的是可直接换算成钱的秒数

  • 事故响应:生产系统宕机时,每分钟都是SLA罚金和流失的客户。OpenAI自己的团队就在用Ultrafast做incident response——读日志、分析调用链、定位根因,在故障还在进行中时就把修复方案准备好。
  • 购物决策: shopper犹豫的30秒里给出个性化回答,犹豫变成下单和变成弃购的区别。OpenAI官方场景列表里明确写了"before hesitation becomes an abandoned cart"。
  • 金融与安全:市场信号还在变化时完成交易评估,攻击还在进行时完成检测响应。这些场景里,“晚到正确的答案"约等于"错误的答案”。

Cerebras给出了一个量化案例:在GDP-Val(专门测"有经济价值的知识工作"的基准)上,Ultrafast带来5.6倍端到端加速,质量零损失。另一个直观的数字:跑完Humanity’s Last Exam全部2500道题,GPT-5.6 Sol Ultrafast用了11小时11分,而Claude Fable 5需要78小时27分——同样的准确率,一个工作日对三天半连续计算

“更快但一样聪明"可以直接翻译成"同样的工资,多雇了几个人”。这种溢价不需要说服CFO,CFO自己会算。

还有一层更容易被忽视:Agent时代的延迟复利。单个对话里,人从生成速度50 tok/s提升到750 tok/s,体验只是从"流畅"变成"飞快"。但Agent会循环调用模型几十上百次,每次调用的延迟会复利式叠加。更糟的是,慢的Agent还面临"上下文漂移"——世界在变,Agent的推理世界还停在三分钟前。OpenAI研究员Jeffrey Wang那句话值得细品:“以前我要等两分钟的任务,现在在我来得及切换上下文之前就完成了。“这句话描述的不是爽感,是一种全新的工作范式:人机协作第一次可以在同一个思考节奏里发生。一夜跑完的批量实验,变成工作时间内可以迭代多轮的交互式研究。

快的物理学:为什么14倍速注定是奢侈品

但"快"有一个"强"没有的麻烦:它受物理定律约束,而且这种约束天然反规模。

先看GPU推理的基本经济学。GPU推理靠**批处理(batching)**赚钱:把几十上百个用户的请求打包成一批,权重从显存搬进计算单元一次,服务所有请求。规模越大、批越满,每个token摊到的成本越低。这是云计算的经典逻辑——共享摊薄成本。代价是延迟:请求要排队凑批,生成要按批的节奏走。

Cerebras的晶圆级引擎(WSE)走的是彻底的反方向:在一块晶圆大小的芯片上堆44GB片上SRAM,让模型权重常驻片内,token像流水线一样穿过一层层计算单元。没有权重搬运,没有排队凑批,单请求延迟被压到极致。Cerebras的说法很直白:前沿模型的推理瓶颈不是算力,是数据搬运——GPU上权重在片上缓存和显存之间反复搬运,才是慢的根源。

问题在于,这套架构是batch-1经济学:一颗晶圆在同一时刻基本只服务一个请求流。GPU靠共享赚钱,WSE靠独占赚钱。独占意味着产能刚性稀缺——Cerebras的晶圆产量短期内不可能跟上需求,这也解释了为什么Ultrafast只能是"limited preview”、“select customers”、以及那个意味深长的未公布价格

未定价不是没想好,是奢品定价法:先筛出"每秒都值钱"的客户(金融、电商、安全、运维),按支付意愿而非成本定价。供应受限+需求刚性+溢价按时间而非智力计价——这和爱马仕配货的逻辑没有本质区别。

对OpenAI来说,这笔账还有一层:这是它首次在生产环境采用非NVIDIA硬件做推理。当推理工作负载可以在不同架构的硬件间迁移,GPU的护城河就从"生态锁定"退化为"性价比选项”。硬件异构化一旦开始,推理成本的想象空间就打开了。

裂成两半之后,中间往哪去

把趋势外推一步,可以预见三个连锁反应。

第一,速度分层会成为标准产品形态。 今天是Standard和Ultrafast两档,明天大概率是按延迟SLA定价的完整价格表——token计费之外,会出现"每秒token数"作为独立的计费维度,甚至按时间而非按量计费的尝试。Google有TPU自研芯片,跟这个牌桌毫无障碍;真正尴尬的是租算力的Anthropic——它既没有自研推理硬件,也没有公开的异构合作伙伴,Fable 5卖不动溢价、又拿不出速度故事,是被这轮变化夹得最疼的玩家。

第二,中间层模型最先死。 市场底部是价格趋近边际成本的开源和Flash型号,顶部是"贵但快/贵但强"的奢品型号。夹在中间的中档闭源模型,论价格打不过开源,论独特性够不着奢品,是这场分裂里最脆弱的位置。选型时如果你的架构里有一个"中不溜"的默认模型,值得重新审视。

第三,延迟会成为架构设计约束。 对开发者而言,这次的启示不是"要不要买Ultrafast",而是把延迟分层写进系统设计:同一个产品里,补全和建议走廉价快速层,事故响应和交易决策走高速层,模型身份和速度档位都做成可替换的配置而非硬编码。OpenAI自己的开发者指南已经在教"按任务复杂度动态切换模型"这一课——下一步就是按时间敏感度切换速度档。

结语:稀缺性的迁徙

大模型行业这两年一直在争论什么是真正的护城河:参数规模、数据、生态、算力。8月13日这三个价格信号给出了阶段性的答案——当智力不再稀缺,稀缺性就迁徙到了时间上

DeepSeek涨价6倍是在承认:便宜不再是武器,稳定的质量和Agent生态才是。Google半价甩卖是在抢:商品市场的默认位只有一个。OpenAI卖14倍速是在赌:企业不为分数付钱,但会为秒付钱。

哪条路对?也许都对——它们本来就在分裂后的两个市场里。真正确定的是:“一个模型、一份价格"的时代结束了。以后你买的不是智能,是特定时间密度下的智能。而时间,是唯一无法蒸馏的东西。


参考:OpenAI: Previewing UltrafastCerebras: Accelerating GPT-5.6 Sol UltrafastThe DecoderRamp支出数据