一天之内,三条降价曲线同时陡降
2026年9月23日的AI日报里,出现了耐人寻味的一幕:三条与"价格"相关的新闻在同一天落地,而且来自三个不同阵营。
第一条来自Anthropic。新一代旗舰Claude Opus 5.5发布,官方基准显示Terminal-Bench 4.0达到66.4%,显著超过Fable 5.1的55.8%和GPT-6 Astra的57.9%;Humanity’s Last Exam拿到67.7%。但比性能曲线更值得注意的是成本曲线:定价降至每百万token输入4美元/输出20美元(降幅20%),缓存读取成本直降60%,叠加token用量减少与输出提速30%以上,综合运营成本较上一代Opus降低约40%。
第二条来自OpenAI。GPT-6系列新成员Sol与Luna发布,API价格直接砍半。The Decoder的评测很直白:性能提升有限,这两款模型的核心价值就是"token价格减半"——把Astra级别的能力搬运到低价位段,被普遍解读为对中国低价模型的正面回击。
第三条来自中国阵营。小米MiMo-V2.6-Pro登顶开源模型榜单,同时以远低于竞争对手的API定价发起攻势;此前MiMo系列已以"数小时级自主编码"对标Claude Opus。更有意思的细节是,Anthropic自己承认Claude在小米的训练流程中发挥了作用——头部模型的能力正在通过蒸馏、合成数据等路径快速"泄漏"到低价开源模型中。
三件事孤立看都是常规的产品迭代,放在同一天看,指向的是同一个事实:前沿推理成本已经进入结构性通缩通道,而且这不是周期性促销,而是产业级趋势。
这不是第一次:通缩的历史斜率
要理解今天发生的事情,需要把它放到过去几年的坐标系里。
大模型推理成本的单价下行早已开始。斯坦福大学HAI发布的AI Index报告曾给出过一个被广泛引用的数字:达到GPT-3.5同等能力的推理成本,在2022年11月到2024年10月的约两年间下降了超过280倍——从每百万token约20美元跌到不足0.1美元(不同供应商的Gemini-Flash级别定价)。那波下降的主要驱动是三个:模型小型化(同等能力所需参数量骤降)、推理框架优化(量化、批处理、投机解码)以及摩尔定律式的硬件进步。
而2025年至今的这波通缩,驱动力结构发生了变化:
第一,效率红利从"训练侧"转向"推理侧"。 早期的成本下降主要靠"把模型做小",现在则越来越多地来自推理环节本身的工程优化——KV缓存复用(Opus 5.5缓存读取降60%就是典型)、投机解码、连续批处理、以及模型自身输出token总量的减少。Opus 5.5所谓"综合成本降40%“是一个复合数字:单价降、缓存降、用量降、速度升,四个维度叠加。这意味着成本优化的责任正在从模型厂商部分转移到应用架构层——同样的模型,架构糟糕的调用方式和架构优秀的调用方式,成本可能相差一个数量级。
第二,竞争格局从"性能竞赛"变成"价格-性能双线作战”。 OpenAI的Sol/Luna明确承认性能提升有限、核心卖点是价格,这在两年前是不可想象的——当时前沿实验室从不公开谈论"性价比"。中国厂商的低价策略把这场战争提前了:当开源模型的性能逼近闭源旗舰、价格只有零头时,闭源厂商只剩两条路——要么更快地拉开能力差距,要么跟进降价。今天我们看到了两手同时打出。
第三,能力扩散的速度快于能力创新的速度。 小米用(据称)Claude辅助的训练流程造出登顶开源榜的模型,说明前沿能力从封闭实验室扩散到开源生态的周期已经压缩到月级。扩散快于创新,意味着任何"能力溢价"的存续时间都在缩短,定价权持续向买方倾斜。
为什么这件事比"模型更强"更重要
成本通缩本身不新鲜,新鲜的是它发生的时机——正好撞上了Agent应用的爆发窗口。
过去两年Agent产品始终面临一个经济学悖论:Agent的价值在于"自主完成多步骤任务",但多步骤任务意味着几十次模型调用、几十万甚至上百万token的消耗,外加大量试错与重试。一个单次对话只需几美分的模型,做成Agent后单任务成本可能达到数美元——而Agent完成任务的质量还不稳定。这个"单位任务成本高于单位任务价值"的缺口,是Agent从demo走向生产环境的最大障碍之一。
通缩正在直接填补这个缺口。做个粗略的算术:假设一个复杂Agent任务需要消耗200万token(含上下文重读与重试),一年前用旗舰模型可能花费60-80美元;今天同样的任务用Opus 5.5(叠加缓存优化)可能降到25美元左右,用Sol/Luna或国产开源模型可能降到5美元以下。当单任务成本从"需要审批的支出"降到"可以忽略的运营成本",应用形态会发生质变——从"用户谨慎地发起一次调用"转向"Agent常驻后台持续运行"。
这正是今天日报中"技术趋势观察"一栏点出的判断:当单次任务成本降到可忽略,应用形态将从"谨慎调用"转向"常驻运行"。常驻运行的Agent意味着完全不同的产品逻辑:监控式的、陪伴式的、流水线式的AI服务会成为可能,而不是今天这种"打开对话框—提问—关闭"的会话式交互。
硬件层的暗流:非硅基路线与端侧生态
成本通缩不只发生在云端API。同一天的日报里还有两条容易被忽略的相关信号。
其一,Biological Computing Co.宣布与AWS合作推出基于实验室培育神经元的文本生视频模型,宣称速度达传统GPU方案的5倍、成本降低约80%。无论其宣称是否经得起独立验证(此前生物计算的商业化承诺大多未能兑现),它代表着一个结构性判断:硅基推理的成本曲线最终会撞上物理与经济极限,市场需要备选路线。 类似地,Multiverse Computing将LLM剪枝建模为Ising优化问题、Hugging Face让Transformers直接支持llama.cpp量化模型,都在从不同角度压缩"单位智能的实际支付价格"——前者减少达到目标性能所需的计算量,后者抹平训练格式与部署格式的边界、让端侧量化部署成本趋近于零。
其二,端侧路线的成熟反过来压迫云端定价。当开源量化模型可以在本地硬件上跑出"够用"的能力,云端API的定价上限就被钉死了——这也是小米们敢于发动价格攻势的底气之一。云、端两条成本曲线正在互相拉扯着下行。
给工程团队的三条启示
如果说这篇文章只留下一件事,应该是:token经济学必须成为架构设计的一等公民,而不是事后优化的杂务。 具体展开为三条:
1. 把"成本观测"做成基础设施。 大多数团队的LLM应用至今没有按任务、按Agent、按用户维度的成本看板。在成本高企时这只是浪费,在成本通缩期这是战略失明——因为你无法判断哪些调用路径值得迁移到更便宜的模型,也无法在厂商降价时快速收割红利。缓存命中率、每任务token消耗、模型路由分布,这三个指标至少要像QPS一样被监控。
2. 模型路由从"优化项"升级为"架构假设"。 通缩期的正确姿势不是选定一个模型,而是默认"多模型、可切换":简单步骤走低价模型(Sol/Luna级别),关键决策走旗舰,重复上下文走缓存。Opus 5.5把缓存读取降价60%,实际上是在奖励为缓存设计的架构——把系统提示、工具定义、历史上下文的组织方式改造成缓存友好的结构,收益可能超过换模型本身。
3. 用"成本弹性"重新评估Agent产品可行性。 一年前因单任务成本过高被否决的Agent产品设想,值得重新拿出来算一遍账。同样的,正在规划的产品应该按照"推理成本每年下降50-80%“的假设做压力测试——不是定价下降,而是成本下降带来的体验升级空间:能不能让Agent从"按需唤醒"变成"常驻观察”?能不能承受十倍于原设计的调用频率?成本通缩给产品创造的想象空间,比给财务报表的大得多。
结语:智能的摩尔定律,与它的代价
单位智能价格的持续下跌,正在成为这个产业最稳定的"物理定律"之一——比任何单次模型发布的性能跃迁都更稳定。Opus 5.5的40%、Sol/Luna的50%、小米的贴身低价,只是这条长曲线上最新的三个数据点。
但通缩从不免费。它在微观上奖励架构能力强的团队、惩罚只会调API的团队;在中观上把闭源实验室的利润率压向刀锋,迫使它们向应用层(如Anthropic自建湿实验室)寻找新价值锚点;在宏观上,它以极低价格向所有人分发强大能力的同时,也把治理难题按同样的斜率放大——OpenAI同日呼吁为递归自我改进AI建立国际标准,正是意识到这一点。
对绝大多数从业者来说,问题不再是"AI能不能做这件事",而是"这件事的调用成本降到临界点了吗"。今天,又有一批任务的答案从"没有"变成了"有了"。而明天还会有更多。
(本文数据与新闻线索来自2026-09-23 AI洞察日报;历史成本趋势参考斯坦福HAI AI Index报告的公开数据。文章观点仅供参考,不构成投资建议。)