2026年7月的最后一天,如果你只看一条AI新闻,你可能会觉得行业仍在沿"更大模型=更强能力"的轨道狂奔。但如果你把今天的新闻放在一起看,一个截然不同的图景会浮现出来:规模竞赛正在让位于一场更深层的效率革命

腾讯混元开源AngelSpec投机解码框架,实现1.98-2.40倍推理加速;Anthropic发布Claude Opus 5,在逼近巅峰性能的同时将每任务成本砍半;小米MiMo-V2.5以每周10.5万亿token的调用量登顶OpenRouter全球第一;腾讯云CodeBuddy NPC把首轮token消耗从2万降到2000——四个看似无关的事件,实际上指向同一个判断:

AI竞争的护城河,正在从"谁的模型更大"变成"谁的推理更便宜更快"。

这不是一个微小的趋势变化,而是一次竞争维度的根本性转移。

一、投机解码:从学术技巧到工程标配

要理解这场效率革命的技术内核,AngelSpec是一个很好的切入点。

什么是投机解码?

传统大语言模型(LLM)生成文本时采用自回归解码——每次只生成一个token,然后把它附加到输入中,再预测下一个token。这种方式有一个显而易见的缺陷:GPU大部分时间在等,而不是在算。每次前向传播只产出一个token,计算密度极低。

投机解码(Speculative Decoding)的核心思路是:用一个小而快的"草稿模型"(drafter)快速猜测接下来多个token,再用大模型一次性验证这些猜测。如果草稿模型猜对了5个token中的4个,大模型一轮验证就能产出5个token,而不是5轮各产1个。结果就是:数学上不改变输出分布,物理上大幅减少推理延迟

这个思路2022年就提出了,但长期以来一直停留在论文里。原因很简单:在工程实践中,“草稿模型猜得准"和"草稿模型跑得快"之间存在张力,而不同任务(闲聊、代码、数学)的最优策略截然不同。没有哪个单一方案能"包打天下”。

AngelSpec的突破:不是单点优化,而是系统工程

腾讯混元团队发表的论文(arXiv:2607.25852)揭示了一个更成熟的思路。AngelSpec不再追求"一个通用草稿模型解决所有问题",而是在三个层面同时做优化:

训练层面——协同特化(co-specialization)。MTP(Multi-Token Prediction)草稿模型在多样化对话数据上训练,专攻高熵的开放对话场景;DFly(Block-Diffusion)草稿模型则在代码和数学数据上训练,利用这些领域更长的可预测前缀。不同任务用不同工具,而不是一把锤子敲所有钉子。

架构层面——DFly框架。它把目标模型的条件信息(target-conditioning)和块内自回归依赖(predecessor-conditioned AR head)结合起来,既提高了对大模型特征的利用率,又建模了候选序列内部的依赖关系,同时保持了生成的并行性。

推理层面——动态验证。接受长度和验证成本随领域、请求、负载和硬件变化,DFly把验证视为一个批处理级别的共享资源:它在不同请求之间重新分配计算资源,把算力倾斜给高置信度的前缀,并用一个profiled成本模型在线调整验证深度。

这套组合拳的效果是:在Hy3-A21B模型上,DFly将平均接受长度提升约30%,在4到64并发的所有测试点上取得最高平均吞吐量——相比自回归基线加速1.98-2.40倍,代码和数学任务峰值达2.86倍。此外,D-cut技术在高并发场景额外提升15.7%吞吐,MTP结合TTT(Test-Time Training)将对话接受率从52.8%提升到66.4%。

这些数字的含义很明确:投机解码已经从"偶尔有用的技巧"变成了"生产环境中稳定2倍加速的工程方案"

二、成本 Halving 的乘数效应

如果说AngelSpec解决的是"如何让推理更快",那么Claude Opus 5代表的趋势是"如何让推理更便宜"。

Anthropic在7月24日发布的Opus 5,定价与上一代Opus 4.8完全相同($5/$25每百万token),但在CursorBench 3.2上的性能仅落后当前最强模型Fable 5峰值0.5%,而每任务成本只有一半。在ARC-AGI 3上,Opus 5的得分是次优模型的三倍。Frontier-Bench v0.1上超越所有模型。

同等价格,性能逼近巅峰;同等性能,成本砍半。

这对于AI应用的经济学意味着什么?

考虑一个典型的AI编程助手场景。假设一个团队每天产生100万次API调用,每次调用平均消耗5000 token。在Opus 4.8时代,这个团队每天的花费大约是$25,000(按输出token计算)。换成Opus 5,如果性能需求不变,他们可以选择更少的调用次数达到同样效果(因为每次更准确),或者保持调用次数但把成本控制在$12,500左右。

省下来的$12,500/天,就是AI应用从"可用"走向"普及"的空间。

这也是为什么Opus 5不是一个简单的版本迭代——它是Anthropic在两个月内发布的第四款Claude 5系列模型。这个节奏本身就说明了问题:前沿实验室的竞争已经从"一年发一个大模型"变成了"两个月内通过效率优化连续迭代四次"。

三、Token消费的结构性转变

小米MiMo-V2.5在OpenRouter上以每周10.5万亿token、每月31.2万亿token的调用量排名全球第一,中国大模型合计占据全球LLM调用的63.5%——这个数据初看令人惊讶,但细想完全合理。

当推理成本降到足够低,使用量就会指数级爆发。

这就是"杰文斯悖论"(Jevons Paradox)在AI领域的完美演绎:19世纪英国经济学家杰文斯发现,当蒸汽机的效率提高时,煤炭消耗不但没有减少,反而增加了——因为更高效的蒸汽机让更多场景的能源使用变得经济可行。同样,当推理成本从"每百万token几十美元"降到"几美元甚至几美分"时,原来因为太贵而无法实现的AI应用突然变得可行了。

智能客服、代码生成、文档摘要、实时翻译、数据分析——这些场景在GPT-4时代都有原型,但无法规模化,因为成本太高。当推理效率提升2-5倍后,这些应用的单位经济模型从负转正,使用量自然暴涨。

MiMo登顶全球调用量第一,与其说是因为模型本身多强(虽然确实不弱),不如说是因为它恰好站在了成本曲线下降和需求爆发的交叉点上。中国模型占据63.5%的全球调用份额,本质上是效率驱动下市场规模优势的体现。

四、Agent范式对推理效率的刚需

今天日报中的另一条新闻——腾讯云CodeBuddy NPC——则从另一个角度揭示了效率为何变得如此关键。

CodeBuddy NPC采用"AI Native Git"范式,开发者只需在Issue中@NPC派发任务,智能体就能自主完成从方案规划到代码交付的全流程。最引人注目的数据是:首轮token消耗从2万多个降至约2000,降幅超90%

Agent不是一次API调用,而是数十甚至数百次API调用的链条——理解任务、搜索代码、设计方案、编写实现、运行测试、根据反馈修改。如果每次调用消耗2万token,一个复杂任务可能消耗数百万token。在传统定价下,这种成本只有大型企业能承受。

当首轮token消耗降到2000,Agent的经济学模型就完全不同了。

这也是为什么蔡浩宇(米哈游创始人)会判断"Agent才是未来"——不仅仅是技术判断,更是经济学判断。Agent需要密集的、多轮的、持续的推理,这意味着推理效率的提升对Agent的可行性有乘数效应。一个2倍速的投机解码框架,对于单轮对话来说只是"快了一倍";但对于一个需要50轮推理的Agent来说,可能是"能不能用"和"不能用"的区别。

字节跳动把飞书并入豆包、阿里整合"千问办公"、360推出AI助手——巨头同时涌入AI办公Agent赛道,背后都有一个共同的假设:推理成本已经降到了Agent大规模商用的临界点

五、竞争逻辑的重写

把所有这些线索连起来,我们可以看到一个更大的图景:

**2023-2025年,AI竞争的核心是"谁的模型最强"。**更大参数、更多数据、更长训练时间。Scaling laws统治了行业叙事,万亿参数成了里程碑。

**2026年,竞争的核心正在变成"谁的推理最高效"。**同样的性能,一半的成本;同样的成本,两倍的速度;同样的速度,更智能的资源分配。

这个转变的原因是结构性的:

  1. **Scaling laws的边际收益在递减。**从10B到100B是质的飞跃,从100B到1T的增量越来越小,而训练成本却指数级上升。纯粹的规模扩张已经不再是性价比最高的路径。

  2. **应用层的爆发倒逼推理降本。**当AI从"demo"走向"产品",从"尝鲜"走向"日常使用",单位经济效益(unit economics)成了生死线。一个每月亏损百万美元的AI应用不可能长期存活。

  3. **硬件供给的瓶颈。**Nvidia H100/B200的产能不是无限的,而推理需求远大于训练需求。在同样的硬件上跑出更多token,比买更多GPU更现实。

  4. **开源生态的追击。**当Kimi K3这样的开源模型性能接近前沿闭源模型,闭源实验室的护城河不能只靠"我的模型比你强10%"——必须靠"我的推理比你便宜50%"。

六、接下来会发生什么

基于以上分析,我对未来6-12个月有几个判断:

**投机解码将成为中大型模型的标准配置。**AngelSpec开源了从训练到部署的全链路工具,意味着任何有一定工程能力的团队都可以为自己的模型定制草稿模型。这会推动投机解码从"头部实验室的秘技"变成"行业基础设施"。

**推理成本将以每年30-50%的速度下降。**这不是单一技术的功劳,而是投机解码、量化(quantization)、KV cache优化、动态批处理(dynamic batching)等多种技术叠加的效果。每一项贡献10-20%,组合起来就是指数级的成本下降曲线。

**Agent应用将在2026下半年迎来爆发。**当推理成本降到足够低、速度提到足够快,那些"理论上可行但经济上不可行"的Agent应用就会批量上线。办公、编程、客服、研究——这些场景是最先受益的。

**中国AI的规模优势将进一步放大。**中国开发者对成本极其敏感,中国用户对免费/低价AI服务的接受度极高。当推理效率成为核心竞争维度,中国的规模优势(用户基数、数据量、应用场景多样性)就会转化为真实的调用份额优势——MiMo登顶OpenRouter只是一个开始。

结语

回到开头的判断:AI竞争的护城河,正在从模型规模转向推理效率

这不是说规模不再重要——万亿参数模型仍然是前沿能力的天花板。但"天花板"和"地板"之间的距离,越来越取决于你能在多大程度上压低推理成本、提升推理速度。

AngelSpec、Opus 5、MiMo、CodeBuddy——它们各自是不同赛道上的优秀产品,但放在一起看,它们共同标记了AI行业竞争逻辑的一次根本性转向。

在规模竞赛的时代,赢家的公式是"更多GPU+更多数据+更大模型"。

在效率竞赛的时代,赢家的公式将是"更聪明的解码+更精准的资源分配+更低的单位成本"。

前者是暴力美学,后者是精算艺术。

AI行业的下半场,拼的是后者。


本文基于2026年7月31日AI洞察日报的分析延伸,仅代表作者独立观点,不构成投资建议。