Hot Chips 2026 上演了耐人寻味的一幕:OpenAI 与 NVIDIA 在同一天回答了同一个问题——大模型推理到底需要什么样的芯片——却给出了方向相反的两个答案。
OpenAI 交出了首款自研推理芯片 Jalapeño 的首批实测成绩:额定 700 瓦的单一架构,在 SemiAnalysis 的 InferenceX 公开基准上,同时做到更高吞吐与更低延迟。NVIDIA 则宣布 Groq 3 LPX 全面量产:单芯片 500MB SRAM 的数据流架构,靠一个机架 256 颗 LPU 在 Gemma 4 31B 上跑出 3400 tokens/s 的历史纪录,代价是完整跑 DeepSeek V3 需要约 1342 颗芯片、五个以上机架。
一边是把平衡做进单芯片,一边是把分工做到机架级。这个分野本身比任何跑分都值得深挖。本文以 Jalapeño 官方公布的数据为主线,拆解三件事:数字到底该怎么读、架构上打破了什么、以及藏在新闻标题之下那个更深的变量——Agent 正在改写推理的经济学。
一、先把数字读对
OpenAI 给出的 headline 数字有三组:峰值吞吐下每瓦 AI 工作量是对比系统的 1.5~1.9 倍;端到端延迟降低 1.7~3.6 倍;高交互负载性能高出 2.1~4.1 倍。测试跑了三个开源模型:GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T。
具体到 GPT-OSS 120B(对比 GB200,封装 TDP 1200W vs Jalapeño 700W):峰值混合吞吐每千瓦 85,448 vs 44,960 TPS;端到端延迟 1.03 秒 vs 1.80 秒;最小 token 间隔(TBT)0.69ms vs 1.87ms——折算单用户体验为 1459 vs 535 tokens/s。
真正扎眼的是另一组数字:「在上一代最佳 TBT 点位上,每瓦吞吐高出 53.7 倍」,DeepSeek R1 上则是 104.3 倍。三位数的倍数不是魔法,而是 Pareto 前沿形状的必然:延迟-吞吐曲线在极低延迟区间极其陡峭,当新硬件把曲线整体外推,在旧硬件被迫接受的延迟约束下,能塞进的并发量差距会被指数级放大。换句话说,104 倍衡量的是「以旧体验为约束时的容量差距」,它真实,但需要语境。
同样需要语境的是对比集:官方附录里的对手是 GB200/GB300,按公开 TDP 归一化,而不是 NVIDIA 下一代 Rubin。还有一个对 OpenAI 有利却没大肆宣扬的细节:归一化用的是 700W 额定功耗,而实测持续功耗不超过 550W——真实每瓦效率比纸面数字还要好上一截。
所以严谨的结论是:单芯片绝对吞吐未必碾压,但在「同等用户体验约束下的每瓦工作量」这个维度上,Jalapeño 确实站上了新的 Pareto 前沿。而这恰恰是最值钱的维度——原因见第三节。
二、取舍是怎么被打破的
传统推理系统有个公认的交易:要么高吞吐(大批次 batching 摊薄成本、延迟高),要么低延迟(小批次响应快、成本高)。通用 GPU 的架构决定了你只能在曲线上选一个点。
根源在于语言模型推理的相位分裂。Prefill(处理 prompt)是算力密集型,decode(逐 token 生成)受内存带宽约束,而跨芯片通信又会让算力单元空等数据。为某个相位优化的系统,会在相位切换时把优势吐回去——数据在计算、内存、网络之间搬来搬去,每一跳都是延迟和能耗。
Jalapeño 的设计哲学可以浓缩成一句话:最小化数据搬移。官方披露的关键选择有三个:
- KV 缓存显式本地驻留。生成过程中的模型状态不必在资源间迁移,可以显式放置并保持在本地——直接砍掉推理中最昂贵的那类数据移动。
- 网络是架构的一部分,而非外挂。大域网络让整个工作负载留在单一连接系统内,请求从头到尾不跨系统边界。
- 均衡且可置换(balanced and fungible)。同一架构同时胜任 prefill 与 decode,且随两者比例变化自适应——这正是 agent 负载的定义特征:一次任务里 prefill 与 decode 的比例是持续漂移的。
注意这里没有出现任何「堆 HBM」「堆 SRAM」的暴力美学。Jalapeño 的路线是把调度自由度做进硬件与网络的拓扑里,让「哪个计算挨着哪个数据」变成可编程的决策。这更像 Google TPU 十年路线的延伸,而不是通用 GPU 的改良。
三、Agent 改变了推理的物理学
为什么「同等体验约束下的每瓦」成了新货币?因为 Agent。
单轮对话里,延迟只是一次体验的瑕疵;Agent 任务是 N 步串行执行,每一步的延迟会复利累积。一个 50 步的 agent 任务,单步省下 1 秒就是近一分钟的用户等待——延迟从「体验问题」变成了「任务能否完成」的功能性问题。这正是 OpenAI 选择在 matched user experience 下度量每瓦工作量的原因:他们真正优化的是「每个任务的成本」,而不是「每个 token 的成本」。
TBT 是这场转变里的体验货币。0.69ms 对 1.87ms 的差距,在人类阅读场景几乎无感,但在 agent 串行调用、流式解析、边解码边触发工具的场景里,是「顺手」与「卡顿」的分界。当高交互负载的性能差距拉到 2.1~4.1 倍,意味着同样一套基础设施能供养的 agent 并发密度完全不同。
对做产品的开发者,这个转变很实际:你的 agent 成本模型该从「按 token 计价」迁移到「按任务计价」——其中延迟是隐性乘数。硬件层 3.6 倍的延迟改善,在 50 步任务上是乘上去的,不是加上去的。
四、被低估的部分:AI 设计了运行 AI 的芯片
多数报道聚焦跑分,但 Jalapeño 发布里最值得长期关注的细节藏在工作流里。
从初始设计到 tapeout 只用了九个月,OpenAI 称这是高性能先进制程 ASIC 史上最快的开发周期。怎么做到的?模型直接参与了设计:探索实现方案、压缩设计-测量-验证的循环、优化算术电路。更关键的是反向的那一半:芯片被刻意设计成「对人类和 AI 都清晰可预测的编程目标」——本地张量、显式通信、可预测的同步。并行编程这个困扰业界几十年的难题,第一次被当作「给 AI 的 API 设计问题」来对待。
结果是可验证的:对 GPT-OSS 选定的 attention 和 MoE 模块,AI 生成的实现比人类专家手写的快 1.5~1.8 倍;用 Codex 配合 GPT-Astra,团队在两个月内把三个原本不在生产计划里的开源模型调到高性能。
我的判断是:芯片性能优势是可以被追赶的——架构层面的领先通常 18~36 个月就会被对手吸收。但「用模型加速芯片迭代」这个循环一旦跑通,它的复利不在单代产品上,而在每一代的开发速度上。这才是 multigenerational roadmap(Gen 2 已在深度开发、Gen 3 成形中)真正可怕的地方:如果每一代都比对手早半年到位,Pareto 前沿就会被持续外推,追赶者面对的永远是一个移动靶。
五、产业棋局:Broadcom 稳赚,NVIDIA 双线作战
把镜头拉远,Jalapeño 的产业含义有三层。
Broadcom 是最稳的赢家。 Google TPU 走通的「客户自研架构 + Broadcom 硅实现」路径,如今被 OpenAI 复制(系统侧还有 Celestica 负责板卡、机架与整机)。Hock Tan 的公开说法是 2026 年起与微软等伙伴部署吉瓦级数据中心。无论通用 GPU 份额如何变化,定制加速器这条线的代工抽成都落进 Broadcom 口袋——在铲子战争里,卖铲人的逻辑最稳。
NVIDIA 的角色是双面的。 OpenAI 明确说会继续大规模部署 NVIDIA 及其他伙伴的加速器(训练与推理都需要);但同一天 NVIDIA 自己用 Groq LPX 展示了另一条推理路线——极致 decode 带宽、机架级聚合、GPU 做 prefill 加 LPU 做 decode 的混合形态。NVIDIA 同时在通用 GPU 和专用数据流两条线上押注,本身就是对「推理不是一种工作负载」的承认。
推理硬件进入按相定制时代。 选型的基本单位正在从「几卡」变成「我的负载瓶颈在哪个相位」:交互密度高的 agent 服务看 TBT 前沿,批量离线处理看每瓦峰值吞吐,混合负载看 Pareto 中段。单点 token/s 排行榜对采购决策的误导性会越来越强。
六、值得保持怀疑的地方
作为技术读者,有几处需要挂起判断:
- 对比集止步于 GB200/GB300,Rubin 未入列;「内部前沿模型上优势进一步扩大」的说法无法独立验证——而这恰恰是最影响 OpenAI 自身经济性的部分。
- InferenceX 是公开基准,真实产品的混合负载(长上下文、多租户、工具调用交错)下表现如何,要等年底部署后的第三方数据说话。
- 自研芯片的真正考验从来不在首发跑分,而在规模化运维:良率、固件迭代、故障域管理、与既有 serving 栈的整合。Google 用了十年才把 TPU 做成体系,OpenAI 的九个月只是第一代的首秀。
- 软件生态是长期变量。CUDA 二十年积累的护城河不在硬件峰值,而在「任何新算子都有人替你踩过坑」。Jalapeño 把可编程性押注在 AI 生成 kernel 上,这条路能走多宽,决定它能否承载 OpenAI 系之外的模型与负载。
结语
Jalapeño 的首批实测值得认真对待,但不是因为跑分。它标记了三个正在发生的变化:度量衡变了——从每 token 吞吐到「同等体验下的每瓦」;设计对象变了——从「推理」这个笼统概念到 agent 串行任务的延迟复利结构;开发方式变了——芯片第一次被设计成 AI 可以编程的形状,而 AI 已经开始写得比人类专家更快。
推理是 AI 接触用户的界面,也因此是一切成本最终结算的地方。当这个层面的经济学被重写,上层每一个应用的定价、体验与可行性都会跟着重算。年底 Jalapeño 进入 OpenAI 自有基础设施时,值得回头看这篇的判断对了几成。
参考