资讯动态

AI芯片竞争转向能效:OpenAI自研Jalapeño与NVIDIA Vera Rubin的对决

发布时间:2026/8/29 9:04:50 来源:尧图企业网站定制
最近 AI 圈真正让人睡不着觉的问题已经不再是“谁的模型又大了一个量级”而是另一件事电费怎么付。当前沿模型训练一次需要耗费接近一个中小城市规模的电力当推理流量开始以指数级扩张AI 硬件竞争的胜负手正在从“单卡算力”悄悄切换到“每瓦特能处理多少有效 token”。这就是 OpenAI Jalapeño 芯片传闻最值得关注的地方。一条被反复转发的消息是OpenAI 用约 9 个月完成了一款面向推理的定制芯片设计目标制程是台积电 3nm 级别行业代号 Jalapeño而且有观点认为它在特定推理负载上的能效表现可能超过 NVIDIA 下一代平台 Vera Rubin。但这里我更想给出一个清醒判断Jalapeño 能效超越 Vera Rubin不意味着 NVIDIA 的通用平台神话破灭更不是 OpenAI 要全面“抛弃 NVIDIA”。它真正揭示的是AI 计算竞争的标尺已经变了。从“单卡能跑多少”进化到“每瓦能出多少 token”再进化到“整个数据中心的 TCO 是否可持续”。本文会围绕一条主线展开能效为什么成为 AI 芯片的主角Jalapeño 和 Vera Rubin 各处于什么生态位置厂商口中的能效数据应该怎么科学解读以及作为普通开发者我们能从这场竞争里拿到什么实际价值。1. 为什么能效突然成为 AI 芯片的主角回看过去五年AI 芯片竞争经历了好几个阶段。第一阶段的胜负手是单卡算力V100、A100、H100 每一代都宣称性能翻倍训练时间缩短一倍所有人都盯着 TFLOPS。第二阶段的胜负手转移到集群规模因为单卡再强模型太大也装不下于是出现了“万卡集群”这种工程概念。到了 2024 年以后行业进入第三阶段胜负手变成了集群能效也就是单位电费能支撑多少有效计算。这个转变不是某家公司主动选择的而是被物理约束逼出来的。首先是推理流量的商业化。训练一个模型再贵它也只是一次性的资本支出但推理是持续的运营支出。ChatGPT 这类产品上线后每天产生数百亿甚至更多 token每一次回答都要消耗真实算力、真实电费。当推理总算力需求超过训练总算力能效就决定了一家公司能不能把毛利率撑住。其次是电力瓶颈。高性能 GPU 的峰值功耗已经逼近 1000W一个机柜塞进 8 块卡就是几千瓦的功率密度。数据中心要从几十千瓦向百千瓦级别演进液冷从可选项变成必选项。更关键的是电网容量并不是可以随意扩容的一个大型 AI 集群选址现在最先看的不是离大模型团队近不近而是园区电力余量够不够。所以“能效”在这个语境下不是绿色环保的遮羞布而是实打实的利润来源。同样一天 10 亿 token 的推理负载芯片能效差一倍电费就多出一倍长期算下来是一笔难以忽视的差额。这就是为什么 OpenAI 宁可重新设计芯片也要把能效这个指标握在自己手里。从开发者的视角看这件事离我们更近API 降价的底气来自芯片能效提升。如果一个自研芯片能把单 token 成本降一个数量级那么上层模型服务的定价空间就打开了。这也是 Jalapeño 芯片值得关注的原因它影响的很可能不是你今天能不能买到一块卡而是明年你调用模型的成本会变成多少。2. Jalapeño 是什么OpenAI 为什么要自研芯片2.1 不是突然跨界而是被业务规模倒逼很多人第一反应是 OpenAI 一家软件公司做芯片是不是有点跨界。但从业务链条看这是被规模倒逼的自然动作。OpenAI 的推理负载高度集中在自家模型上模型架构、算子集合、精度分布、服务形态都是已知的这就为定制化芯片提供了清晰的输入条件。定制芯片追求的从来不是通用而是在特定负载上把每一个晶体管都用在刀刃上。从公开信息看OpenAI 对自研芯片的策略比较务实不与 NVIDIA 在训练市场全面对抗而是先做面向推理场景的定制 ASIC。行业报道称这款代号 Jalapeño 的芯片由 OpenAI 与博通合作设计把设计周期压缩到约 9 个月目标流片节点是台积电 3nm 级别工艺。这些消息有相当大比例来自坊间传闻尚未经过官方完整确认但方向具有很强的合理性。2.2 推理芯片为什么容易做出能效差异推理负载有一个鲜明特征计算和访存都是相对规律的。模型训练需要反向传播、梯度同步、分布式通信几乎所有变压器结构之外的计算都要支持推理则只需要前向推理算子集合更固定数据移动模式更容易预测。于是定制推理芯片可以在多处做裁剪不需要昂贵的训练通信单元NVLink 级别的互联和梯度聚合引擎可以省掉。不需要高精度计算单元全覆盖目标模型若使用 FP8/FP4芯片只需要为这些精度做极致优化。控制逻辑可以简化指令集只需要覆盖前向计算、注意力计算、激活函数、采样等固定流程。这些裁剪直接转化为面积和功耗的下降。面积更小意味着同样晶圆可以切出更多芯片功耗更低意味着单个加速卡可以做到更低 TDP。在推理服务器里大多数时候瓶颈不是峰值算力而是内存带宽和功率密度。定制芯片如果能围绕这两点做文章能效自然有优势。2.3 这里要审慎看待的信息边界我必须强调一点截至本文写作时Jalapeño 的具体算力、内存带宽、功耗、制程版本都没有官方完整参数公开。网传的“9 个月造出 3nm 自研芯片”是一个充满传播力的表述但不能把它等同于严谨技术指标。9 个月完成设计更多说明 OpenAI 选择了与成熟芯片公司合作复用了大量现成 IP而不是从一张白纸开始做芯片。3nm 是当前先进制程的重要节点但不同厂商对 3nm 的定义也有差异TSMC 的 N3、N3E、N3P 在功耗和性能曲线上各不相同。所以读者看到这类新闻时可以先把它理解为“OpenAI 真的在认真做推理芯片”而不是急着去背一串未经证实的跑分数字。3. Vera Rubin 是什么通用平台的能效基线聊完 Jalapeño再来看它的对比对象 Vera Rubin。Vera Rubin 是 NVIDIA 下一代计算平台的名字对应的是 NVIDIA 官宣的产品路线图。这个平台以暗物质天文学家 Vera Rubin 命名核心是 Vera CPU 与 Rubin GPU 组合的超级芯片并配套新一代 NVLink 和 HBM4 内存。按 NVIDIA 已经公布的计划Vera Rubin 平台大致对应 2026 年的产品周期是 Blackwell 之后的又一次全栈迭代。为什么总是有人拿 Jalapeño 和 Vera Rubin 对比因为两者的时间窗口高度重叠。OpenAI 的 Jalapeño 预计 2026 年左右流片量产Vera Rubin 也瞄准 2026 年前后于是很容易被视为“同期对手”。但这里有一个并不对等的比较。Vera Rubin 是一个通用计算平台它要覆盖训练、推理、科学计算、虚拟化、大模型微调等几乎所有工作负载。GPU 的通用性是一把双刃剑它让一个平台适配所有场景但也意味着在任何一个单一场景里都有大量面积和功耗花在“当前负载用不上”的通用能力上。而 Jalapeño 的定位是专用推理芯片它只需要在一个窄得多的场景里做到极致。因此“Jalapeño 能效超越 Vera Rubin”更接近一个局部命题在 OpenAI 自家的模型推理负载上定制芯片每瓦产出的有效 token 数可能超过通用 GPU。这个结论并不荒谬但它不能外推到“Jalapeño 全面击败 Vera Rubin”更不能直接推导出“NVIDIA 遇到强敌了”。Vera Rubin 的意义在于系统级能效。单看 GPU 芯片能效提升空间有限但当 Vera CPU、NVLink、HBM4、可插拔光互连、整机柜散热全部协同调整后一套大规模集群的每瓦 token 产出会比上一代明显改善。换句话说NVIDIA 在能效上选择的路径是“系统省电”而 OpenAI 在 Jalapeño 上选择的路径是“芯片省电”。两条路径最终在数据中心里相遇谁的总拥有成本更低要看实际负载而不是单点跑分。4. 能效到底怎么算别被 FLOPS/W 带偏4.1 能效指标的第一层定义厂商最喜欢公布的能效指标是 FLOPS/W意思是每瓦功耗产生多少浮点运算。这个指标有一个明显缺陷它通常用峰值算力计算而实际任务很难跑满峰值。一个理论算力 1000 TFLOPS 的芯片跑真实推理时利用率可能只有 40%另一颗理论算力 500 TFLOPS 的芯片因为算子被固化利用率稳定在 80%。这两颗芯片在真实负载下的有效算力是 400 TFLOPS完全打平但只看 FLOPS/W 会得出完全相反的结论。所以工程上讨论能效更准确的口径是“有效算力利用率 × 峰值算力 / 平均功耗”或者直接用一个任务导向的指标吞吐量除以功耗。对推理服务来说最实用的形式是“每瓦每秒处理的 token 数”或者“每百万 token 消耗的电量”。4.2 影响真实能效的几个隐藏变量精度FP16、FP8、FP4 的能效差异巨大。很多新一代芯片把 FP4 作为宣传主力但实际服务里为了精度往往还是要跑 FP8 甚至更高精度。比较能效时必须锁定同一精度。批大小批处理越大矩阵运算的复用性越好能效通常更高。但推理服务往往要求低延迟批大小受限导致能效无法达到芯片最优区。内存带宽推理特别吃内存带宽尤其是长上下文场景。计算单元可能一直在等数据此时芯片整体功耗未必下降但有效吞吐上不去能效就被摊薄了。平均功耗 vs 峰值功耗很多芯片的峰值功耗只能维持几秒钟真正的数据中心能效看的是 7×24 小时平均功耗。4.3 一个可运行的最小能效估算脚本下面写一个简化但能表达核心逻辑的 Python 脚本用来估算一颗芯片在特定负载下的有效能效。参数都是示意性的请以真实硬件基准和实际负载为准。# ai_chip_eff.py # 功能估算 AI 推理芯片在指定负载下的有效能效 # 注意所有参数均为可配置假设不是任何芯片的官方数据 def effective_throughput(peak_tflops, utilization): 有效推理算力。 peak_tflops: 芯片峰值算力单位 TFLOPS utilization: 实测算力利用率范围 0~1 return peak_tflops * utilization def energy_per_token(tflops_per_token, eff_tflops, chip_power_w): 估算处理一个 token 的能耗。 tflops_per_token: 平均每个 token 所需的前向计算量单位 TFLOPS eff_tflops: 有效推理算力单位 TFLOPS chip_power_w: 芯片平均功耗单位 W seconds_per_token tflops_per_token / eff_tflops return chip_power_w * seconds_per_token / 3600 # Wh/token def cost_per_million_tokens(tflops_per_token, eff_tflops, chip_power_w, price_per_kwh): 估算每百万 token 的电力成本。 price_per_kwh: 综合电价单位 元/kWh wh_per_token energy_per_token(tflops_per_token, eff_tflops, chip_power_w) return wh_per_token * 1e6 / 1000 * price_per_kwh if __name__ __main__: # 以下参数是演示用假设不代表任何真实芯片 params { peak_tflops: 800, utilization: 0.75, tflops_per_token: 0.001, # 粗略值取决于模型规模 chip_power_w: 600, price_per_kwh: 0.6, } eff effective_throughput(params[peak_tflops], params[utilization]) cost cost_per_million_tokens( params[tflops_per_token], eff, params[chip_power_w], params[price_per_kwh] ) print(f有效算力: {eff:.0f} TFLOPS) print(f每百万 token 电力成本估算: {cost:.2f} 元)运行方式python3 ai_chip_eff.py这个脚本的价值不在准确预测而在于帮助理解能效与成本的数学关系吞吐提升一倍、功耗下降一半、电价下调都会直接影响 token 成本。真正做芯片选型时应该把真实模型的压测数据代入这些公式而不是套用上面的占位参数。4.4 能效评估维度对照表维度厂商宣传真实负载差异来源算力峰值 TFLOPS有效吞吐算子利用率、批大小功耗典型功耗平均功耗散热、降频、空闲功耗精度常用最低精度线上实际精度精度与量化策略对比基准自定义负载标准化负载任务类别、模型结构指标FLOPS/W每 token 总成本内存带宽、互联、PUE5. 为什么定制推理芯片可能做到局部能效超越回到核心问题Jalapeño 凭什么可能在能效上超过 Vera Rubin把变量拆开看至少有四个逻辑支撑点。第一是制程红利。3nm 级别制程带来的晶体管密度提升可以让芯片在相同功耗下容纳更多计算单元或者在相同面积下把功耗压得明显更低。Vera Rubin 大概率也会采用先进制程但 Jalapeño 作为专用芯片面积更可控更有余量把制程红利转化为纯能效收益。第二是架构裁剪。推理不需要训练链路因此省掉大批互联、控制逻辑、缓存一致性硬件。在芯片上面积就是功耗的前置条件面积减小漏电功耗和动态功耗都会下降。这是定制芯片最直接的能效优势。第三是内存与算子协同。推理任务的内存带宽瓶颈非常明显。定制芯片可以根据自家模型的注意力计算、KV Cache 访问模式设计针对性的缓存层次和内存控制器。如果一次注意力计算需要遍历的 KV Cache 命中率提高 30%那么有效吞吐会显著上升而功耗几乎不变能效自然拉开。第四是算力利用率。大模型推理的算力利用率受限于访存延迟和调度开销。通用 GPU 为了兼容各种模型调度逻辑更复杂专用芯片可以围绕模型结构预编译执行计划把矩阵乘法的 MAC 利用率推高。同样是 800W 的功耗预算利用率从 50% 提升到 85%有效 token 产出就接近翻倍。这四个逻辑叠加起来指向一个很清晰的结论在 OpenAI 自家推理负载这个“主场上”定制芯片的每瓦 token 数超过通用平台是符合工程直觉的。但一旦离开主场比赛比如去跑一个完全不同的模型架构或者去处理模型训练专用芯片的优势可能会迅速消失甚至变成劣势。这也正好解释了一个传播误区很多人把“能效超越”理解成“性能超越”。实际上能效领先不必依赖绝对算力碾压只要在相同吞吐下更省电或者在相同功耗下产出更多 token就已经是巨大优势。数据中心的账本来就是按电费和后端成本来算的。6. 一个对比工具用“每百万 Token 成本”看懂能效差异单纯比较瓦数和 TFLOPS对开发者来说还是有距离感。普通人更容易感知的是“同样一批 token谁的运行成本更低”。这里我们再扩展一个更完整的成本估算概念。每百万 token 的推理成本可以粗略拆成三块电力成本芯片平均功耗 × 运行时间 × 电价。硬件折旧成本服务器采购成本除以生命周期和出勤率。运营成本数据中心租金、散热、网络、人工这部分通常用 PUE 和机柜密度来体现。芯片能效直接决定第一块同时通过功率密度影响第二块和第三块。一颗能效更高、功耗更低的芯片可以在相同机柜功率预算下塞进更多计算卡从而提升机柜算力密度摊薄单位 token 的固定资产和场地成本。下面是一个更完整的估算脚本把硬件折旧也纳入粗略计算# token_cost_model.py # 功能粗略估算大模型推理服务的每百万 token 成本 # 注意这是教学用简化模型参数请按真实账单替换 def cost_per_million_tokens( peak_tflops, utilization, tflops_per_token, avg_power_w, price_per_kwh, server_cost_yuan, server_lifetime_days, server_utilization_ratio, million_tokens_per_dayNone ): eff_tflops peak_tflops * utilization seconds_per_token tflops_per_token / eff_tflops # 电力成本 kwh_per_token avg_power_w * seconds_per_token / 3600 / 1000 electricity_cost kwh_per_token * price_per_kwh * 1e6 # 硬件折旧成本按生命周期内总计算量摊销 # 假设服务器一天可以处理的 token 数 if million_tokens_per_day is None: tokens_per_day (24 * 3600) / seconds_per_token * server_utilization_ratio million_tokens_per_day tokens_per_day / 1e6 depreciation_cost server_cost_yuan / (server_lifetime_days * million_tokens_per_day) return electricity_cost depreciation_cost if __name__ __main__: cost cost_per_million_tokens( peak_tflops900, utilization0.8, tflops_per_token0.001, avg_power_w650, price_per_kwh0.6, server_cost_yuan200000, server_lifetime_days1095, server_utilization_ratio0.7, ) print(f每百万 token 综合成本估算: {cost:.2f} 元)实际部署中这两个脚本都要做大幅改造把推理框架vLLM、SGLang、TGI的真实吞吐数据填进去而不是用峰值算力估算。但这个模型已经足以说明一件事能效提升 20%落到每百万 token 成本上可能意味着几个百分点的毛利率差异——对规模化推理服务来说这就是生死线。运行验证方式也比较直接# 观察目标 GPU 的实时功耗与利用率需要在拥有该硬件的授权环境执行 nvidia-smi # 压测推理服务得到真实吞吐RPS 或 tokens/s python benchmark_inference.py --model meta-llama/Llama-3.1-8B --max-tokens 128 # 用 DCGM 周期性记录功耗评估平均功耗 dcgmi stats -g 0 -s 5如果遇到权限限制请先确认自己对测试环境拥有合法操作权限。7. 超越不等于替代能效领先的边界在哪里现在我们把视野放回生态。即便 Jalapeño 在推理能效上真的超越 Vera Rubin这个“超越”要真正转化为行业格局变化还需要跨过很多边界。第一个边界是工作负载类型。Jalapeño 如果只面向 OpenAI 自家模型优化那它服务的是特定架构、特定参数范围、特定精度配置。第三方的模型、第三方的算子、新的模型架构都无法直接吃到这颗芯片的定制红利。通用 GPU 的优势在于任何新模型出来只要把权重加载上去就能跑起来。专用芯片的演进速度能否跟上模型架构的迭代是它最大的不确定性。第二个边界是生态和工具链。NVIDIA 用二十年建立起来的 CUDA 生态不是一块芯片就能挑战的。训练框架、推理引擎、量化工具、监控运维、算子库全都有现成的解决方案。OpenAI 有 Triton 这样的底层编程语言也有非常强的编译器团队但要把整个推理工具链打磨到完美状态仍然需要时间。芯片能效再高如果上层算子缺失、部署工具链不完善开发者也不会选它。第三个边界是时间窗口。NVIDIA 的路线图非常密集Vera Rubin 之后还有 Rubin Ultra。一颗芯片的能效领先可能只能维持 12 到 18 个月。定制芯片团队必须持续迭代否则很容易被通用平台的下一轮制程和架构更新重新追平甚至反超。第四个边界是工程系统。单颗芯片能效高不代表集群端到端能效高。一家 AI 公司要跑起海量推理还需要负载均衡、KV Cache 调度、多机互联、容错调度。OpenAI 有很强的系统团队但“把芯片造出来”和“把集群运营好”之间还隔着一层很厚的工程。把这些边界列出来并不是要否定 Jalapeño 的意义而是想提醒在分析芯片竞争时要区分“器件竞争”和“平台竞争”。Jalapeño 和 Vera Rubin 可能根本不在同一个维度打仗。前者是垂直整合的专用武器后者是通用基础设施。短期内两者更可能共存而不是一方替代另一方。7.1 常见误区与解读思路说法可能误解更准确的解读“Jalapeño 超越 Vera Rubin”全面碾压 NVIDIA指特定推理负载的能效局部领先“9 个月造出 3nm 芯片”从零设计只花 9 个月与博通合作复用成熟 IP快速完成定制化“能效提升意味着性能更强”算力绝对更高同样功耗下产出更多 token或同样吞吐下更省电“自研芯片替代 NVIDIA”所有场景都用自研芯片可能只在核心推理场景使用训练仍依赖 NVIDIA“3nm 制程一定更省电”只看制造节点架构、缓存、功耗管理同样关键制程只是变量之一8. 给开发者的实用建议如何应对芯片能效竞争面对这类芯片新闻普通开发者常有两种极端反应要么觉得与自己无关要么看到“自研芯片”就焦虑。实际上这场竞争会以非常具体的方式影响我们每一个人。第一关注模型 API 的价格走势。当推理芯片能效明显提升最大的红利会体现在 API 定价上。如果你在日常项目里依赖大模型 API建议把成本数据拉出来看趋势别等到厂商调价短信来了才做应对。第二学会自己做简单的能效观测。不要只看厂商宣传页把 nvidia-smi 和 DCGM 用起来记录自己任务的实际功耗和吞吐。你可以准备一个固定负载比如同样的模型、同样长度的输入输出每周跑一次观察吞吐和功耗的变化。这会帮助你建立对“真实能效”的直觉。第三如果团队正在做推理架构选型要把“每 token 综合成本”而不是“每卡价格”作为决策指标。算力卡便宜但功耗高长期电费可能远超差价。在预算允许的情况下用 TPOT单 token 输出时间、吞吐、平均功耗、机柜密度等多维度评估硬件而不是相信一张跑分表。第四关注软件栈的迁移成本。无论未来是 Jalapeño 还是其他自研芯片进入市场都可能带来新的部署方式。提前把推理服务抽象成标准化接口选择支持多种硬件的推理框架会降低未来切换硬件时的改造风险。第五保持对信息的谨慎。在新芯片没有量产、没有第三方基准测试之前所有“能效超 XX”的说法都停留在传闻或内部测试阶段。正确的态度是观察、验证、小范围试用、再决定是否切换。不要因为一次热搜就让业务押注在未经验证的硬件上。9. 总结能效战争才刚开始把整条线索拉通可以看到一个清晰的趋势AI 芯片竞争已经从算力竞赛转向能效竞赛。OpenAI 的 Jalapeño 芯片之所以值得关注不是因为一块芯片能改变所有格局而是因为它代表一种垂直整合的新策略——模型公司直接进入硬件层针对自己的推理负载做极致定制。这种策略在特定场景下实现能效超越符合工程逻辑但这个超越有边界它无法自动替代通用平台的生态价值。对开发者来说这场竞争最直接的红利是推理成本下降。无论最后胜出的是自研芯片还是 NVIDIA 的新平台只要能效提升的势头保持模型调用成本就会持续走低。我们真正要做的是把工具链准备好把成本模型建立起来让每一个项目都能在硬件变化时做出正确的技术选型。Jalapeño 和 Vera Rubin 的对比短时间不会有确定答案。更值得持续观察的是三件事OpenAI 是否会把这颗芯片对外提供推理服务NVIDIA 的 Rubin 平台最终能效表现如何以及市场上会不会出现更多“模型公司芯片公司”的合作。这些事件比热搜词更能说明AI 计算的下一个十年会走向哪里。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价