OpenAI 自研推理芯片 Jalapeño 在推理基准测试中超越 Nvidia Blackwell 和 Rubin?这类说法最近在技术圈传得很快。看到消息时,我第一反应不是“OpenAI 又要改写算力格局”,而是先确认几个没说清楚的细节:测的是什么模型,跑的是什么精度,batch 多大,输入输出多长,并发多少,功耗多少,用的是什么软件栈。如果这些条件没有一项一项列出来,“超越”就只能算一个宣传口径,不能直接当采购依据。
这个主题之所以值得认真聊,是因为它同时牵动三类人:正在规划推理算力的团队,想了解自研芯片真实价值的开发者,以及只通过 API 使用 OpenAI 服务的普通用户。对前两类人来说,重点不是急着改成 Jalapeño 或者继续加购 NVIDIA,而是先搞懂一个问题:推理芯片的“性能”到底该怎么判断。这篇文章先拆概念,再聊跑分口径,然后分析自研芯片的真实动机和落地距离,最后给出普通团队的应对思路。
1. 先把“推理芯片”和“训练芯片”分开,再谈超越
1.1 推理芯片正在成为成本瓶颈
大模型从开发到上线,基本分成两个阶段:训练和推理。训练阶段让模型在海量数据里学习参数,推理阶段让模型拿学习到的能力去回答用户问题。过去几年,大家更关注训练芯片,因为训练要消耗的算力大得惊人。但落到真实业务里,真正每天都烧钱的是推理。
用户每调用一次模型,服务端就要做一次前向计算,生成一段文本、一张图片或一段代码。这个过程中的每个 Token 都需要矩阵运算和显存读取。用户量一大,推理芯片的吞吐能力、显存带宽和单位算力成本就直接决定服务的毛利。OpenAI 的 API 规模已经非常大,推理成本再低一个量级,都会影响定价策略和服务容量。
这就是 Jalapeño 这类自研推理芯片受到关注的原因。它不是去抢训练芯片的市场,而是想在大模型服务最烧钱的地方做优化。推理任务的特点是:模型权重相对固定,输入输出变化多,对延迟和并发有明确要求。相比训练任务,推理更容易通过专用芯片来加速,因为不需要那么灵活的并行调度和超大显存互联。
1.2 Blackwell 和 Rubin 不是同一个时间维度的对手
Nvidia Blackwell 是目前数据中心里的主力架构,很多大模型推理服务都是基于它来部署。Rubin 是 Nvidia 后续路线图里的新一代平台,代表的是未来一到两年的性能预期。拿一颗刚曝光传闻的自研芯片去和 Blackwell、Rubin 比,本身就有时间错位的问题。
Blackwell 的强项是通用性和生态成熟度。它不只为某一个模型设计,而是能适配不同规模、不同精度的模型。Rubin 还没全面铺开,它的价值要等实际产品、驱动、框架都跟上之后才能体现。Jalapeño 如果是一颗专用推理芯片,针对 OpenAI 自家模型优化,那在特定模型和特定部署条件下跑赢 Blackwell 是有可能的,但这和“全面超越”是两码事。
自媒体传播里容易把“某一项测试领先”简化成“整体吊打”。真正做技术选型时,不能只看这种结论。一颗芯片好不好,要看它在你自己的模型、自己的流量、自己的并发曲线下表现如何,而不是看别人用一个特定场景测出来的数字。
1.3 传闻中 3nm 与 9 个月:速度不等于可用性
网络讨论里经常出现“OpenAI 用 9 个月造出 3nm 自研芯片”的说法。这个听上去很提气,但要注意,这属于待证实信息。芯片行业里,“设计出来”“流片成功”“量产可用”“规模部署”是四个完全不同的阶段。
9 个月完成设计,说明团队执行效率高,或者设计目标非常聚焦。但一颗芯片要真正进入数据中心,还要解决代工良率、封装散热、供电、内存子系统、驱动、编译器、运行时调度、故障运维等问题。任何一个环节跟不上,芯片就只能停留在演示阶段。
我自己见过不少项目,Demo 里跑得很惊艳,真到了 7×24 小时服务时才发现稳定性不行。推理芯片尤其如此,用户请求是随机到达的,峰值流量可能突然冲到几倍,芯片不仅要快,还要在持续高压下不降频、不报错、不出现内存错误。流片成功只是夺回了起跑线,后面还有一整条供应链和服务体系要补。
2. 推理基准测试的“超越”要看全这组参数
2.1 比快之前,先确定指标口径
推理性能不像“跑分软件”那么简单,它至少有四个常见指标:首 Token 延迟(TTFT)、生成长度、吞吐量、端到端延迟。TTFT 影响用户感知到的响应速度,吞吐量影响单位时间服务多少人,端到端延迟则直接决定在线服务的体验。
如果一个基准测试只说“超越 Blackwell”,没有说明测的是哪一项,这个结论就没有操作意义。比如某颗芯片可能 TTFT 很快,但连续输出时吞吐不高;也可能离线高并发很强,但在线单请求延迟很差。论文和发布会里通常挑最好看的指标讲,这个习惯在芯片领域也一样。
我一般会先看吞吐量和功耗的比值,也就是每瓦每秒能生成多少个 Token。因为推理服务的核心成本不是单次请求快不快,而是单位电力下能处理多少请求。如果一颗芯片峰值很高但功耗吓人,数据中心散热和电费会直接把成本优势吃掉。
2.2 同一颗芯片在不同任务里可能判若两人
推理芯片的性能极度依赖任务类型。跑 7B 小模型、跑 70B 大模型、跑 MoE 模型,对显存、带宽和计算单元的需求完全不同。小模型更吃内存带宽,大模型更吃显存容量和计算吞吐,MoE 模型则对路由调度和稀疏计算有额外要求。
另一个关键变量是 batch size。在线聊天场景通常是 batch 很小,单条延迟敏感;离线批量生成场景可以开大 batch,芯片利用率和吞吐会显著提升。同一颗芯片,小 batch 下可能输,大 batch 下可能赢。如果测试方为了拿到好看数据,把 batch size 设成实际业务很少用的数值,那结果再高也参考价值有限。
精度也要留心。FP8、INT8、FP4 这些精度在推理里很常见,量化后速度会快很多,但模型质量会有少量损失。芯片在低精度下跑分高,不代表它在用户实际需要的精度下同样高。严谨的对比必须把模型、精度、上下文长度、batch size、并发数都写清楚。
2.3 没有官方数据前,怎么判断可信度
目前关于 Jalapeño 的细节非常少,没有架构图,没有官方白皮书,没有可下载的测试工具,甚至没有明确说测试用的模型和软件版本。这种情况下,我建议把“超越 Blackwell 和 Rubin”当作传闻,而不是结论。
判断传闻可信度,可以看几个信号:有没有独立的第三方复现,有没有说明测试环境和参数,有没有给出完整实验配置,OpenAI 官方是否确认。只要这些信号缺失,消息就处于“待验证”状态。芯片领域有个常见现象:早期测试结果很好,优化到量产阶段发现各种限制,最终性能和最初预期差一截。所以对早期跑分保留一点耐心,反而是负责任的态度。
2.4 一张表核对“跑分超越”是否可参考
| 信息项 | 为什么重要 | 缺失时怎么判断 |
|---|---|---|
| 测试模型 | 7B 和 70B 的芯片适配方式完全不同 | 不能推测是否适合你的模型 |
| 精度 | FP8、FP4、INT8 直接影响速度和效果 | 只看速度可能失真 |
| batch size | 小 batch 偏延迟,大 batch 偏吞吐 | 要对比自己业务的 batch 区间 |
| 输入输出长度 | 长上下文对显存和带宽要求更高 | 短上下文快不代表长文本快 |
| 并发数 | 并发高时考验调度和内存管理 | 单请求快不表示系统吞吐高 |
| 软件栈 | 不同推理框架优化差异很大 | 结果可能来自特定框架深度适配 |
| 硬件环境 | 散热、供电、互联拓扑会影响结果 | 纸面数字无法直接迁移 |
| 功耗 | 决定数据中心运营成本 | 不讲功耗的性能对比没有闭环 |
| 可信度 | 第三方复现、公开配置、官方确认 | 缺失时只能算单方面数据 |
不管最后是不是真的超越,上面这张表都值得保留。以后再看任何推理芯片跑分,都先把这些列出来,能对上再花时间评估。
3. OpenAI 为什么要自研推理芯片:成本、供给和软件控制权
3.1 API 规模越大,推理成本越不容忽视
OpenAI 的 API 服务要支撑大量开发者调用,从对话补全到代码生成,背后全是 GPU 集群在跑。只要用户量在涨,推理资源就得跟着扩。直接用 Nvidia 的卡当然省事,但对一家算力消耗如此大的公司来说,长期成本不可控。
自研推理芯片如果能做到同等质量下单位成本更低,OpenAI 可以直接把成本优势反映到 API 价格里,或者保持价格不变同时提高利润。这个逻辑对开发者也是利好:API 价格更稳,服务扩容能力更强,使用体验更可能保持稳定。
但成本优势不是只看芯片价格。自研芯片要摊薄芯片设计费、流片费、软件研发费、生态适配费,前期投入比直接买卡高得多。只有部署量足够大,才能把固定成本摊薄。所以自研芯片对公司规模和业务体量有很高要求,不是随便一家都能抄的作业。
3.2 自研芯片的动机不完全是因为跑分
如果只看跑分,OpenAI 完全可以继续采购 Nvidia 的下一代产品,没必要自己造芯片。自研的价值更在于供应链控制权和产品定义权。
采购外部 GPU 时,能买多少、什么时候到货、用什么架构,都受供应商节奏影响。自研芯片可以把算力规划和产品路线绑定,针对自家模型做深度定制。这种“软硬一体”的思路,和很多云厂商自研芯片的动机一致:不为在每一个指标上赢,而是为了在关键场景里掌握主动。
另外,大模型架构变化很快。推理芯片如果设计得太专用,可能只对某一代模型有效,模型一变芯片就失去优势。因此自研芯片要平衡专用加速和通用可编程能力,这也是最难的地方。跑分只能体现当前某几个模型的效率,体现不了未来三年架构迭代的适应能力。
3.3 比芯片更难的是编译器、算子库和服务框架
AI 芯片行业有句老话:芯片只是硬件的一半,另一半是软件。Nvidia 的护城河不只有 GPU 本身,还有 CUDA、TensorRT、cuDNN 和庞大的开发者生态。开发者已经习惯了用 CUDA 写算子、用 TensorRT-LLM 部署模型、用 Nvidia 工具排查性能问题。
自研芯片要真正被用起来,要先有一套编译器,能把 PyTorch 等框架里的算子编译到自己的硬件上;还要有算子库,把常用操作优化到足够快的程度;还要有推理服务框架,支持动态 batch、分页注意力、模型并行等高级功能。这些工作的工作量不会比设计芯片小。
OpenAI 在软件上有积累,也有强烈的自研动机。它不需要像普通芯片厂商那样取悦所有开发者,只要先服务好自己内部和 API 场景就够了。这种垂直整合路线比通用芯片更容易落地,但也意味着它对生态的覆盖范围会窄一些。
4. 从流片到大规模部署,中间隔着一整条供应链
4.1 流片成功不等于量产可用
看到“芯片测试通过”的新闻时,很多人会默认芯片马上可以大量使用。实际上,一颗芯片从流片成功到量产,还要过良率、封装、测试、可靠性验证等多道关。即便是成熟设计,良率爬坡也需要几个月时间。数据中心芯片还要做长时间老化测试,确保在高温高负载下不会频繁出错。
更现实的问题是新架构需要重新设计服务器硬件。芯片接口、供电、内存拓扑、散热方案都要搭配。如果只做了芯片本身,服务器主板、整机厂商、机柜部署策略都得跟上。整个链条会明显拉长。
所以我更愿意把传闻里的时间点理解成“设计验证完成”,而不是“马上能大规模服务”。OpenAI 就算真有芯片在手,也不会立刻把所有 API 流量迁过去。更可能的路径是先在内部小范围试跑,再逐步扩大。
4.2 单卡性能高不等于服务稳定
推理服务要稳定,不是单卡够快就行。大规模部署时,需要把模型切到多卡上,处理显存不足问题;需要在服务崩溃时自动重启;需要面对网络通信瓶颈;还需要一个持续监控系统,跟踪每张卡的利用率、温度、显存错误率。
一颗芯片在基准测试里跑得快,只说明它在受控环境里算得快。如果它在长时间运行时出现显存错误率偏高,或者高并发下调度器不稳定,那再高的峰值性能也无法用于生产。Nvidia 的卡经过很多年打磨,运维工具和排错经验已经非常成熟。新芯片再强,稳定性数据也要靠时间攒出来。
我自己做部署时,最怕的不是慢,而是不稳定。慢还可以通过加机器解决,不稳定却会让整个服务的错误率、超时率一起上升。推理芯片的可靠性不是跑一两个基准就能证明的,一定要看连续运行几天的表现。
4.3 软件生态迁移成本可能比性能差距更关键
假设 Jalapeño 真的在一项测试里超过了 Blackwell,接下来一个很现实的问题是:迁移成本。团队用 Nvidia 的卡,可能已经写好了一套基于 CUDA 的图像处理流程,或者用 TensorRT-LLM 做了量化优化,又或者用 Nvidia Triton 管理推理服务。搬家到新芯片,算子要重新编译,推理框架要重新适配,监控告警要重新开发。
如果新芯片只能兼容 OpenAI 自家模型,那外部开发者迁移的意愿会更低。很多团队不可能为了推理性能提升就放弃整套成熟的 Nvidia 工具链。这个生态惯性是客观存在的,不会因为一颗芯片的跑分而改变。
这也是为什么很多自研芯片厂商都在强调“兼容已有生态”,而不是让用户另起炉灶。OpenAI 更可能的做法是继续通过 API 对外提供服务,把芯片能力包装成服务,让开发者无感。这样既能发挥芯片优势,又不用强迫用户迁移。
4.4 时间表背后的现实约束
芯片行业里,“路线图宣布”和“规模量产”之间经常隔着两三年。网络热词里提到的“9 个月造出 3nm 自研芯片”,如果指的是从立项到流片,那确实说明团队速度很快。但从流片到量产再到规模部署,通常不是几个月能完成的事。
这里还涉及代工产能、先进封装、HBM 内存供货等因素。一颗高性能推理芯片不只要逻辑设计强,还要有足够带宽的存储系统。HBM 的产能和成本直接决定芯片能不能大规模出货。这些供应链问题不是 OpenAI 单独能解决的。
对普通开发者来说,更稳妥的时间预期是:即便消息全部属实,Jalapeño 真正能通过 API 大规模影响用户体验,也可能需要按年而不是按月来算。短期内,Nvidia 仍然是推理部署的主流选项。
5. 对普通开发者和技术团队来说,短期该关注什么
5.1 如果你只是调用 API,底层芯片变化对你是透明的
大量开发者现在是以 API 方式使用 OpenAI,比如处理文本、生成代码、做语义搜索。这种情况下,你不需要关心背后跑的是 Nvidia 还是自研芯片。OpenAI 只要保证接口不变、价格稳定、响应速度符合预期,底层硬件换不换和你没有直接关系。
但有一个点可以关注:接口稳定性。如果 OpenAI 为了发挥自研芯片优势,修改了某些模型行为、上下文窗口策略或计费逻辑,那开发者才会真正受到影响。芯片本身不是你需要关心的层,API 的输入输出、价格和限流策略才是。
5.2 如果你在做本地推理部署,NVIDIA 工具链仍是基本盘
很多团队跑的是本地部署,比如用开源模型做私有化服务。这时候 Nvidia 的驱动、CUDA、container runtime 仍然是日常操作的一部分。热词里大量出现 Ubuntu 安装 Nvidia 驱动、nvidia container toolkit 配置、CUDA 版本问题,说明这套工具链依然是本地推理的事实标准。
你可以关注自研芯片的未来,但短期选型不能押在一个传闻上。该装驱动还是装驱动,该调 CUDA 还是调 CUDA,该做量化还是做量化。推理服务的优化点很多,芯片只是其中一个环节,模型、框架、数据格式、服务配置都会影响最终效果。
如果是在 Jetson 这类边缘设备上做推理,更不用因为桌面端芯片新闻改变计划。边缘场景对功耗、体积、工具链成熟度的要求更苛刻,短时间不会有谁能动摇 Nvidia 在边缘部署里的地位。
5.3 OpenAI 近期更值得关注的是软件工具链
相比芯片传闻,OpenAI 近期在工程工具上的动作更实际。比如 Codex 相关工具的下载和更新,API Key 的获取使用,以及开发者社区里讨论度很高的 Codex harness 开源进展。这些是能直接改变开发效率的东西。
芯片离普通开发者很远,但这些工具离得很近。我建议把注意力放在:OpenAI 的 API 格式有没有变化,Codex 能不能接入自己的工程流程,函数调用、结构化输出、批量处理这些能力是否更稳定。这些因素对实际项目的帮助,比一个未经验证的芯片跑分更直接。
5.4 给技术选型的三个判断标准
如果团队正在做推理算力选型,可以按下面三个标准来判断,不管面对的是 Nvidia、自研芯片还是其他方案。
第一看可验证性。选型必须有可复现的压测数据,不能只有厂商宣传。用自己业务里的真实模型和请求数据,跑一轮延迟、吞吐、错误率测试。
第二看迁移成本。新方案能不能兼容现有代码,算子重写量有多大,监控和部署流程要不要重做。很多看起来性能更好的方案,在迁移成本面前并不划算。
第三看供应链和长期投入。芯片能不能稳定供货,软件迭代是否活跃,社区和文档是否完整。长期依赖一个没有生态的技术栈,风险很高。
6. 我的结论:别急着站队,先把验证框架搭起来
6.1 传闻期最忌讳直接下结论
一个尚未被官方确认的推理芯片,在某个基准测试里跑赢 Blackwell 和 Rubin,这个消息适合当行业动态看,不适合当行动指南。芯片行业的宣传口径从来都是挑最有利的场景讲,真实性能要等更多独立验证才能看清楚。
我更建议用这段时间把自家推理性能的基线测出来。跑一批固定模型,记录延迟、吞吐、错误率和硬件利用率。这样等新芯片真正开放测试时,可以直接用同一套方法对比,而不是被别人的测试结论牵着走。
6.2 等官方披露哪些信息才值得判断
以后如果消息进一步公开,我会重点看几个信息。首先是芯片的架构细节,包括计算单元、显存带宽、互联方式和功耗。其次看基准测试的完整配置,包括模型、精度、batch、输入输出长度、软件栈。再然后看量产计划和部署时间表。
如果这些信息都不公布,那就继续观望。真正优秀的推理芯片产品,最终会通过公开测试、开发者体验和实际服务数据来证明自己,而不是只靠一句“超越某某芯片”来争关注。
6.3 团队可以提前做哪套可复现验证
团队现在就可以准备一套推理压测脚本。固定模型版本,固定测试数据集,固定并发模式,记录三类数据:平均 TTFT、平均 Token 生成速度、错误率和超时率。
同时记录硬件信息,包括 GPU 型号、显存占用、功耗和温度。将来无论切换芯片还是改配置,都能拿着同一套脚本做横向对比。这套验证框架的价值会超过某一条新闻。
6.4 长期看,这场“超越”真正的价值是什么
我更愿意把 Jalapeño 的传闻当成一个行业信号:自研推理芯片的竞争正在加速。OpenAI 敢花资源做芯片,说明推理成本在大模型服务里的权重越来越重。无论最终这颗芯片表现如何,它都会推动市场出现更多选择。
算力市场的竞争越充分,普通开发者的选择空间就越大。有人会觉得“OpenAI 如果不再依赖 Nvidia,API 可能更稳”,也有人会担心“如果芯片是专有的,会不会绑定更深”。这些担心都有道理,但现在下结论都太早。
现阶段最稳的姿势是:继续保持对 Nvidia 工具链的熟悉,同时把自家推理任务的性能和成本基线记录下来。芯片新闻看完之后,回到自己的模型、数据和压测脚本里,用可复现的数据做判断。传闻会越来越多,但真正能指导决策的,只有你自己跑出来的结果。