ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

OpenAI自研推理芯片Jalapeño:能效超越Vera Rubin意味着什么?

OpenAI自研推理芯片Jalapeño:能效超越Vera Rubin意味着什么? 芯片行业的“跨界者”故事这几年我们看过不少。但 OpenAI 亲自下场做芯片而且第一款自研芯片就以“能效超越 Vera Rubin”这样的姿态出现在公众视野里还是值得停下来认真看一次。这里说的 Vera Rubin是 NVIDIA 下一代 AI 加速平台的名字以暗物质天文学家命名接替 Blackwell 架构的位置。而 Jalapeño这个听起来像是一道墨西哥菜的代号就是 OpenAI 与博通合作流片、传闻用 9 个月时间完成的 3nm 自研推理芯片。在我早期关注 AI 基础设施时市场上一度默认的逻辑是算力约等于 NVIDIAGPU 约等于算力。无论是训练还是推理买卡、排队、扩容基本是唯一路径。但过去一两年这个默认值开始松动。OpenAI 从“最大的 GPU 采购方之一”转向“自己定义芯片”本身就是行业分工发生变化的最直接信号。Jalapeño 如果真如传闻一样在能效上超越 Vera Rubin那它的意义就不只是“OpenAI 做了一个更省电的芯片”而是“AI 算力供应链的价值重心正在从单卡峰值性能转向能效、成本、供给可控性这些更工程化的指标”。这篇文章想聊三个层面的东西Jalapeño 到底是什么为什么“能效超越”比“算力超越”更值得关注以及这件事对未来 AI 应用开发和基础设施选型意味着什么。会尽量区分哪些是已经公开的事实哪些是基于工程经验的判断哪些还需要等到产品真正落地才能验证。1. 先搞清楚 Jalapeño 超越的到底是什么1.1 Vera Rubin 不是一个具体的芯片而是一套平台在对比“Jalapeño 超越 Vera Rubin”之前需要先把 Vera Rubin 的定义说清楚。很多人会把 Vera Rubin 理解成一块 GPU但实际上它是一个平台级的迭代计划。NVIDIA 在 2024 年的 GTC 上公布了 Vera Rubin 平台Vera 是 CPURubin 是 GPU两者组合成一套完整的计算单元。按照 NVIDIA 的路线图Vera Rubin 会在 2026 年正式登场后续还有 Rubin Ultra 等更高规格的版本。如果只比单卡 FP4 算力Jalapeño 大概率不会宣称超越 Vera Rubin。因为 Vera Rubin 的目标是下一代旗舰训练和推理平台它要覆盖的不仅是高并发推理还要承接大规模训练任务。OpenAI 的 Jalapeño 从公开信息看定位是推理芯片也就是说它聚焦的是模型训练完成之后在线上跑用户请求这个阶段。所以“能效超越”这个说法本身就限定了一个范围在推理场景下每瓦性能。这里要注意能效不是一个绝对优势而是一个相对优势。它讲的是“完成同样的推理任务谁消耗的能量更少”。如果 OpenAI 的芯片在跑 GPT 系列模型时单位能耗显著低于 Vera Rubin 平台那对于 OpenAI 这种每天要处理海量 API 请求的公司来说省下来的就不只是电费而是整个推理成本结构。1.2 为什么 OpenAI 要自研芯片而不是继续买卡这里需要回到一个基本问题OpenAI 为什么放着成熟的 NVIDIA 生态不用非要自己造芯片答案不能简单归为“省钱”或“掌控自主权”更准确的判断是OpenAI 的推理负载已经大到无法用现成芯片的最优解来覆盖。过去 OpenAI 做的事是在 NVIDIA 的芯片上写 CUDA 优化、调推理引擎、做模型并行和量化。这种模式的问题在于芯片的指令集、内存带宽、缓存结构和 interconnect 拓扑都是别人定好的你只能在别人的框架里优化。当你的模型结构、推理流量、输入输出分布越来越独特时通用芯片的效率天花板就会越来越明显。自研芯片意味着 OpenAI 可以按照自己的模型结构来设计计算单元。举个例子如果 GPT 系列的推理负载中注意力机制和 FFN前馈网络的占比非常固定那就可以在硬件层面做专门的数据通路而不是让通用计算单元来处理所有计算。这种“软硬协同”带来的能效提升往往不是在峰值算力上体现出来的而是在实际运行时的功耗曲线上体现出来的。从工程经验看推理芯片比训练芯片更容易做出差异化。训练任务要计算的张量形状更复杂、通信量更大、通用性要求更高而推理任务相对固定batch 大小、序列长度、模型层数都更可控更容易做硬件特化。OpenAI 选择从推理芯片切入是一个务实的选择。1.3 “9 个月造出 3nm 芯片”这个节奏说明了什么网络热词里流传着“openai用9个月造出3nm自研芯片”的说法。9 个月从零开始做一颗 3nm 芯片并且完成流片验证这个节奏放在传统半导体行业是难以想象的。常规的高端芯片开发周期通常在 2 到 3 年从架构定义、RTL 设计、验证、物理实现到流片每个环节都高度并行、极度耗时。如果这个时间线属实那只能说明一件事Jalapeño 大概率不是在 OpenAI 内部从白纸开始设计的。更合理的推测是OpenAI 提供模型需求、算法特征和使用场景博通这样的芯片设计服务方负责 IP 复用、SoC 集成和后端物理设计。换句话说OpenAI 定义“要什么”博通解决“怎么实现”。这就像你请一个成熟的建筑事务所在他们的标准构件库里选型、组合、定制而不是自己从烧砖开始盖楼。这也是为什么 OpenAI 选择与博通合作而不是像一些大厂那样直接收购或自建几百人的芯片团队。博通在 ASIC 定制化芯片领域有成熟的 3nm 设计流程和高速 SerDes、片间互联等关键 IP。OpenAI 的价值在于知道自己需要什么博通的价值在于能把需求快速变成能流片的 GDS 文件。不过这里要泼一盆冷水流片成功和量产稳定是两回事。一颗芯片从 tape-out 回来再用 9 个月做样片测试、可靠性验证、驱动程序开发、量产良率爬坡时间线还要再拉长一截。所以“9 个月造出芯片”和“9 个月后大规模部署”之间还有不小距离。2. 能效这个指标为什么比“算力跑分”更值得较真2.1 算力的价值正在从峰值走向边际成本过去几年AI 芯片的竞争焦点一直绕不开峰值算力也就是单颗芯片每秒能做多少次浮点运算。这个指标直观、好传播、容易做宣传。但真正做 AI 基础设施的人会知道峰值算力只是纸面性能实际能跑出多少有效算力取决于内存带宽、互连带宽、算力利用率、功耗墙和散热条件。在模型训练阶段峰值算力和显存容量确实更重要因为训练任务的任务密度高、并行规模大芯片之间要频繁通信。但在推理阶段情况完全不同。推理任务通常是小批量、低延迟、高并发的瓶颈往往不在峰值算力而在内存带宽、功耗、延迟和每 token 的成本。为什么能效在推理场景里这么重要一个简单的逻辑同样的电费预算下能效更高的芯片可以支撑更高的请求吞吐量。如果 OpenAI 的自研芯片在能效上真的超过 Vera Rubin 平台的推理表现那意味着在同样的功率上限下OpenAI 可以用更多的 Jalapeño 芯片组成一个规模更大的推理集群或者用更少的芯片处理同样规模的请求。无论哪一条最终都指向同一个结果单位请求的算力成本下降。如果把眼光放到数据中心层面能效的差异会被放大。高密度 GPU 集群的功耗动辄几十千瓦电力基础设施和散热系统的投入甚至可能超过硬件本身。当算力规模足够大时“省电”不再是环保口号而是真金白银的毛利率。2.2 为什么 Blackwell 之后推理能效成了 NVIDIA 也要面对的问题NVIDIA 的加速卡从 A100 到 H100 再到 Blackwell每一代都在大幅提升峰值算力和显存带宽。但推理场景下的能效优化更多依赖软件栈、TensorRT、FP8/FP4 量化、KV Cache 管理与硬件特性的配合。NVIDIA 平台的优势在于成熟稳定、生态完善但它的通用性也意味着很多能效优化的机会被留给了上层软件而不是在芯片设计层面就固定下来。OpenAI 自研芯片有机会做的是在硬件层面直接匹配自己的推理需求。比如缓存策略可以直接针对 transformer 结构设计计算单元可以针对低精度推理做比通用 GPU 更大的特殊化。这类设计在跑自己的模型时能效优势会非常明显但如果拿去跑一个结构完全不同的模型优势可能就不存在了。所以Jalapeño 在能效上超越 Vera Rubin不代表 OpenAI 在芯片设计能力上全面超过 NVIDIA。两者根本不是同一类产品也没有必要得出“谁取代谁”的结论。更准确的理解是OpenAI 正在为一个非常垂直的场景设计一个非常专用的解决方案而这个专用方案的能效在某些关键负载上确实可能超过通用平台。2.3 能效提升的长期价值不只是省电从技术演进的角度看能效提升还关系到芯片能不能部署到更灵活的位置。如果一颗芯片的功耗太高就只能在大型数据中心里用专门的机柜和散热系统伺候它。如果功耗足够低就可以部署到边缘机房、城市节点甚至靠近数据产生的区域。这种“离用户更近”的能力对推理场景有实际意义。AI 应用的实时性要求越来越高语音交互、多模态理解、复杂 Agent 任务都希望响应时间尽可能短。如果推理芯片可以部署在更靠近用户的地方网络延迟就不再是瓶颈用户体验会有明显提升。当然这属于更远期的想象。当前最现实的判断是OpenAI 希望通过自研芯片降低推理成本让 API 价格有更大的下调空间把更多应用场景变成可接受的商业模型。这一步走通影响的不只是 OpenAI 一家公司的利润率而是整个 AI 应用生态的算力成本基准。3. 从软硬协同的视角看 Jalapeño 会怎样改变推理工作流3.1 模型结构和芯片架构的深度耦合会带来什么如果把 AI 芯片比作一个厨房通用 GPU 像是一间设备齐全的中央厨房什么菜都能做但每个菜不一定都能用最少的能源做出来。Jalapeño 更像是 OpenAI 为自家菜单定制的专用厨房灶台高度、锅的尺寸、火力曲线都按自己的菜品设计出餐效率自然更高。这种软硬协同在推理任务上会体现在几个方面计算单元与模型算子的匹配如果 OpenAI 的模型推理主要落在矩阵乘法和注意力计算上芯片可以设计专门的加速单元减少指令调度的开销。内存层次与 KV Cache 的匹配推理时KV Cache 的读写量非常大如果芯片的缓存结构和容量设计得更贴合模型需求可以显著降低对 HBM 带宽的依赖。量化格式的固化OpenAI 可以对自家模型使用统一的低精度格式而不需要为不同模型做复杂的量化适配。这些优化叠加起来最终的能效提升不是某一步的功劳而是整个系统设计的一致性带来的。3.2 对普通开发者和应用层工程师来说芯片变化意味着什么首先必须说清楚Jalapeño 对绝大多数 AI 应用开发者来说是透明的。你不太可能直接对着这颗芯片编程更不用说针对它做底层优化。你做的是调用 OpenAI 的 API请求发给哪个芯片、底层怎么调度跟你没有直接关系。但芯片带来的间接影响会非常明显。如果 OpenAI 的推理成本因为自研芯片下降API 价格就有下降空间。这会直接改变 AI 应用的盈利模型。过去很多 AI 应用面临的困境是功能能做出来但每月的 API 账单太高毛利太薄。如果推理成本下降 30% 到 50%一批原本活不下去的应用会重新获得商业上的可行性。另一个间接影响是响应速度和配额限制。如果推理集群的能效提升OpenAI 可以在同样的电力预算下部署更多推理芯片整体吞吐量上升排队概率下降免费或低价配额的可能也会增加。用户能感受到的就是 AI 应用更快、更稳、更便宜。3.3 对 AI 基础设施选型的影响Jalapeño 如果成功会影响的不只是 OpenAI 和 NVIDIA 这两家公司。其他拥有大规模推理需求的公司可能会重新评估“自研 or 采购”的决策。尤其是那些模型结构相对固定、推理负载大、有算法团队能定义硬件需求的公司定制芯片的吸引力会越来越大。但这不等于所有公司都应该自研芯片。自研芯片有非常高的门槛首先是模型负载要足够大否则芯片的研发成本和流片成本根本摊不回来其次是要有非常强的算法与硬件协同能力能说清楚“我需要什么”而不是“你看着办”最后还要有长期投入的耐心因为芯片迭代是数年的周期不是一两个季度就能见效。我通常会建议先做这样的判断如果公司当前的推理规模还在每月几百万到几千万 tokens 量级买 GPU 或云服务是最理性的选择。真正需要考虑自研的是推理规模已经达到数十亿 tokens 每个月且模型结构相对稳定、未来几年不会剧烈变化的情况。Jalapeño 对行业最大的启示不是“大家都该自研”而是“当你足够大你就有定义工具的权利”。4. 把芯片优势变成真正的工程优势中间还差几步4.1 从流片到稳定部署这是一条漫长的路每一颗新芯片从 tape-out 回来到能在真实业务里稳定运行中间的路都远比想象中漫长。首先是样片测试要验证所有功能模块是否正常然后是可靠性测试要跑长时间压力测试确认没有热失效、时序问题或随机错误之后还要开发完备的驱动程序、内核态的支持、容器和编排系统的适配。AI 芯片尤其麻烦的地方在于它的价值必须通过大型模型推理集群才能体现。单颗芯片跑通一个模型和一万颗芯片组成集群跑通生产流量是两个完全不同难度的事情。网络拓扑、集合通信、负载均衡、故障迁移每一个环节都要重新验证。即使 Jalapeño 的样片已经流片成功距离“OpenAI 大规模用自研芯片替代 NVIDIA 进行推理”这个目标还有相当一段路。可以期待但不要把它当作已经发生在昨天的事。4.2 推理芯片落地时最容易翻车的三个环节结合过去几年做模型推理服务的经验定制化芯片落地时最容易出问题的环节通常是这三个第一个是硬件兼容性。芯片不是只在软件模拟器里跑通就算完。真实部署时主板、内存、电源、散热和机箱设计都要配合任何一个环节的兼容性出问题都会导致硬件不稳定或者性能不达标。第二个是驱动与运行时生态。CUDA 之所以能成为事实标准不只是因为硬件强而是因为它把底层的线程调度、内存管理、算子库都封装好了。OpenAI 的自研芯片如果要跑自家模型需要一套同样好用的运行时。如果这套运行时只能在 OpenAI 内部使用那问题不大如果将来要开放给生态工程量会成倍增加。第三个是故障率与生命周期管理。大规模集群里芯片故障是常态而非偶发。有没有可靠的故障检测、隔离和迁移机制直接决定了整个集群的可用性。新芯片没有经过大规模部署验证时这类问题通常要踩过很多坑才能解决。从现在公开的信息看Jalapeño 可能还处在从流片走向小规模验证的阶段。这个阶段最需要做的事不是急着追求性能指标而是把可靠性、可维护性和可观测性先补齐。4.3 一个值得长期观察的信号OpenAI 会不会开放芯片能力Jalapeño 的第一代版本大概率只服务 OpenAI 自家业务。真正值得观察的是未来 OpenAI 会不会把定制芯片能力开放出来变成类似云服务或算力平台的一部分。如果开放意味着其他 AI 公司也可以把自己的模型跑在 OpenAI 设计的推理芯片上享受更高的能效比和更低的成本。这个模式的商业想象力远大于卖芯片本身。它相当于从“出售计算资源”转向“出售算力基础设施的标准”。但开放也有很大的不确定性芯片的定制优化和具体模型结构强相关OpenAI 不可能针对每个第三方模型做硬件级优化芯片产能怎么分配优先满足自家业务还是对外供给也是一个战略选择。从当前的情况看更可能的路径是先在自己身上验证到稳定可靠再考虑对外输出。对于普通开发者现阶段最值得做的是盯住两个信号一是 OpenAI 的 API 是否有因成本结构改善而出现的降价或额度调整二是 OpenAI 是否会在 devday 之类的场合公布自研芯片的大规模部署数据。这两点都比“能效超越某平台”这类新闻更能说明真实进展。5. 怎么看这件事才算不被“标题震撼”带偏5.1 保留一点怀疑等真实数据出来再下结论关于“Jalapeño 能效超越 Vera Rubin”这件事目前的信息更多来自传闻和推测缺乏官方发布的完整对比数据。什么样的能效、在什么模型上、用什么 batch size、什么上下文长度、什么精度格式、整个集群还是单芯片这些细节都会大幅影响结果。在没有看到完整测试方法的情况下最理性的态度是把这个说法当作一个值得关注的方向而不是一个已经确定的结论。芯片行业最不缺的就是“纸面领先”或者“在特定条件下领先”的宣传。真正有效的判断依据是它在真实业务负载下的长期表现。更实际一点说Vera Rubin 目前还没有正式上市Jalapeño 更没有大规模部署这两个平台在“能效”上的比较更像是一场发生在发布会和新闻稿层面的较量。真正的胜负要等两边都在真实生产环境里跑几个月之后才能看得出来。5.2 对行业来说真正的变化不是“OpenAI 赢了”如果换一个角度Jalapeño 是否真的在能效指标上全面超越 Vera Rubin可能没那么重要。重要的是从这件事开始一个关键的行业假设被动摇了AI 计算不再只能靠 NVIDIA 的通用 GPU 来支撑。这个假设一旦松动会带来一系列连锁反应。云厂商会更有底气推进自研芯片计划芯片创业公司会获得更多关注和融资AI 公司会在架构设计早期就把“未来的算力形态”考虑进去而不是默认“反正最后都要适配 GPU”。对整个 AI 产业链来说多一种高性能的计算选择就意味着更低的风险和更大的谈判空间。对于普通工程师和开发者这种变化短期内不明显但长期看是好事。算力市场从单极走向多极成本会下降选择会变多工具链也会更丰富。当整个行业不再把所有希望押在一家公司的路线图上时创新的空间反而更大了。5.3 如果只记一件事我希望你记住这个判断Jalapeño 的事不需要你记住它“超越”了什么也不需要在 NVIDIA 和 OpenAI 之间选边站。真正值得记住的是AI 芯片的竞争正在从追求“更快”转向追求“更省”和“更可控”。峰值算力依然是重要的底座但能效、成本、供给确定性和软硬协同能力正在成为下一轮竞争的核心指标。对做 AI 应用的人来说这是一个值得乐观的信号。算力不会永远停留在卖方市场的状态随着定制芯片和更多技术路线的成熟算力会变得更像水电一样按需供给、成本可控。拉长到三五年来看Jalapeño 可能只是这条路上的一块里程碑但它的方向感是明确的。如果你现在正在做 AI 应用最该做的不是等待某个芯片出现而是继续把应用的核心价值打磨好把模型效果和用户体验做扎实。算力成本的下降会把越来越多“技术上可行、商业上不成立”的项目变成真正可以落地的生意。这件事比任何一款芯片本身都更值得期待。
返回列表