SemiAnalysis:OpenAI 自研芯片实测干翻英伟达旗舰?黄仁勋最担心的事发生了

BiRun 消息,作者:SemiAnalysis 编译:深潮 TechFlow 深潮导读: OpenAI 首款自研推理芯片 Jalapeño 实测数据曝光,能效直接压过英伟达现役旗舰 Blackwell,直逼下一代 Rubin。对受困于数据中心电力瓶颈的 AI 公司来说,这枚芯片可能改写算力市场格局。但第一代芯片能否真正动摇英伟达的 CUDA 生态,仍需打一个问号。 用自研 ASIC 对比 Rubin、Jalapeño 的总拥有成本、每兆瓦吞吐量,以及辛辣细节过去两年,OpenAI 一直在默默研发“Jalapeño”,这款推理芯片刚刚在 Hot Chips 上公布。流片成功的传闻已经传了一阵。但现在我们拿到了细节。OpenAI 邀请我们查看芯片、进入实验室验证它的真实程度,并用我们的 InferenceX 套件进行基准测试。 今年 6 月,OpenAI 公布了与博通合作的芯片项目,从零开始专为 LLM 推理打造。设计工作始于 2024 年年中,从最初团队招聘到制造流片只用了约 16 个月,这是一个极快的 ASIC 开发周期。 通常第一代芯片没有竞争力,但 OpenAI 反其道而行,在多个顶级开源模型上,它击败了我们能测试的所有英伟达、AMD 和谷歌芯片,处于行业领先地位。OpenAI 靠的是极致的软硬件协同设计。令人意外的是,OpenAI 并没有过度专攻模型推理的某个特定环节,而是专注于做一款在所有场景下都能提供高性能的通用芯片。 本文将深入 Jalapeño 在 InferenceX 上的架构细节、软件细节和性能结果。 一款通用推理芯片所有人都说 OpenAI 的芯片专为 OpenAI 模型定制,但这是错的,OpenAI 做了一款面向 AI 推理的通用芯片。 时间线太疯狂了。这表明“用 AI 加速芯片设计”的说法是真的。尽管时间线很快,OpenAI 花了大量资金、做了务实的设计决策,而且团队非常强,所以这不令人意外。 单看规格,它立刻就是有力竞争者: 而且使用 HBM4 让它足以与英伟达和 AMD 的旗舰 GPU 相提并论: 很多媒体对这款芯片的报道,都跟着 OpenAI 几句随口说的话走,声称它会以其他芯片做不到的方式为自家模型优化。这是错的。Jalapeño 是一款通用推理芯片,能跑各种模型和各种工作负载,包括我们的 InferenceX 基准测试——我们当时和 OpenAI 工程师一起在实验室里跑了这个测试。作为玩笑,OpenAI 甚至给我们展示了它在跑《毁灭战士》,这个游戏只用 Codex 提示词就移植到了他们的芯片上。 下面是我们最重要的性能/瓦特结果,看的是每兆瓦总功耗下的 token 吞吐量。Jalapeño 完胜所有其他芯片。这一切都没有使用多 token 预测(MTP),而图表中的其他芯片都是各自 SKU 的最佳配置,全部开了 MTP。 Jalapeño 在几乎所有场景下,性能/瓦特都超过 Blackwell,而且没有针对曲线上的某个特定点做调优。它不仅在低延迟场景表现优异,在高吞吐场景也同样出色。更公平的比较是看单 token 预测结果,Jalapeño 把每个竞争对手都甩出几条街。在低并发场景下,Jalapeño 展现出惊人的交互性,在 DeepSeek R1 模型上,并发数为 1 时每用户每秒超过 700 个 token。 不可思议的是,这一切都是用单 token 预测(STP)实现的,没有推测解码,也没有预填充-解码分离。除了 DeepSeek R1,我们还看到其他一些模型,包括 Kimi-K2.5 和 GPT-OSS,它们大约跑到。
利多 矿业板块利多 NVDA(英伟达) 查看原文
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯