导语
当大模型公司开始为自己造芯片,半导体行业的节奏被彻底打破。2026年8月25日,OpenAI公布了与博通联合研发的首款AI推理芯片Jalapeño(墨西哥辣椒)的公开测试成绩。这款芯片在推理能效和延迟方面大幅超越英伟达当前最强的AI加速器,而它的开发周期——从设计到流片仅用9个月——更让整个行业看到了AI加速硬件迭代的新可能。
事件概览
根据SemiAnalysis发布的公开基准测试InferenceX,Jalapeño运行了GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T三款主流大模型,结果显示:每瓦完成的AI工作比英伟达GB200、GB300多1.5至1.9倍;端到端延迟缩短至对照系统的约30%至60%。以DeepSeek R1为例,一次8K输入、1K输出的推理从5.99秒降至1.65秒,最低token间隔从5.90ms压至1.43ms。OpenAI首席执行官Sam Altman对此评价简洁有力:“我们制造了一款芯片,它很快。”
核心信息
为推理而生:Jalapeño的设计哲学
不同于通用的GPU,Jalapeño从设计之初就只有一个目标——承载现代大模型的推理工作。这一方向与当前AI Agent的流行紧密相关。Agent任务往往需要连续调用模型几十次(读文件、搜资料、操作软件、检查结果),每一步推理延迟累积起来,会大幅拖慢体验。OpenAI的ChatGPT也因此将界面分为“聊天”和“工作”两个模式。如果推理速度足够快,Agent的响应可接近普通聊天,未来ChatGPT有望回归一个对话框的简洁形态。
为了实现极致的推理速度,Jalapeño对整个计算架构进行了协同优化。大模型推理分为两个阶段:Prefill(一次性读取提示词,考验计算能力)和Decode(逐个生成token,需反复从内存读取权重和KV Cache,常遭遇“内存墙”)。Jalapeño配备216GiB HBM4内存,带宽达15.4TB/s,接近微软Maia 200和Google Ironwood的两倍,确保数据搬运速度跟上计算速度。此外,它将计算核心和HBM划分成多个对应区域,使模型权重和KV Cache尽量留在本地内存中,减少跨区域数据搬运的等待时间。
这种从芯片设计之初就通盘考虑计算、内存和网络的方法,带来了惊人的能效比。Jalapeño标称功耗700W,实际测试持续功耗低于550W;而英伟达GB200和GB300标称功耗分别为1200W和1400W。这意味着Jalapeño用约一半的能耗实现了更高的推理性能,直接转化为数据中心电力成本的巨大节省。
九个月流片:AI加速芯片开发速度
Jalapeño的开发速度同样令人瞩目。据路透社报道,项目正式起步于2024年底至2025年初,初始成员很多来自Google TPU项目。OpenAI在更早之前就邀请了前Google TPU负责人Richard Ho组建硬件团队。2025年10月,OpenAI宣布与博通合作部署10吉瓦的定制AI加速器;11月完成流片。综合各方信息,从正式设计到流片只用了9个月——而按照Semiconductor Engineering的估算,高复杂度AI加速芯片通常需要18至24个月。OpenAI将这一周期压缩了近一半。
实现如此速度的关键因素之一是AI本身。OpenAI表示,他们的模型在芯片设计期间用于探索实现方案、参与验证和修改方案、优化算术电路等。芯片进入实验室后,OpenAI又使用Codex和未发布的Astra模型,在两个月内将三款原本不在适配计划中的模型(GPT-OSS、DeepSeek R1、Kimi K2.5)成功适配。OpenAI计划在2026年底前将Jalapeño部署到计算基础设施中,同时第二代产品已在开发中段,第三代也初具雏形。
影响与观察
Jalapeño并非孤例。大模型公司自研芯片已成潮流。Google的TPU已迭代至第八代,第七代Ironwood就是首款推理专用TPU,第八代进一步细分为训练和推理芯片。Google甚至正在开发代号Frozen v2的服务器芯片,尝试将Gemini的部分架构直接固化进硬件,预估每瓦生成token数可达最新TPU的6至10倍。亚马逊AWS开发了推理芯片Inferentia和训练推理兼顾的Trainium,Anthropic通过Project Rainier获取近100万颗Trainium芯片算力,并已组建内部芯片研发团队为下一代Claude打造定制芯片。
自研芯片最直接的理由是算力效率的经济账。以OpenAI的定价变化为例,2024年GPT-4o每百万输入/输出token收费5美元/15美元,如今GPT-5.6 Luna已降至0.2美元/1.2美元,降幅超过94%。假设一项Agent日调用1000万次,年费可从约6.39亿美元降至3650万美元。虽然降价包含算法、软件与市场竞争的贡献,但计算效率的提升是核心驱动力。将计算效率的主导权掌握在自己手中,结合ChatGPT的巨大调用量,自研芯片的投入可轻松通过节省支出收回。
算力供给同样重要。即使是拥有TPU的Google Cloud,也曾因容量不足拒绝外部订单,Gemini的混乱据报也有内部算力争夺的原因。只有把芯片握在手里,模型研发才不会完全受制于单一供应商的产能和报价。OpenAI首席财务官Sarah Friar将公司战略概括为“以广度建生态,以自营握杠杆”:训练和通用计算继续采购外部高端系统,稳定且巨量的推理则由Jalapeño分担。第一代芯片暂不出售也不出租,产能全部留给OpenAI。作为模型公司,OpenAI比其他公司更了解Agent的实际工作流程,这为下一代芯片的设计提供了独特优势。
结语
计算机科学家Alan Kay曾说:“真正认真对待软件的人,应该制造自己的硬件。”在大模型时代,这句话有了新的变体:真正认真对待模型的人,也会去造一颗专属于模型的芯片。Jalapeño的出现,不仅展示了AI辅助芯片设计的速度潜力,也标志着大模型公司从算力使用者向算力定义者的转变。当AI开始为自己造芯,芯片业的“大加速时代”才刚刚开始。
信息来源:爱范儿,查看原始信息。本文由 AI ONLINE 基于公开资料整理,信息可能随时间变化,请以官方发布为准。
