核心概念

2026 年 6 月 24 日,OpenAI 與 Broadcom 聯合發布 Jalapeño——OpenAI 有史以來的第一款自研 AI 晶片,也是專為大型語言模型推論設計的 ASIC(特定應用積體電路)。

為什麼是推論,不是訓練?

Jalapeño 定位明確:只做推論(inference),不做訓練(training)。這是一個精算的策略決定。

訓練需要海量通用算力,NVIDIA H100/B200 是無可爭議的首選。但推論的工作負載截然不同——相同的模型權重被讀取數十億次,服務同樣的 attention 計算模式,流向固定的 serving pipeline。這種高度可預測的重複工作負載,正是 ASIC 最擅長的場景。

OpenAI 每天需處理數以億計的推論請求(ChatGPT、Codex、API 呼叫),推論成本是主要運營支出。今年 ChatGPT 伺服器成本預估高達 140 億美元,OpenAI 目前每賺 1 美元只留下約 33 美分利潤,相比之下 NVIDIA 維持約 75% 的毛利率。改善推論效率,財務意義遠大於改善訓練效率。

架構設計哲學

Jalapeño 的架構圍繞 LLM 推論的核心瓶頸設計,而非通用算力:

記憶體移動最小化:LLM 推論的主要瓶頸不是計算力,而是在晶片記憶體中持續搬移 KV cache 和模型權重。Jalapeño 的記憶體子系統專門針對這個問題優化,最大化記憶體頻寬利用率。

計算 / 記憶體 / 網路三角平衡:不同於通用 GPU 以計算為核心再附加記憶體和網路,Jalapeño 從設計初期就同等重視三個維度的均衡,使整體系統能接近理論峰值效能運行。

網路直接整合:Broadcom 的 Tomahawk 交換晶片與 Jalapeño 直接整合,讓跨晶片、跨伺服器的推論叢集能以極低延遲協調運作。

針對自有模型的深度調優:完全圍繞 OpenAI 自有模型的計算核心(kernel)設計,不需要支援 NVIDIA 龐雜的生態系或其他廠商模型。工程樣品已在生產目標頻率下成功運行 GPT‑5.3‑Codex‑Spark。

早期測試結果顯示,每瓦性能(performance per watt)顯著優於當前最先進替代方案,推論成本目標降低約 50%

三方供應鏈結構

角色 公司 負責範圍
架構設計 OpenAI 整體晶片架構、kernel 設計
矽晶體實作 Broadcom 矽晶片工程、Tomahawk 網路整合
製造 TSMC 3 奈米製程生產
系統整合 Celestica 電路板、機架、系統組裝

Microsoft 預計購買初期產能的約 40%,與 Stargate 計畫:OpenAI 打造智能時代算力基礎設施 的吉瓦級資料中心建設需求直接掛鉤。

九個月的超速開發

從初始概念到製造流片(tape-out)僅耗時九個月,被業界認為可能是高效能先進半導體領域有史以來最快的 ASIC 開發週期。加速關鍵之一是 OpenAI 的自有語言模型直接參與硬體設計流程——AI 自動化了部分工程環節,讓人力專注於最需要創意判斷的設計決策。

關鍵要點

  • 推論專用 ASIC:Jalapeño 不做訓練,僅針對 LLM 推論設計,以 TSMC 3nm 製程製造,工程樣品已可在生產頻率下運行 GPT‑5.3‑Codex‑Spark
  • 50% 成本目標:相較現有 GPU 推論方案,目標降低約 50% 的每次推論成本,每瓦性能取得顯著優勢
  • 三方供應鏈:OpenAI 主導架構、Broadcom 負責矽晶片與網路、Celestica 負責系統整合,Microsoft 購買初期約 40% 產能
  • 吉瓦規模部署:2026 年底開始初期部署,2029 年目標達到 10 吉瓦產能規模
  • 全棧控制宣示:OpenAI 明確目標是掌控「晶片架構、記憶體系統、網路、排程到產品體驗」的完整技術棧,Jalapeño 是硬體層的起點

實務應用

對 OpenAI 財務結構:若推論成本降低 50%,意味著在不增加伺服器支出的前提下,可提供兩倍的推論請求量,或大幅改善利潤率,緩解每年百億美元規模的伺服器成本壓力。

對 NVIDIA 的競爭信號:Jalapeño 發布當天 NVIDIA 股價微跌約 1%。短期而言,大型模型訓練仍依賴 NVIDIA GPU;但長期信號明確——繼 Google TPU(2016)、Amazon Inferentia(2019)、Meta MTIA(2023)之後,主要 AI 公司正系統性地在推論側替代 NVIDIA。

對 Broadcom 的機遇:Google TPU 同樣由 Broadcom 負責流片,Jalapeño 進一步確立了「AI 公司設計架構、Broadcom 執行矽晶體」的合作模式,Broadcom 成為 AI 自研晶片浪潮的核心基礎設施提供商。

延伸觀點

推論 ASIC 成為標配競爭動作:跨多個獨立報導的共同觀察是——自研推論晶片已從 Google 的獨家優勢演變為頭部 AI 公司的必要配備。2026 年 6 月同期,ByteDance 也傳出與 Qualcomm 洽談自研 ASIC,顯示這波浪潮正在跨越美中 AI 競爭的邊界。

AI 加速 AI 晶片設計的正循環:多個來源共同指出,九個月超快開發週期的關鍵因素之一是 OpenAI 使用自有 LLM 自動化了硬體設計的部分流程。這形成一個值得關注的正循環:更好的模型幫助設計更好的晶片,更好的晶片降低推論成本,使模型能服務更多用戶並獲得更多訓練資料回饋。

推論成本下降重開產品設計空間:以當前 GPU 推論成本,許多多模態、長上下文、高頻互動的 AI 功能仍在邊際成本邊緣掙扎。若推論成本下降 50%,等同於重新開啟大量此前「算不起」的產品設計空間——複雜 Agent 鏈路、多輪深度對話、全程串流生成等特性的部署門檻都將大幅降低。

反向連結

以下頁面引用了本頁: