8 月 25 日,OpenAI 正式發表了其首款 AI 加速晶片 Jalapeño。Jalapeño 提供高達 13.4 petaflops 的 4 位元運算能力,並配備 232 GB 的最先進記憶體,傳輸速度高達每秒 15.4 TB。

OpenAI 引用的基準測試顯示,Jalapeño 在端到端延遲(從提示詞到最後一個 token 的時間)方面,比該公司目前依賴的 Nvidia GB300 晶片快上 3.6 倍,同時功耗更低。

這些數據在 Jalapeño 廣泛部署於 OpenAI 的推論叢集後,是否能轉化為實際效益仍有待觀察,但效能只是故事的一半。另一半則是這款晶片的設計方式,正如預期,整個過程都由 OpenAI 的大型語言模型(LLM)加速完成。

Jalapeño 從最初的架構概念到首次投片,僅用了不到 20 個月。從定義晶片邏輯的暫存器傳輸層級(RTL)程式碼完成到設計定案(tapeout)送交製造,也只花了 9 個月。

這是一個快速的時程,然而專家認為,隨著 LLM 的改進並更深入整合到晶片設計工具中,這個速度很快就會顯得緩慢。OpenAI 對此機會毫不意外地抱持樂觀態度。

OpenAI 硬體副總裁 Richard Ho 表示:「這些模型賦予了我們的工程師超能力。我們的工程師仍然主導著工作,他們仍然是最終的決策者。但他們可以更快地完成任務,探索更多的路徑。」

OpenAI 以小型設計團隊取得快速成果

Ho 提到,設計 Jalapeño 的團隊在整個專案期間平均不到 100 人,目前仍維持約 100 人的規模,以開發第二代和第三代設計。這個數字涵蓋了硬體團隊中從系統設計到軟體和供應鏈的廣泛職位,但不包括與 OpenAI 合作的 Broadcom 員工。

OpenAI 和 Broadcom 之間的勞務分工大致上是設計與實作。OpenAI 團隊負責端到端系統設計,包括推論加速器、記憶體層級和網路。Ho 表示,Broadcom 則負責「從閘極開始的實體設計」。

與 Broadcom 的合作讓一些人對 OpenAI 的速度有所保留。代理晶片設計新創公司 Verkor.io 的共同創辦人 David Chin 表示:「他們給出的時程相當可信」,但他認為 Broadcom 的協助對 Jalapeño 的快速開發至關重要。

他補充說:「如果讓其他人從零開始,那是不可能的。」Verkor.io 的另一位共同創辦人 Ravi Krishna 稱 OpenAI 的速度是「一個相對令人印象深刻的成果」,但他補充說,他預計如果專案從今天開始,LLM 能力的提升可能會帶來更快的時程。

加州大學聖地牙哥分校的傑出教授 Andrew Kahng 也認為 OpenAI 的速度值得關注,稱其「很可能是目前業界最佳」。Kahng 回憶起他共同組織的 2016 年 IEEE 設計自動化未來研討會。

當時仍在 Google 擔任工程師的 Richard Ho 是該研討會的主題演講者。Ho 對設計自動化有著強烈的看法,他將完成晶片設計所需的時間,視為團隊一天內能完成的迭代次數的函數。

OpenAI 的 LLM 如何加速 Jalapeño 的設計

馬里蘭大學半導體計畫與創新總監 Ankur Srivastava 表示:「自動化本身在晶片設計領域已經存在數十年了,這不是一個新問題。」然而,LLM 與先前的自動化工具不同之處在於它們理解語言和程式碼的能力。

他指出,這使得 LLM 特別適合處理「仍處於問題語言領域」的晶片設計任務。

OpenAI 團隊設計了一個利用這項優勢的工作流程。OpenAI 的前端工作流程圍繞著加速硬體合成(XLS)工具鏈而建構,這是一個最初由 Google 開發的開源高階合成工具。

高階合成是一種晶片設計自動化形式,允許工程師在更熟悉的程式設計環境中設計晶片。以 XLS 為例,晶片設計師可以使用 DSLX(一種受 Rust 啟發的領域特定語言)和 C++ 等語言進行編寫,然後 XLS 會將這些程式碼轉換為用於描述電子系統的硬體描述語言 Verilog。

OpenAI 技術人員 Chris Leary 表示:「我們當時在思考如何利用 AI 來加速專案,而 AI 在處理類似軟體的任務上表現得更好。」他補充說:「XLS 在某些方面看起來像軟體,因此獲得了這項優勢。」

Leary 對 XLS 的運作方式非常熟悉也很有幫助,因為他是在 Google 任職期間啟動這個專案的。

Kahng 同意,使用 AI 加速高階合成(例如 XLS)的決定是合理的,因為這對 LLM 來說「更自然」,並提供了快速迭代的機會。他認為:「我認為這是一個普遍有用的工作流程,而且它在未來也很有潛力。」

同樣的邏輯也促使 Jalapeño 團隊專注於軟體優化。當第一批晶片在五月從晶圓廠送回時,團隊利用其內部 AI 模型設計軟體來執行 SemiAnalysis 的 InferenceX 等基準測試。

在 DeepSeek 的多頭潛在注意力核心基準測試中,效能從理論上限(由晶片的運算和記憶體頻寬設定)的 0.31% 大幅提升到 88.94%,僅用了大約 40 小時。Ho 表示,這個結果是可重複的,因此晶圓廠交付第一批晶片到量產之間的時程可以縮短。

他強調:「我們所有的時程假設都將基於我們現在擁有這項能力的事實。」Jalapeño 晶片設計用於部署在包含 2,048 個晶片的叢集(pods)中。

儘管 Jalapeño 團隊的 AI 輔助工作流程的大致方向,Ho 和 Leary 事先已有預測,但 OpenAI 模型本身的改進仍帶來了一些驚喜。Leary 表示,該專案最初是藉助 OpenAI 的 o3 等模型,該模型於 2025 年 4 月公開發布(但 Jalapeño 團隊更早就能使用)。

然而,等到專案結束時,團隊已經可以使用 GPT-6 Astra 的前身模型,而 Astra 直到 2026 年 9 月 3 日才公開發布。Leary 說,較新的模型可以直接在 Verilog 中工作,無需 XLS 從一般程式語言進行轉換,並且已接近能夠獨立操作專有設計工具。

Ho 也證實,團隊可以使用為晶片設計而微調的內部 LLM,這些模型並未公開。他拒絕透露所使用的模型細節,但補充說 Jalapeño 團隊與 OpenAI 的研究團隊合作。

Ho 表示,雖然並非所有用於設計 Jalapeño 的特定模型都已公開,但目標是將從該專案中學到的經驗應用到公司的商用 LLM 中。他說:「可以肯定的是,Astra 及後續模型在晶片設計方面將會非常出色。」

AI 在後端優化方面較不實用,但情況可能改變

如前所述,OpenAI 在 Jalapeño 上的大部分工作都集中在晶片設計的「前端」,這包括從初步概念、編寫 RTL 程式碼定義設計,到驗證設計在實體實作時是否能正常運作等任務。

而大部分的「後端」設計,包括佈線互連、完成並驗證時脈和電源規格,以及將所需的設計資訊發送給晶圓廠等任務,則交由 Broadcom 負責,由其將晶片帶入生產階段。

不過,這並不表示 OpenAI 的工作流程忽略了後端。Jalapeño 團隊中包含實體設計工程師,他們與 Broadcom 的對應人員合作,提供晶片佈局(floorplan)和佈線(routing)等方面的指導。

在 2026 年的 IEEE Hot Chips 會議上,Ho 和 Leary 提出了 AI 輔助實體設計優化的具體成果,包括矩陣乘法單元(matrix multiplication units)的面積減少了 10%,這是與優化過的人工基準相比的結果。

換句話說,OpenAI 聲稱 AI 輔助優化有助於在相同的矽晶片面積內設計出比以往更多的電路。

Broadcom 使用了自己的內部工作流程。該公司的團隊無法存取 OpenAI 用於設計 Jalapeño 的內部模型,但他們可以使用 OpenAI 的公開商用模型。

Verkor.io 的 Ravi Krishna 表示,OpenAI 在後端設計上的方法已經顯得有些保守,他認為這是專案啟動時間(2024 年 10 月)的產物。他說:「過去四到五個月的模型已經有所改進。從 2026 年 4 月開始,它們才真正開始能夠更好地處理這些任務。」

Verkor.io 共同創辦人 Suresh Krishna 也同意,並表示「沒有理由不能有一個代理迴圈(agentic loop)也能大幅加速後端流程。」

Ho 和 Leary 也暗示,與團隊的下一個專案相比,用於設計 Jalapeño 的工作流程可能顯得有些過時。Leary 表示:「正如你所想像的,對於 Jalapeño,我們盡可能地追求速度。因此,在『我們是否要花時間進行一些創新,還是要做我們歷史上已知有效的事情』之間存在權衡。」

他補充說:「對於第二代晶片,我們有機會重新思考所有我們想要建立的東西。」

Ho 表示,第二代晶片的工作流程中「有很多地方我們正在導入 AI」。他提到在驗證和實體設計方面有更多利用 AI 的機會。Leary 補充說,團隊現在擁有自動波形操作和檢視工具。

這項工具可以自動化分析,識別與故障相關的晶片時脈訊號,並在硬體設計階段就能改進除錯。儘管預期會有這些改進,Ho 和 Leary 仍明確表示他們不認為晶片設計可以完全自動化。

Ho 解釋說:「我們並不是說任何人都可以只使用 [OpenAI 的程式設計平台] Codex 來建造最先進的尖端 AI/ML 加速晶片。我們正在說明一些非常具體的事情,關於如何更好地使用 Codex,以及我們如何專注於小型團隊和快速時程來達到高品質的成果。」