跳至主要內容
FAQ

AMD 攜手 Cerebras 推出分離式推理架構,效率宣稱提升 5 倍

AMD 與 Cerebras Systems 於 7 月 23 日宣布技術合作,結合 AMD Helios 機架級硬體與 Cerebras 晶圓級引擎,打造分離式 AI 推理工作流,宣稱每瓦 token 生成效率最高可提升 5 倍。聯合系統預計於 2026 年下半年透過 Cerebras Cloud 上線,鎖定程式碼助理、自主代理及即時機器人等應用場景。

1 分鐘閱讀

如果 AI 推理將成為這個十年最關鍵的基礎設施命題,答案幾乎確定無法由單一廠商提供。AMD 與 Cerebras Systems 剛宣布的技術合作,恰恰是對這個判斷的具體落地:透過結合兩家公司各有所長的硬體,他們相信能夠打出任何一方單獨作戰時五倍的效率。

這項合作於 7 月 23 日的「Advancing AI 2026」大會上發布,描述一種分離式推理架構,將執行大型語言模型時計算性質截然不同的兩個階段,拆分到各自最適合的專用硬體上——AMD Helios 負責提示詞處理階段,Cerebras 晶圓級引擎(Wafer-Scale Engine,WSE)負責 token 生成階段。兩家公司宣稱,相比 Cerebras 系統單獨運作,這套組合每瓦 token 生成效率可提升最多 5 倍。

為何推理成為新戰場

在 AI 熱潮的大部分早期篇章裡,矚目的競爭焦點是訓練:誰能集結最大的 GPU 叢集、投入最多算力、訓練出最強的基礎模型。這場競賽尚未結束,但一場規模或許更具商業意義的競爭已悄然並行展開:推理。

推理是訓練結束後發生的一切——每當用戶向 AI 助理發送訊息、每一次生產應用的 API 呼叫、每一個由自主代理在多小時任務中生成的 token,都是推理。大規模部署時,推理成本可以遠超訓練成本,而推理延遲直接決定即時應用的體驗品質。這正是為什麼 AMD 執行長蘇姿丰在 Advancing AI 大會上選字如此精準:「AI 推理正在成為 AI 領域最大的基礎設施機遇之一,而它日益增長的多元需求需要更靈活的應對方式。」

她提到的多元需求,是真實且持續擴大的。程式碼助理需要在兩秒內回應開發者的問題,否則工作流就會中斷。一個花四小時完成多步驟分析的自主代理,需要最大吞吐量來高效處理上下文。控制實體系統的機器人應用,需要有安全保障的超低延遲。這些工作負載對硬體的要求根本不同——為其中一種優化的單一系統,幾乎必然不適合另一種。

架構設計:從分離出發

AMD 與 Cerebras 的合作,透過將推理刻意拆分為兩個自然階段來應對這種多元需求。

「預填充」(Prefill)——即提示詞處理階段,模型讀入並編碼用戶輸入,包括可能長達數百萬 token 的上下文——需要龐大的記憶體頻寬和處理大規模並行矩陣運算的能力。這正是 AMD Helios 的優勢所在,它基於 AMD Instinct GPU 架構,以機架級配置封裝,能夠快速消化超大上下文視窗。隨著模型部署時的上下文視窗從 128K 擴展至 100 萬 token,這項能力愈加關鍵。

「解碼」(Decode)——token 生成階段,模型逐 token 輸出回應——有著不同的計算特性:需要極高的單 token 記憶體頻寬和超低延遲,才能維持讓 AI 感覺流暢互動而非機械等待的串流響應性。這正是 Cerebras 晶圓級引擎的本土優勢。WSE 建立在一塊超大的單晶片上,消除了 GPU 叢集在解碼階段飽受折磨的晶片間通訊延遲,使其能以任何同等規模 GPU 系統都難以比肩的速度生成 token。

透過將兩套系統連結為單一的分離式工作流,AMD 與 Cerebras 主張:應對推理多元需求的正確答案不是更好的 GPU,而是一套將每個階段分配給最適硬體的專用系統。Cerebras 執行長 Andrew Feldman 直白地點出需求驅動力:「對超快推理的需求正以前所未有的速度增長。」

效能主張與背景脈絡

5 倍每瓦 token 效率的宣稱,是以 Cerebras 系統單獨運作為基準——而這個基準本身已是市場上可取得的最快 token 生成方案之一。相對於純 GPU 推理系統,效率差距的呈現方式會有所不同,但核心論點依然成立:當工作負載天然包含兩個具有不同硬體需求的截然不同階段時,分離式架構可以超越單一整合架構。

合作初期鎖定三個效能特性最具商業吸引力的應用類別:軟體開發工作流(程式碼助理需要穩定的毫秒級響應時間)、自主代理(超長上下文與高吞吐決定代理每小時能完成多少工作)、機器人與科學發現(與物理世界的即時互動需要 GPU 叢集難以穩定保障的延遲承諾)。

上線路徑與部署規劃

聯合系統將於 2026 年下半年首先透過 Cerebras Cloud 上線。Cerebras 計劃在自有資料中心實際部署 AMD Helios 系統,形成一個企業客戶可以透過 API 存取的整合基礎設施堆疊,無需自行管理異質硬體的複雜度。這種部署路徑是刻意為之的:企業 AI 團隊愈來愈傾向以服務形式採購推理算力,而非自建和運維複雜的異質硬體堆疊。

雲端優先的上線策略,也讓 Cerebras 得以在向外提供本地部署方案之前,先在生產規模上驗證分離式架構的可靠性。這種複雜度的硬體整合——透過統一軟體層將晶圓級矽片與機架級 GPU 基礎設施連結——需要實驗室基準測試無法完全模擬的生產強化過程。

競爭維度

AMD 與 Cerebras 的宣告,被明確定位為對 Nvidia 主導 AI 基礎設施市場地位的挑戰。Nvidia 的 H100 和 B200 GPU 目前在大多數生產部署中同時處理預填充和解碼兩個階段,而 Nvidia 的 CUDA 軟體生態系統形成了巨大的遷移成本,即便替代硬體在效率上更有優勢也難以輕易切換。

這項合作傳達的訊息,並非 AMD 或 Cerebras 任一方能單獨取代 Nvidia——而是推理市場規模太大、需求太多元,沒有任何單一架構能服務所有場景,而將延遲和效率優先於軟體生態系統連續性的客戶,有充分理由考慮分離式替代方案。

對 AMD 而言,Cerebras 合作在無需自研晶圓級矽片的情況下,補強了自身的推理佈局。對 Cerebras 而言,AMD 的 Helios 提供了 WSE 架構先天不擅長的高吞吐預填充能力,讓一款專用加速器蛻變為完整的推理解決方案。

市場的回應,取決於企業買家願意在異質基礎設施上投入多大的力氣。效能層面的論據已然紮實;運營簡易性的故事,還在持續建構之中。

AMD Cerebras AI 推理 硬體 晶片 Nvidia 競爭者
分享

相關報導