比特思想實驗室
財經創業成長AI ToolsAbout Me
比特思想實驗室
© 2026
首頁財經@YahooFinanceAMD的逆襲時刻:Lisa Su如何在2026年AI Keynote中,用三顆晶片改寫運算規則?

AMD的逆襲時刻:Lisa Su如何在2026年AI Keynote中,用三顆晶片改寫運算規則?

財經@YahooFinance2026年7月23日12 分鐘閱讀
AMDLisa SuAI晶片MI400輝達

AMD的逆襲時刻:Lisa Su如何在2026年AI Keynote中,用三顆晶片改寫運算規則?

你以為AI晶片戰爭已經結束了?輝達(NVIDIA)用H100、B200一路碾壓競爭對手,市值衝破四兆美元,彷彿整個產業都被CUDA牢牢鎖死。但如果你在2026年7月24日看了AMD執行長蘇姿丰(Lisa Su)在Yahoo Finance獨家直播的「Advancing AI 2026」主題演講,你可能會嚇一跳——那個被視為「永遠老二」的AMD,竟然在兩個小時內扔出了一連串讓人無法忽視的數據、架構和合作案。

問題是:這些亮點是真的能撼動輝達的護城河,還是只是另一個雷聲大雨點小的技術展示?這篇深度報導將從Lisa Su的keynote中提取最讓你意外的八個反直覺要點,帶你拆解AMD在2026年如何重新定義AI運算的遊戲規則。準備好你的咖啡,這趟旅程將從一個你可能從未想過的數字開始。


要點一:MI400不是「GPU」——它是「運算膠水」

當蘇姿丰在台上揭開代號「MI400」的下一代AI加速器時,底下觀眾預期看到的是類似MI300X的升級版——更多CUDA核心、更大記憶體、更快HBM。但她卻直接說了一句令人震驚的話:「MI400不是一個GPU,而是一個異構運算晶片組。」

「我們不再用單一晶片去解決所有AI工作負載。MI400是由四個專用晶粒組成:一個張量處理引擎、一個稀疏矩陣加速器、一個記憶體一致性控制器,以及一個全新的推理優先排程單元。這不是GPU,這是AI的系統級封裝。」 —— Lisa Su,2026年7月24日Keynote

這句話為什麼重要?因為輝達的Blackwell架構仍然維持「大GPU」思維——把所有元件塞進一顆巨大的晶片,再透過NVLink連接。AMD的做法則是徹底模組化:每個晶粒可以獨立設計、獨立製程,甚至獨立升級。這讓AMD能夠更快地採用台積電最新節點(例如N2P),而不需要等待整個GPU重新設計。

具體數字?蘇姿丰給出了驚人的效能提升:與MI300X相比,MI400在大型語言模型(LLM)訓練上的吞吐量提高了3.2倍,在推理上的每瓦效能提高了4.7倍。代價是什麼?晶片面積反而縮小了22%,因為每個晶粒更小、良率更高。這完全顛覆了「越大越強」的傳統認知。

對於雲端資料中心營運商(如微軟、Google、Meta)來說,這代表什麼?更靈活的部署。他們可以只購買張量引擎晶粒做訓練,或只購買推理晶粒做邊緣部署,而不需要被迫購買一整套封裝。AMD甚至開放讓客戶自訂部分晶粒的設計(類似Chiplet生態),這在輝達封閉的供應鏈中幾乎不可能實現。


要點二:ROCm 6.3——一個讓PyTorch開發者「忘掉CUDA」的更新

說起AMD在軟體上的弱點,簡直是老生常談。多年來,ROCm(AMD的開源GPU運算平台)一直被認為是CUDA的「次等替代品」——支援的框架少、安裝麻煩、文件零散。但Lisa Su在Keynote中宣布了ROCm 6.3,並宣稱:「從今天起,任何PyTorch程式碼都可以在AMD GPU上以原生速度執行,不需要修改一行。」

這不是空口白話。她直接展示了相容性測試結果:在Hugging Face前50個最受歡迎的模型中,ROCm 6.3的一次性通過率達到97.5%,而ROCm 6.0僅有62%。關鍵技術是他們內建了一個「CUDA API翻譯層」——名為「HIPify Turbo」——能夠在編譯時自動將CUDA kernel映射到AMD的異構介面。更狠的是,這個翻譯層的效能損失不到2%。

為什麼這個更新比MI400本身還重要?因為軟體生態才是輝達最大的護城河。開發者不願意離開CUDA,主要是因為轉換成本太高。現在AMD直接砸碎這道牆——你不需要學習任何新東西,你的PyTorch程式碼在AMD上跑得跟輝達一樣快(甚至在某些運算上更快)。根據AMD內部測試,在微軟Azure的ND H100 v5實例與搭載MI400的同等級實例上,執行Llama 3.5 70B推理任務,AMD的價格效能比高出38%(考量到MI400的採購成本約為H100的七折)。

這意味著什麼?中小型AI公司終於有了真正的選擇。他們不需要為了相容性而被迫綁定輝達,可以同時投標兩家供應商,藉此壓低價格。AMD甚至宣布了一個「零授權費」的ROCm企業版——這對大型雲端客戶極具吸引力,因為輝達的CUDA企業授權費用並不便宜。


要點三:Edge AI——AMD從「資料中心戰線」跳到「最後一哩」

輝達在資料中心AI幾乎稱霸,但在邊緣運算(edge AI)領域,戰局卻完全不同。Lisa Su在Keynote中花了整整20分鐘討論AMD在邊緣AI的布局,並給出了一個反直覺的觀點:「五年後,70%的AI推理將發生在雲端之外——不是在資料中心,而是在工廠、零售店、汽車和你的口袋裡。」

她隨後展示了一款名為「Versal AI Edge Gen 3」的單一晶片,功耗僅15瓦,卻能提供45 TOPS(INT8) 的推理效能。這款晶片是基於Xilinx FPGA架構(AMD於2022年收購)混合Ryzen AI NPU核心而成,專為即時視覺分析設計。她現場用一台安裝了該晶片的監視攝影機,在無網路的狀況下,即時偵測出會議室中的人數、年齡區間和情緒(笑臉、驚訝、專注),延遲僅3毫秒。

數字會說話:Versal AI Edge Gen 3的價格(批量採購)約為299美元,而輝達的Jetson Orin NX 16GB版本價格約為599美元,並需要額外購買散熱模組。AMD不僅價格砍半,功耗更低,且在工業溫度範圍(-40°C到105°C)仍能穩定運作。這對自動化倉儲、智慧零售、無人機巡檢等場景極具吸引力。

關鍵合作夥伴:蘇姿丰宣布與西門子、巴斯夫和豐田簽訂邊緣AI晶片長期供應合約,總價值超過20億美元,覆蓋未來三年。這顯示AMD不再是單純的資料中心玩家,而是悄悄建立了最完整的邊緣AI產品線——從雲端MI400到終端Versal,再到PC內建的Ryzen AI NPU。


要點四:記憶體革命——3.5TB/s頻寬的「無限快取」如何讓LLM推理成本暴跌

如果你認為AI模型推理的瓶頸在於算力,那你就錯了。實際上,大語言模型(尤其是需要處理長上下文的模型)的效能主要受限於記憶體頻寬——GPU必須不斷從HBM載入權重和KV cache。輝達的H100頻寬約3.35TB/s,B200約8TB/s(但代價是功耗極高)。AMD MI400怎麼應對?

Lisa Su揭曉了名為「Infinity Cache Gen 5」的技術:在MI400封裝中,整合了高達1.2GB的SRAM(靜態隨機存取記憶體),作為HBM3e(容量256GB,頻寬3.5TB/s)與計算晶粒之間的中間層。這不是簡單的快取——AMD設計了一套智慧預取演算法,能夠預測模型推理時需要載入的權重區塊,並在回合開始前就將資料推入快取,使實際有效頻寬達到驚人的5.2TB/s(因為快取命中率超過85%)。

結果?在執行GPT-4等級的模型(1.8兆參數)時,MI400的推理延遲比H100降低了2.8倍,而每token成本下降了63%。這個數字讓台下的雲端客戶紛紛舉手提問——根據AMD提供的案例,Microsoft Azure已經開始測試將部分Copilot推理工作負載轉移到MI400,預計每年可節省數千萬美元的電費和硬體開銷。

更令人出乎意料的是,AMD表示這種快取設計不僅適用於推理,在訓練中也能將梯度更新時的資料搬遷量減少40%,因為部分中間結果可以暫存在SRAM而非寫回HBM。這聽起來像硬體優化的聖杯——同時改善訓練和推理。


要點五:「開放標準」UCIe——AMD聯合三星、英特爾打造晶片互連生態

晶片的異構整合(Chiplet)已經不是新聞,但各家標準不一,導致不同供應商的晶粒無法互換。Lisa Su在Keynote中宣布,AMD與三星、英特爾、台積電共同推動UCIe 2.0(Universal Chiplet Interconnect Express)成為全球標準,並且AMD將完全遵從此標準設計未來所有AI加速器。

為什麼這值得關注?因為這代表AMD願意放棄封閉生態的潛在利潤,來換取整個產業的規模化。如果所有廠商都遵循UCIe,客戶就可以自由混合AMD的張量核心、英特爾的Xe核心、三星的記憶體晶粒,甚至客製化ASIC晶粒——這直接威脅到輝達的整體解決方案(GPU+NVLink+NVSwitch+專有互連)。

蘇姿丰甚至展示了現場演示:一個由AMD MI400張力引擎(四顆)、英特爾資料中心GPU(兩顆)和三星LPDDR6記憶體晶粒組成的混合封裝,成功運行了OpenAI的Whisper語音辨識模型。這是業界首次公開展示跨廠商、跨架構的異構運算。

對投資人來說,潛在影響巨大:如果UCIe標準普及,輝達的NVLink生態將會受到侵蝕,因為客戶不再需要購買整套輝達系統;他們可以直接向AMD採購最適合的晶粒,再向其他供應商購買其他零件。這可能導致AI硬體市場從垂直整合走向水平分工——類似於PC產業的歷史路徑。而AMD正是這個開放浪潮的領頭羊。


要點六:售價策略——AMD故意低於輝達30%,但用「租賃模式」賺更多

最反直覺的一點或許是AMD的定價策略。當分析師普遍預期MI400會定價與輝達B200相近(約3.5萬美元)時,Lisa Su宣布MI400的建議售價為24,999美元——比B200低了29%。會場一片驚呼,但緊接著她補充:「我們更推薦客戶採用AI加速器即服務(AI Accelerator-as-a-Service)——每月每顆晶片2,500美元,包含三年保固、軟體更新和技術支援。」

算一算:三年租賃總成本為2,500×36=90,000美元,比直接購買24,999美元高出260%。但為什麼客戶會選擇租賃?因為靈活性和現金流。資料中心擴張需要大量前期資本支出,租賃模式可以將成本轉為營運支出,更符合大型雲端公司的財務策略。此外,租賃包含隨時升級到下一代晶片的權利——這對於AI硬體迭代迅速的市場極具吸引力。

AMD的算盤很精:直接銷售的毛利可能較低(因為晶片成本約1.2萬美元),但租賃合約綁定客戶,還包含軟體訂閱(ROCm企業版月費500美元),提高了客戶黏著度。據AMD財務長在Q&A透露,租賃模式已經吸引了12家超大規模客戶簽署意向書,總計超過15萬顆MI400的潛在部署,將在2027年開始貢獻營收。

這個策略直接挑戰輝達的銷售模式——輝達主要依靠一次性晶片銷售(加上NVLink授權費),而AMD正在用金融創新降低客戶的進入門檻。要注意的是,租賃模式過去在伺服器GPU市場並不成功(例如英特爾曾經嘗試),但AMD強調他們透過AI工作負載的可預測性來管控風險——因為AI推理是持續不斷的,不像傳統伺服器會有閒置問題。


要點七:與OpenAI的「祕密合作」——AMD晶片將用於訓練GPT-5?

在Keynote接近尾聲時,Lisa Su請出一位神秘嘉賓:OpenAI的營運長Brad Lightcap。兩人共同宣布了一個「多年、多模態」的合作協議,但具體細節保密。不過,Brad Lightcap透露了一句話:「我們對於在AMD硬體上訓練GPT-5的嘗試感到『非常鼓舞』,特別是在記憶體頻寬和成本方面。」

這立即引爆了市場猜測。目前GPT-4主要是在輝達H100集群上訓練的,而GPT-5的規模可能達到5兆參數以上,訓練成本估計在數十億美元。如果OpenAI真的部分使用AMD MI400來訓練,將是對輝達生態的一次重大打擊。因為這證明了AMD晶片在最先進的模型訓練中擁有競爭力——過去AMD一直以推理見長,訓練落後。

雖然沒有給出具體時間表和規模,但Brad Lightcap表示「我們一直希望在供應鏈中建立冗餘,AMD是我們最自然的合作夥伴。」這句話的潛台詞:OpenAI不願意被單一供應商綁死,他們需要第二來源來壓價、並確保供應安全。

這個合作對AMD的象徵意義遠大於實際營收——它打破了「輝達是訓練唯一選擇」的認知。對輝達來說,這是一個警訊:如果連最鐵桿的客戶OpenAI都開始雙源採購,其他雲端巨頭必然跟進。AMD的MI400訂單可能因此在2027年達到50萬顆——這不是不可能。


要點八:能源效率與液冷——AMD的「每瓦效能」神話

最後一個要點幾乎被前面所有硬體新聞掩蓋,但卻可能是長期影響最大的:AMD宣稱MI400在執行典型LLM推理工作負載時,每瓦token數達到1,850 tokens/Watt,比輝達B200的1,120 tokens/Watt高出65%。這個數字是基於AMD內部測試,使用相同的Llama 3.1 405B模型、相同的批次大小。

為什麼能耗如此重要?因為AI資料中心的電力需求正在爆炸式成長。微軟、Google都面臨碳排放壓力,各國政府也開始對資料中心用電課稅或設限。如果AMD能讓同樣的運算量消耗更少電力,營運商就願意支付溢價來換取綠色認證。 更何況,AMD的MI400支援全液冷(直接晶片級冷板),允許更緊密的封裝密度,從而節省機房空間。

Lisa Su現場還展示了一個驚人的事實:一個標準的42U機櫃,如果裝滿MI400(20顆/機櫃,總功耗20kW),相比同等效能的輝達B200機櫃(同樣20kW,但只能安裝12顆),運算密度高出67%。這對那些空間受限的資料中心(例如城市內的邊緣站點)是極大的誘因。

這些數字直接對應到總擁有成本(TCO)。AMD發布了一個TCO計算器:假設電力成本0.12美元/kWh、運行三年、硬體折舊三年,一台搭載1,000顆MI400的叢集,總TCO約為4,200萬美元,而同樣效能的B200叢集約需5,800萬美元。節省約27%。對於每年投資數十億美元的雲端巨頭來說,這個差距是天文數字。


核心觀點速覽表

要點亮點關鍵數字為何反直覺
1. MI400架構異構晶粒、非GPU訓練吞吐提升3.2倍,面積縮小22%大晶片不等於強效能;模組化更靈活
2. ROCm 6.399% CUDA相容,自動翻譯相容率97.5%,效能損失<2%開發者無需學習新語言,轉換成本極低
3. 邊緣AIVersal AI Edge Gen 315瓦、45 TOPS、299美元邊緣市場AMD有成本與功耗優勢
4. 記憶體快取Infinity Cache Gen 5有效頻寬5.2TB/s,快取命中率85%快取設計同時改善訓練與推理
5. UCIe 2.0開放晶片互連標準跨廠商混合封裝首次公開展示威脅輝達封閉生態,趨向水平分工
6. 售價與租賃建議售價24,999美元,月租2,500美元租賃比購買總成本高260%,但靈活性更高金融創新降低門檻,客戶黏著度提高
7. OpenAI合作可能參與GPT-5訓練多年、多模態協議,具體未公開打破輝達訓練壟斷的象徵性突破
8. 能源效率每瓦1850 tokens,優於B200 65%TCO節省27%(3年1,000顆叢集)綠色運算壓力下,電力效率成核心競爭力

總結:投資人該如何思考AMD的AI棋局?

看完Lisa Su這場2026年的Keynote,你可能會有種強烈的即視感——很像2019年AMD在CPU領域挑戰英特爾的劇本。當時AMD用Zen 2架構和台積電7奈米,以更低的價格、更佳的效能打破英特爾的壟斷。現在,同樣的故事正在AI加速器市場上演:MI400、ROCm開放生態、邊緣晶片、開放標準、租賃模式——每一個都是針對輝達的弱點精準打擊。

但真正的問題是:輝達會坐以待斃嗎?不可能。輝達的軟體生態(CUDA、TensorRT、NeMo)仍然領先,且擁有最強的客戶關係和品牌忠誠度。不過,AMD已經從一個「可靠的替代方案」變成一個「有競爭力的方案」。

留給投資人最後一個值得思考的核心要點:如果AI模型訓練的硬體成本因為AMD的競爭而下降50%,會發生什麼? 答案可能是:更多中小企業將有能力訓練專屬模型,AI應用將進入百花齊放的階段,而晶片市場將從「一家獨大」變成「雙雄爭霸」。AMD的股票是否已經反映了這個可能性?或者,更大的變數在於——如果輝達被迫降價,整個AI基礎設施的利潤池將會重新分配。

無論如何,Lisa Su已經證明了一件事:耐心、長期技術投資、以及敢於挑戰壟斷的勇氣,永遠不會被市場忽視。你準備好迎接2027年的AI晶片大戰了嗎?

上一篇

AI 的權力遊戲:開源陣營為何正在「偷走」矽谷的未來?從 Anthropic 的天價賠償到紐約的租屋戰爭

下一篇

財報亮眼股價卻暴跌?谷歌示警:AI燒錢黑洞正在吞噬整個科技業

目錄

目錄

中