跳至主要內容
科技 分析

十歲的 ROCm 主攻推理:4GB 顯示卡入列,開發難題交給 AI 代理

AMD 以 10.0.0 版本紀念 ROCm 問世十週年,更新主軸放在 AI 推理、開發者工具與效能分析,支援清單納入 4GB 與 8GB 版 RX 9050,並開放以 AI 代理加速開發的 ROCm.AI。

Techroomage 編輯部 閱讀約 9 分鐘
十歲的 ROCm 主攻推理:4GB 顯示卡入列,開發難題交給 AI 代理

AMD 以 10.0.0 版本為 ROCm 的十週年定調,更新集中在 AI 推理、開發者工具與效能分析,支援清單下探到 4GB 記憶體的消費級顯示卡,開發流程則引進 ROCm.AI 的 AI 代理。

一張只有 4GB 記憶體的顯示卡,被寫進 AMD 最新運算軟體的支援清單。這個細節小到多數人會直接滑過,卻是看懂 ROCm 10.0.0 布局的起點。GPU 運算軟體的支援對象,通常由資料中心往消費端遞減,入門級顯示卡能進正式清單,說明 AMD 想爭取的使用者基數,比過去任何時候都更靠近一般開發者。

據 IT 之家 8 月 28 日報導,AMD 本週釋出 GPU 加速運算開放軟體堆疊 ROCm 的 10.0.0 版本,版本號刻意對齊這套軟體問世十週年。ROCm 之於 AMD,角色近似 CUDA 之於 NVIDIA:驅動程式、編譯器、數學函式庫到框架支援整包打包,讓 GPU 從繪圖晶片變成通用運算引擎。這一版的重點,放在 Instinct、Radeon 與 Ryzen AI 三個平臺上的 AI 推理、開發者工具與效能分析。

具體更新項目包括:擴充 GPU 與虛擬化支援,把 Radeon RX 9050 的 8GB 與 4GB 兩種記憶體版本納入;升級 PyTorch、JAX、vLLM、SGLang、MIGraphX、ONNX Runtime 等 AI 框架與推理引擎;改進 HIP 效能;更新數學、稀疏運算與通訊函式庫。AMD 同時開放 ROCm.AI,以 AI 技術加速 AMD 硬體上的開發與效能最佳化。

ROCm 10.0.0 的五項更新重點:AI 推理框架與引擎升級、開發者工具強化、效能分析改進、GPU 與虛擬化支援擴充,以及 ROCm.AI 開放使用

十歲這一版,力氣花在模型上線之後

ROCm 在 2016 年問世時,GPU 運算的主流話題是高效能運算與剛起步的深度學習訓練。十年過去,10.0.0 的更新重點列的是推理、開發者工具與效能分析。這份清單本身就在說明產業重心移到了哪一段:模型訓練完成之後,每天回應大量請求、真正碰使用者的那段生命週期。

框架名單值得逐個看。vLLM 與 SGLang 是目前開源大型語言模型服務化部署的主流框架,負責把模型變成能穩定對外提供服務的引擎;ONNX Runtime 跨平臺承接推論工作負載;MIGraphX 則是 AMD 自家的推理圖優化器,決定模型在 AMD GPU 上的執行效率。這幾個名字同時出現在更新清單,指向雲端機房與本地端兩種推理場景。

訓練與推理的經濟邏輯並不相同。訓練是集中在少數叢集、追求極限規模的生意,比的是頂規互連與記憶體頻寬;推理分散在每個應用環節,天天發生,單次請求的成本、延遲與能源效率才是計較的重點。這種差異讓推理市場對硬體選項更開放,開源框架的相容性也因此變成採購時的實際條件,而非加分題。

把重心放在推理,符合 AMD 的處境。訓練市場的採購高度集中在從硬體到框架一手包辦的 NVIDIA,後進者能搶的份額有限;推理市場隨應用普及持續擴大,採購更看價格效能與開源生態的相容程度,對挑戰者相對友善。AMD 把 vLLM、SGLang 與 MIGraphX 一起往前推,等於同時顧了推理的入口與底層執行效率。

支援清單往下長,開發者基數才長得起來

ROCm 過去十年累積最多的批評,集中在支援範圍太窄。正式支援長期偏向 Instinct 資料中心卡與少數高階 Radeon,拿消費級顯示卡跑 PyTorch 的使用者經常得靠社羣自行繞路;文件與框架支援的時間差,也讓許多人繞一織又回到 CUDA。對想建立生態的軟體來說,這類摩擦每一次都在把人往外推。

ROCm 自 2016 年問世至今屆滿十年,10.0.0 的版本號即為紀念此週年而設

10.0.0 把 RX 9050 的 8GB 與 4GB 版本都納入,並擴充虛擬化支援。4GB 記憶體在 2026 年的 AI 語彙裡聽來喫緊,但量化後的小型模型、蒸餾模型與 ONNX 格式的邊緣推論,仍能在這個容量下工作。對學生與獨立開發者,意義在於進入 ROCm 生態的門檻降到一張平價顯示卡的價位,而且本機開發環境與雲端 Instinct 用的是同一套軟體。

HIP 也值得多看一眼。它是 ROCm 裡負責可攜性的那一層,讓原本為 CUDA 撰寫的程式碼經過轉換後能在 AMD GPU 上執行。本版標明改進 HIP 效能,對手上已有 CUDA 資產的團隊是關鍵訊息:移植過去之後跑得快不快,直接決定換硬體這筆帳算不算法。

軟體的支援清單往往先於產品發表,透露硬體布局的先後。蘋果的 iOS 測試版程式碼裡出現複數形態的電池狀態字串,被解讀為摺疊 iPhone 的工程線索,用的是同一種閱讀方法。ROCm 把 RX 9050 兩種記憶體版本寫進支援清單,等於替這條產品線在開發者端先掛了號,也暗示入門市場還有後續安排。

連 Ryzen AI 一起看,這套軟體的覆蓋範圍相當完整:資料中心的 Instinct、工作站與桌機的 Radeon、筆電裡的 NPU,三層硬體共用一個堆疊。開發者用 4GB 顯示卡驗證過的推理流程,往上可以搬進 Instinct 叢集,往下可以進 Ryzen AI 筆電。一次開發、多層部署,正是 CUDA 累積近二十年的優勢結構,AMD 現在用同樣的邏輯追。

ROCm.AI:把最花時間的調校交給代理

CUDA 真正的門檻向來在開發者體驗。近二十年累積的工具鏈、文件與除錯慣例,形成強大的路徑依賴,ROCm 最難補的也是這一段。AMD 這次開放的 ROCm.AI,給了一個屬於這個年代的答案:用 AI 縮短 AI 軟體的開發時間。

ROCm.AI 的三個組成部分:ROCm Hyperloom 自主智慧體系統、AMD Skills 技能庫與 ROCm CLI 命令列介面

ROCm.AI 由三個部分組成:ROCm Hyperloom 自主智慧體系統、AMD Skills 技能庫,以及 ROCm CLI 命令列介面。官方定位是利用 AI 加速 AMD 硬體上的開發速度與效能最佳化,概念上把調校經驗包裝成可重複取用的技能,讓代理執行量測與調整這類繁瑣工作。效能分析正是本版三大重點之一,兩者明顯互為配套:分析工具產生資料,代理消化資料、提出調整,再由工具驗證結果。

對照另一種現實很有意思。許多企業至今對工程師使用生成式 AI 設有層層簽核,日本工程師用 GPT 要跑的簽核流程曾在貼吧引來數萬則圍觀。AMD 把 AI 代理直接放進開發工具鏈,走的是反方向,賭代理帶來的效率增益大於管控成本。這一步若見效,ROCm 與 CUDA 之間最難縮短的體驗差距,就有機會用新的方式補。

誰受影響,接下來盯四個訊號

對開發者,這一版的意義可以直接讀到幾個地方。入門卡進入正式支援,評估 AMD 硬體的試錯成本下降;vLLM、SGLang 的更新讓模型服務化部署更接近主流路徑;HIP 的效能改進則關係到既有 CUDA 程式碼移植後的執行成果,而移植向來是換硬體評估的第一道關卡。

對市場,競爭的計分方式正在慢慢改變。NVIDIA 的優勢核心在軟體生態,ROCm 每一次擴大支援、縮短框架更新的時間差,侵蝕的都是「只能選 CUDA」這個前提。替代選項的真實性提高,採購方的議價空間才存在,這對雲端業者與企業 IT 都是實際的好消息。

四個訊號值得持續追蹤。第一,PyTorch、vLLM 新版發布後,ROCm 支援跟上的時間差是否繼續縮短,這是生態成熟度最直接的指標。第二,支援清單是否往更低階硬體延伸,特別是 Ryzen AI 的 NPU 型號涵蓋範圍。第三,Hyperloom 是否端得出可驗證的調校成果,讓外部檢驗代理的實際貢獻。第四,虛擬化支援的擴充,是否反映為雲端服務上 AMD GPU 選項的增加。

軟體生態的累積沒有單一爆發點,ROCm 走了十年才把版本號推到 10.0.0。這一版的方向值得記住:更新重心放到推理,支援門檻降到 4GB 顯示卡,開發流程引入 AI 代理。幾件事瞄準的是同一羣人,也就是至今因為生態成熟度而留在 CUDA 上的開發者。他們何時開始把 AMD 硬體放進評估清單,會比任何單一版本的更新內容,更能說明這次追趕的真實進度。

#科技#分析#ai推理