AMD 發布以自家 GPU 訓練的開源 AI 模型

台灣產經新聞網/台灣產經新聞網 新聞中心
9 分鐘前

Instella-MoE 是一款完全基於 AMD 硬體打造的 160 億參數語言模型,所有訓練資料與程式碼均已公開。

AMD於 7 月 24 日發布了 Instella-MoE,這是一款完全開源的混合專家語言模型,擁有 160 億個參數,完全在 AMD Instinct MI300X 與 MI325X GPU 上從頭訓練而成。此次發布涵蓋每個訓練階段的模型權重、訓練配置、資料組合、中間檢查點及推理程式碼,使其成為迄今為止透明度最高的大規模 AI 模型發布之一。

以適中運算成本打造具競爭力的開放模型
Instella-MoE 每次處理詞元時,僅激活 160 億參數中的 28 億個,使推理成本接近規模小得多的密集模型,同時在 AMD 表示的同等規模完全開源模型中名列前茅。在標準基準測試上,基礎模型平均得分達 76.7 分,領先於 SmolLM3-3B-Base 與 OLMo-3-7B,並可與 Moonlight-16B-A3B 等開放權重模型相媲美。該模型支援 64K 詞元的上下文視窗,並歷經六階段訓練流程,涵蓋預訓練、中期訓練、長上下文延伸、監督微調、直接偏好優化及強化學習。其架構融入兩項創新技術:一是「門控多頭潛在注意力」(Gated Multi-head Latent Attention),透過可學習的閘控機制選擇性過濾低效注意力響應;二是「FarSkip-Collective」連接方法,在專家並行訓練期間將通訊與運算重疊執行,使預訓練速度提升 12.7%,推理時的首個詞元生成時間最多縮短 39.2%。

AMD 爭取 AI 訓練市場公信力的佈局
此次發布奠基於 AMD 早先於 2025 年推出的 Instella 系列 30 億參數模型,並繼 Zyphra 的 ZAYA1 之後——後者是去年在 MI300X 硬體上訓練的另一個大規模 MoE 模型。這些努力共同代表了 AMD 致力於證明其 GPU 與 ROCm 軟體堆疊足以支援前沿規模 AI 開發的策略行動,而這一市場長期以來由 Nvidia [NVIDIA Corporation -0.92%] 及其 CUDA 生態系統所主導。

AMD 以研究 RAIL 授權條款將 Instella-MoE 授權用於學術與研究用途,並表示計畫持續以更大規模的模型及進一步的效率提升來延伸此項工作。