輝達最新 Vera Rubin NVL72 的輸送量較 GB300 NVL72 提升高達 3.7 倍,這意味著其每token成本要低於GB300。(攝影/鄭國強)
人工智慧晶片龍頭輝達17日公布首次 MLPerf Inference 預覽測試結果中,NVIDIA Vera Rubin NVL72 的輸送量較 GB300 NVL72 提升高達 3.7 倍。
一項橫跨四座 GB300 NVL72 機架、共使用 288 顆GPU的測試配置,達成 99% 的擴展效率,其輸送量相較單一機架基準近乎呈現線性成長。而NVIDIA 在 MLPerf Inference v6.1 提交結果中的軟體最佳化,相較於 v6.0 版本,效能最高提升 1.6 倍。v6.1 提交截止後,最佳化工作仍持續進行,進一步帶來效能提升。
這項效能代表每座 Vera Rubin NVL72 機架所產生的詞元數量、服務的使用者數量,以及創造的營收,均遠高於 GB300 NVL72 機架,同時還能降低每詞元token成本。
每座 Vera Rubin NVL72 機架所產生的詞元token數量、服務的使用者數量,以及創造的營收,均遠高於 GB300 NVL72 機架,同時還能降低每詞元成本。(圖片來源/輝達提供)
這些成果反映硬體與軟體的全端協同設計。Vera Rubin 增強的 Tensor Core 與 Transformer Engine 可加速推論的預填充與解碼階段,而 NVFP4 精度則能降低模型權重、注意力與 KV 快取的記憶體占用量,在幾乎不犧牲輸出品質的情況下提高輸送量。
Vera Rubin 提交結果大量採用分離式服務,將預填充與解碼分開處理,並搭配大規模專家平行化,讓驅動 DeepSeek-R1 與 Qwen3-VL 等模型的混合專家層達到最高效率。
NVL72 垂直擴展網域採用第六代 NVIDIA NVLink 與 NVLink Switch,相較現成乙太網路可提供高達 10 倍的封包速率,並將延遲降低 3 倍,建立互連基礎,讓這些技術能在機架規模下有效運作。
這項協同設計更延伸至 NVIDIA 合作夥伴生態系。Nebius 同樣提交 Vera Rubin NVL72 預覽測試結果,並展現出卓越的效能。
能夠進行多步驟推理、規劃與行動的 AI 代理,正在重塑推論效能的衡量方式。在 SemiAnalysis AgentX 等旨在反映這項轉變的基準測試中,Vera Rubin NVL72 於預覽測試的效能達 GB300 NVL72 的 30 倍。此外,即將推出的 MLPerf Endpoints 基準測試將為代理型推論工作負載帶來標準化的衡量方式,涵蓋傳統輸送量基準測試未能反映的面向。
更多信傳媒報導
美國眾院通過法案制裁俄羅斯 「中印土」買俄能源恐被課100%關稅
晚期子宮內膜癌不只靠化療 健保8月給付免疫治療、患者每年省182萬
選前央行宣布鬆綁房市信用管制 楊金龍:央行也不是硬梆梆