免费软件、软件分享、系统优化、AI工具
科技皮皮虾 > 科技要闻 > NVIDIA公布Vera Rubin NVL72在MLPerf推理6.1预览成绩

NVIDIA公布Vera Rubin NVL72在MLPerf推理6.1预览成绩

NVIDIA发布文章介绍Vera Rubin NVL72系统在MLPerf Inference v6.1中的首次预览提交,披露其在部分大模型推理场景中的吞吐量和扩展效率。

NVIDIA Vera Rubin NVL72推理性能原创配图

NVIDIA称,Vera Rubin NVL72在Qwen3-VL的离线、服务器和交互式场景中,吞吐量最高达到GB300 NVL72的3.7倍;在DeepSeek-R1测试中,吞吐量最高提升至2.5倍。相关结果使用vLLM与NVIDIA Dynamo开源推理框架,另有部分提交使用TensorRT-LLM库。数据来自MLPerf Inference v6.1封闭组,结果于2026年9月16日从MLCommons网站取得。

文章还介绍GB300 NVL72的扩展测试:四个机架共288块GPU在DeepSeek-R1离线场景中达到99%的扩展效率,吞吐量随机架数量增加接近线性增长。NVIDIA表示,持续的软件优化使其v6.1提交成绩较v6.0最高提升1.6倍,提交后仍在继续进行优化。

硬件与软件协同部分包括增强型Tensor Core和Transformer Engine、NVFP4精度,以及将预填充与解码分离的服务架构和大规模专家并行。Vera Rubin NVL72使用第六代NVLink与NVLink Switch作为机架内互连,NVIDIA称其数据包速率较通用以太网高10倍、延迟低至三分之一。文章同时提到,在SemiAnalysis AgentX预览测试中,Vera Rubin NVL72的表现达到GB300 NVL72的30倍。

来源:NVIDIA Blog,发布时间:2026年9月16日。