NVIDIA发布文章,介绍Vera Rubin NVL72系统面向AI代理工作负载的吞吐和能效设计。

NVIDIA援引OpenRouter数据称,代理式AI工作负载消耗的令牌量可达到普通聊天请求的15倍。文章以投资研究类代理为例,说明代理可能连续查询数据库、检索新闻和文件、调用子代理并生成综合结果。
Vera Rubin NVL72的设计重点包括提升令牌生成速度、降低每瓦成本并提高系统利用率。NVIDIA表示,评估代理推理系统需要同时观察吞吐、延迟、功耗和模型质量,不能只比较单个加速器性能。
来源:NVIDIA Blog,发布时间:2026年8月24日。