根据英伟达官方博客,与GB300 NVL72相比,Vera Rubin NVL72系统在处理AI代理工作负载时,每兆瓦的吞吐量提高了30倍,并且每百万Token的成本降低了35倍。这一性能提升对于电力受限的AI工厂至关重要,意味着在相同能耗下能完成更多代理工作,并显著降低运营成本。英伟达通过SemiAnalysis AgentX工作负载测量了这些推理吞吐量数据,该工作负载包含真实的代理式编码会话,保留了实际的上下文增长、工具调用和子代理生成。