엔비디아 공식 블로그에 따르면, Vera Rubin NVL72 시스템은 GB300 NVL72와 비교하여 AI 에이전트 워크로드를 처리할 때 메가와트당 처리량이 30배 증가했으며, 백만 토큰당 비용은 35배 감소했습니다. 이러한 성능 향상은 전력 제약이 있는 AI 공장에 매우 중요하며, 동일한 에너지 소비로 더 많은 에이전트 작업을 완료하고 운영 비용을 크게 절감할 수 있음을 의미합니다. 엔비디아는 실제 컨텍스트 증가, 도구 호출 및 하위 에이전트 생성을 포함하는 실제 에이전트 기반 코딩 세션으로 구성된 SemiAnalysis AgentX 워크로드를 통해 이러한 추론 처리량 데이터를 측정했습니다.