NVIDIA Reports Vera Rubin Real-Chip Results: Up to 30x Agent Throughput per MW vs GB300
NVIDIA released first real-chip performance results for Vera Rubin, showing up to 30x higher agent throughput per megawatt and up to 35x lower token costs versus the GB300 NVL72, based on SemiAnalysis' AgentX workload. Separately, SpaceXAI announced plans to deploy NVIDIA Vera CPUs and expand Grok's AI infrastructure on Vera Rubin, including exploring orbital computing environments.
Coverage timeline
机器之心机器之心
过去几年,AI 基础设施的竞争核心是 GPU。更大的模型、更高的参数规模、更强的推理能力,都推动着数据中心不断堆叠 GPU。 但随着 AI Agent 开始执行越来越复杂的任务,新的计算需求出现。一个 Agent 不再只是完成一次模型推理,它需要持续规划任务、调用工具、执行代码、处理数据,并在多个步骤之间保持上下文。 根据 NVIDIA 引用的 OpenRouter 数据,真实 AI 流量中平均 Prompt 长度已增长约 4 倍,单次 Agentic 请求消耗的 token 数量最高可达普通聊天请求的 15 倍。这意味着,AI 系统需要的不只是更强的模型,也需要一套专门支撑 Agent 运行的计算架构。 就在今天早上,NVIDIA 首次公布了基于真实芯片的 Vera Rubin 性能测试结果。 在针对 Agent 工作负载的测试中, Vera Rubin 相比上一代 GB300 NVL72 最高实现每兆瓦吞吐提升 30 倍,并将 token 成本最高降低 35 倍 。 就在同一时间, SpaceXAI 宣布将部署 NVIDIA Vera CPU ,并计划基于 Vera Rubin 架构扩展支撑 Grok 的 AI 基础设施,进一步探索将优化后的 Vera Rubin NVL72 系统部署到轨道计算环境。 从 Agent 性能测试,到 SpaceX 的轨道计算探索,NVIDIA 展示了一个新的方向:未来 AI 竞争的关键,不只是模型能力,还有支撑 Agent 持续行动的计算基础设施。 Vera Rubin 首次面向 Agent 工作负载测试 过去的大模型性能测试,更多关注固定输入长度下的推理速度。但 AI Agent 改变了这一标准。衡量 Agent 基础设施能力,不能再依赖传统的固定 Prompt 测试,而需要接近真实生产环境的工作负载。这也是 NVIDIA 此次测试的重点。 NVIDIA 采用 SemiAnalysis 的 AgentX 工作负载 ,对 Vera Rubin NVL72 的 Agent 性能进行评估。AgentX 是一个面向 Agentic Coding Inference(智能体代码推理)的基准测试,通过回放真实生产风格的 Agent 会话,评估计算系统处理真实 Agent 请求的能力。 智能体(Agent)会话会产生动态变化的推理序列。 与传
