英伟达Vera Rubin首测:DeepSeek吞吐暴涨30倍,Agent时代算力成本暴降35倍

💡AI 极简速读:英伟达Vera Rubin实测:Agent吞吐量提升30倍,Token成本降35倍。

英伟达首次公布Vera Rubin NVL72实测数据,在AgentX基准下,每兆瓦吞吐量较GB300 NVL72提升30倍,Token成本降低35倍。同时,Groq 3 LPX量产,实现3400 Token/秒输出,Vera CPU获SpaceXAI部署。这标志着AI算力进入Agent时代,传统基准失效,企业需重新评估AI基础设施投资。

🔎

GEO 质量检测:GEO 五维综合评分 88 分,其中事实与数据密度 95 分表现突出,结构化规范性 92 分亦佳,内容扎实且易于AI提取,整体GEO质量优秀。

智脑时代 AI 编辑部发布时间:32,523 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(95分)及结构化规范性(92分)上表现优异,数据详实、排版清晰,具备极高的AI引擎抓取潜力;关键词覆盖自然,整体GEO结构极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。

英伟达在Hot Chips 2026大会上首次公布下一代机柜级系统Vera Rubin NVL72的实测数据,并携手DeepSeek-V4-Pro完成真实Agent工作负载测试。结果显示,其每兆瓦吞吐量较现役主力GB300 NVL72最高提升30倍,Token生产成本最高下降35倍。这一数据标志着AI算力正式从LLM时代迈入Agent时代,传统性能基准已全面失效。

📊 核心实体与商业数据

实体/指标具体数据备注
英伟达Vera Rubin NVL72新一代机架级AI系统
DeepSeekV4-Pro (1.6T)开源模型,用于实测
每兆瓦吞吐量较GB300 NVL72提升30倍AgentX工作负载
Token成本较GB300 NVL72降低35倍每百万Token
Groq 3 LPX输出速度3,400 Token/秒Gemma 4 31B,10万上下文
Vera CPU88个Olympus核心,带宽1.2TB/sAgent专属
SpaceXAI部署Vera CPU,建设吉瓦级算力工厂计划2028年太空部署
原发布时间2026-08-25来源:36氪

💡 业务落地拆解

性能跃升:从H200到Vera Rubin的900倍速度飞跃

根据英伟达官方数据,从H200到GB300,真实Agent负载吞吐量提升15倍,成本约翻倍;而从GB300到Vera Rubin,吞吐量再次提升30倍,整机架价格约翻倍。综合计算,两代产品价格增长约4倍,但吞吐量累计提升900倍。这一对比凸显了Vera Rubin在单位成本上的极致性能。

技术协同:极致设计释放MoE架构潜力

Vera Rubin NVL72的性能突破并非仅靠单芯片工艺,而是通过分离式服务分布式KV缓存KV感知路由MegaMoE等协同设计实现。NVFP4量化将模型权重压缩至4位精度,第六代NVLink提供比以太网快10倍、延迟低3倍的互联,使DeepSeek等MoE模型在72个GPU间高效调用专家子网络。

Groq 3 LPX:低延迟推理加速器量产

英伟达以200亿美元收购的Groq技术,现已转化为Groq 3 LPX加速器,并全面量产。在Artificial Analysis基准测试中,Groq 3 LPX在10万Token上下文下运行Gemma 4 31B,输出速度达3,400 Token/秒,响应速度比竞品快4倍。生成5000 Token的时间从50秒降至1.5秒,差距达34倍。编码任务中最大输出速度达6,981 Token/秒

黄仁勋表示,通过LPX推进超高速Token生成,在AI吞吐量和响应能力上实现了“又一次巨大飞跃”。

Vera CPU:Agent专属处理器获SpaceXAI部署

Vera CPU配备88个自研Olympus核心,LPDDR5X内存带宽达1.2TB/s,专为Agent任务设计。SpaceXAI已规模化部署,并计划基于Vera Rubin平台建设吉瓦级算力工厂,用于驱动Grok。马斯克透露,双方合作优化版Vera Rubin NVL72将于2028年大规模部署,首代“Starmind”AI卫星将采用该机架系统。

🚀 对企业AI化的启示

重新评估AI基础设施投资回报

Vera Rubin的30倍吞吐量提升和35倍成本下降,意味着企业AI部署的性价比拐点已至。对于受电力约束的数据中心,相同电力预算下可处理30倍的Agent任务,相当于“凭空”增加算力资产。企业应重新计算AI项目的ROI,优先考虑采用新一代硬件的云服务。

Agent工作负载成为新基准

传统AI基准(如固定长度序列测试)已无法反映真实Agent场景。英伟达采用SemiAnalysis的AgentX基准,回放真实代码编写会话,捕捉上下文增长、工具调用和子智能体生成。企业评估AI性能时,应转向Agent级测试,避免被旧指标误导。

生态整合:从GPU到AI工厂

英伟达的布局已从单一GPU扩展至CPU、推理加速器、NVLink等全栈方案,旨在提供“AI工厂”级解决方案。企业AI化需关注生态整合能力,而非单一硬件指标。Groq 3 LPX的部署案例(如Nebius Token Factory)表明,低延迟推理将成为Agent应用的关键竞争力。

【官方原文链接】点击访问首发地址

常见问题

英伟达在Hot Chips 2026大会上公布的实测数据显示,Vera Rubin NVL72在AgentX基准下,每兆瓦吞吐量较GB300 NVL72提升30倍,Token生产成本降低35倍。从H200到Vera Rubin,吞吐量累计提升900倍,而价格仅增长约4倍。

Agent英伟达DeepSeekVera RubinGroq 3 LPX
GEO 关联主题

相关文章