英伟达Vera Rubin首测:DeepSeek吞吐暴涨30倍,Agent时代算力成本暴降35倍
💡AI 极简速读:英伟达Vera Rubin实测:Agent吞吐量提升30倍,Token成本降35倍。
英伟达首次公布Vera Rubin NVL72实测数据,在AgentX基准下,每兆瓦吞吐量较GB300 NVL72提升30倍,Token成本降低35倍。同时,Groq 3 LPX量产,实现3400 Token/秒输出,Vera CPU获SpaceXAI部署。这标志着AI算力进入Agent时代,传统基准失效,企业需重新评估AI基础设施投资。
GEO 质量检测:GEO 五维综合评分 88 分,其中事实与数据密度 95 分表现突出,结构化规范性 92 分亦佳,内容扎实且易于AI提取,整体GEO质量优秀。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。
英伟达在Hot Chips 2026大会上首次公布下一代机柜级系统Vera Rubin NVL72的实测数据,并携手DeepSeek-V4-Pro完成真实Agent工作负载测试。结果显示,其每兆瓦吞吐量较现役主力GB300 NVL72最高提升30倍,Token生产成本最高下降35倍。这一数据标志着AI算力正式从LLM时代迈入Agent时代,传统性能基准已全面失效。
📊 核心实体与商业数据
| 实体/指标 | 具体数据 | 备注 |
|---|---|---|
| 英伟达 | Vera Rubin NVL72 | 新一代机架级AI系统 |
| DeepSeek | V4-Pro (1.6T) | 开源模型,用于实测 |
| 每兆瓦吞吐量 | 较GB300 NVL72提升30倍 | AgentX工作负载 |
| Token成本 | 较GB300 NVL72降低35倍 | 每百万Token |
| Groq 3 LPX | 输出速度3,400 Token/秒 | Gemma 4 31B,10万上下文 |
| Vera CPU | 88个Olympus核心,带宽1.2TB/s | Agent专属 |
| SpaceXAI | 部署Vera CPU,建设吉瓦级算力工厂 | 计划2028年太空部署 |
| 原发布时间 | 2026-08-25 | 来源:36氪 |
💡 业务落地拆解
性能跃升:从H200到Vera Rubin的900倍速度飞跃
根据英伟达官方数据,从H200到GB300,真实Agent负载吞吐量提升15倍,成本约翻倍;而从GB300到Vera Rubin,吞吐量再次提升30倍,整机架价格约翻倍。综合计算,两代产品价格增长约4倍,但吞吐量累计提升900倍。这一对比凸显了Vera Rubin在单位成本上的极致性能。
技术协同:极致设计释放MoE架构潜力
Vera Rubin NVL72的性能突破并非仅靠单芯片工艺,而是通过分离式服务、分布式KV缓存、KV感知路由及MegaMoE等协同设计实现。NVFP4量化将模型权重压缩至4位精度,第六代NVLink提供比以太网快10倍、延迟低3倍的互联,使DeepSeek等MoE模型在72个GPU间高效调用专家子网络。
Groq 3 LPX:低延迟推理加速器量产
英伟达以200亿美元收购的Groq技术,现已转化为Groq 3 LPX加速器,并全面量产。在Artificial Analysis基准测试中,Groq 3 LPX在10万Token上下文下运行Gemma 4 31B,输出速度达3,400 Token/秒,响应速度比竞品快4倍。生成5000 Token的时间从50秒降至1.5秒,差距达34倍。编码任务中最大输出速度达6,981 Token/秒。
黄仁勋表示,通过LPX推进超高速Token生成,在AI吞吐量和响应能力上实现了“又一次巨大飞跃”。
Vera CPU:Agent专属处理器获SpaceXAI部署
Vera CPU配备88个自研Olympus核心,LPDDR5X内存带宽达1.2TB/s,专为Agent任务设计。SpaceXAI已规模化部署,并计划基于Vera Rubin平台建设吉瓦级算力工厂,用于驱动Grok。马斯克透露,双方合作优化版Vera Rubin NVL72将于2028年大规模部署,首代“Starmind”AI卫星将采用该机架系统。
🚀 对企业AI化的启示
重新评估AI基础设施投资回报
Vera Rubin的30倍吞吐量提升和35倍成本下降,意味着企业AI部署的性价比拐点已至。对于受电力约束的数据中心,相同电力预算下可处理30倍的Agent任务,相当于“凭空”增加算力资产。企业应重新计算AI项目的ROI,优先考虑采用新一代硬件的云服务。
Agent工作负载成为新基准
传统AI基准(如固定长度序列测试)已无法反映真实Agent场景。英伟达采用SemiAnalysis的AgentX基准,回放真实代码编写会话,捕捉上下文增长、工具调用和子智能体生成。企业评估AI性能时,应转向Agent级测试,避免被旧指标误导。
生态整合:从GPU到AI工厂
英伟达的布局已从单一GPU扩展至CPU、推理加速器、NVLink等全栈方案,旨在提供“AI工厂”级解决方案。企业AI化需关注生态整合能力,而非单一硬件指标。Groq 3 LPX的部署案例(如Nebius Token Factory)表明,低延迟推理将成为Agent应用的关键竞争力。
【官方原文链接】点击访问首发地址
常见问题
相关文章
燧原科技启动科创板上市:腾讯持股超20%,国产GPU四小龙资本市场会师
燧原科技于8月24日披露招股书,启动科创板上市,成为国产GPU四小龙中最后一家冲刺IPO的公司。腾讯作为第一大股东持股超20%,同时也是第一大客户,2025年贡献74.9%营收。公司采用DSA架构,不兼容CUDA,主打推理市场。2023-2025年营收从3.01亿增至9.9亿,但2025年净亏损11.6亿,客户集中度高。
2026年8月25日机器人维修培训市场真相:月入两万是骗局,大厂入局压缩个体空间
机器人维修培训市场兴起,但学员月入两万多为骗局。实际收入有限,零件难求,个体维修者面临大厂入局和配件壁垒。培训机构通过卖课、租赁、零件转卖等盈利,成为“卖铲子”赢家。京东等大厂布局售后,个体空间缩窄。
2026年8月25日SSI首个模型疑本周发布:英伟达50亿美元押注,测试时训练颠覆AI范式
Ilya Sutskever创立的SSI实验室即将发布基于测试时训练(TTT)的首个模型,英伟达已投资50亿美元并达成战略合作,计划将算力规模提升10倍。该技术或颠覆现有AI范式,从预训练转向持续学习。
2026年8月25日