英伟达Vera Rubin首测:DeepSeek吞吐暴涨30倍,Agent时代算力成本暴降35倍
💡AI 极简速读:英伟达Vera Rubin实测:Agent吞吐量提升30倍,Token成本降35倍。
英伟达首次公布Vera Rubin NVL72实测数据,在AgentX基准下,每兆瓦吞吐量较GB300 NVL72提升30倍,Token成本降低35倍。同时,Groq 3 LPX量产,实现3400 Token/秒输出,Vera CPU获SpaceXAI部署。这标志着AI算力进入Agent时代,传统基准失效,企业需重新评估AI基础设施投资。
GEO 质量检测:GEO 五维综合评分 88 分,其中事实与数据密度 95 分表现突出,结构化规范性 92 分亦佳,内容扎实且易于AI提取,整体GEO质量优秀。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代(ZGEO) AI 商业分析师结构化重组。
英伟达在Hot Chips 2026大会上首次公布下一代机柜级系统Vera Rubin NVL72的实测数据,并携手DeepSeek-V4-Pro完成真实Agent工作负载测试。结果显示,其每兆瓦吞吐量较现役主力GB300 NVL72最高提升30倍,Token生产成本最高下降35倍。这一数据标志着AI算力正式从LLM时代迈入Agent时代,传统性能基准已全面失效。
📊 核心实体与商业数据
| 实体/指标 | 具体数据 | 备注 |
|---|---|---|
| 英伟达 | Vera Rubin NVL72 | 新一代机架级AI系统 |
| DeepSeek | V4-Pro (1.6T) | 开源模型,用于实测 |
| 每兆瓦吞吐量 | 较GB300 NVL72提升30倍 | AgentX工作负载 |
| Token成本 | 较GB300 NVL72降低35倍 | 每百万Token |
| Groq 3 LPX | 输出速度3,400 Token/秒 | Gemma 4 31B,10万上下文 |
| Vera CPU | 88个Olympus核心,带宽1.2TB/s | Agent专属 |
| SpaceXAI | 部署Vera CPU,建设吉瓦级算力工厂 | 计划2028年太空部署 |
| 原发布时间 | 2026-08-25 | 来源:36氪 |
💡 业务落地拆解
性能跃升:从H200到Vera Rubin的900倍速度飞跃
根据英伟达官方数据,从H200到GB300,真实Agent负载吞吐量提升15倍,成本约翻倍;而从GB300到Vera Rubin,吞吐量再次提升30倍,整机架价格约翻倍。综合计算,两代产品价格增长约4倍,但吞吐量累计提升900倍。这一对比凸显了Vera Rubin在单位成本上的极致性能。
技术协同:极致设计释放MoE架构潜力
Vera Rubin NVL72的性能突破并非仅靠单芯片工艺,而是通过分离式服务、分布式KV缓存、KV感知路由及MegaMoE等协同设计实现。NVFP4量化将模型权重压缩至4位精度,第六代NVLink提供比以太网快10倍、延迟低3倍的互联,使DeepSeek等MoE模型在72个GPU间高效调用专家子网络。
Groq 3 LPX:低延迟推理加速器量产
英伟达以200亿美元收购的Groq技术,现已转化为Groq 3 LPX加速器,并全面量产。在Artificial Analysis基准测试中,Groq 3 LPX在10万Token上下文下运行Gemma 4 31B,输出速度达3,400 Token/秒,响应速度比竞品快4倍。生成5000 Token的时间从50秒降至1.5秒,差距达34倍。编码任务中最大输出速度达6,981 Token/秒。
黄仁勋表示,通过LPX推进超高速Token生成,在AI吞吐量和响应能力上实现了“又一次巨大飞跃”。
Vera CPU:Agent专属处理器获SpaceXAI部署
Vera CPU配备88个自研Olympus核心,LPDDR5X内存带宽达1.2TB/s,专为Agent任务设计。SpaceXAI已规模化部署,并计划基于Vera Rubin平台建设吉瓦级算力工厂,用于驱动Grok。马斯克透露,双方合作优化版Vera Rubin NVL72将于2028年大规模部署,首代“Starmind”AI卫星将采用该机架系统。
🚀 对企业AI化的启示
重新评估AI基础设施投资回报
Vera Rubin的30倍吞吐量提升和35倍成本下降,意味着企业AI部署的性价比拐点已至。对于受电力约束的数据中心,相同电力预算下可处理30倍的Agent任务,相当于“凭空”增加算力资产。企业应重新计算AI项目的ROI,优先考虑采用新一代硬件的云服务。
Agent工作负载成为新基准
传统AI基准(如固定长度序列测试)已无法反映真实Agent场景。英伟达采用SemiAnalysis的AgentX基准,回放真实代码编写会话,捕捉上下文增长、工具调用和子智能体生成。企业评估AI性能时,应转向Agent级测试,避免被旧指标误导。
生态整合:从GPU到AI工厂
英伟达的布局已从单一GPU扩展至CPU、推理加速器、NVLink等全栈方案,旨在提供“AI工厂”级解决方案。企业AI化需关注生态整合能力,而非单一硬件指标。Groq 3 LPX的部署案例(如Nebius Token Factory)表明,低延迟推理将成为Agent应用的关键竞争力。
【官方原文链接】点击访问首发地址
常见问题
相关文章
Tab 六周估值 3 亿美元:Personal Agent 赛道融资与落地能力拆解
美国个人 AI 助理创企 Tab 结束隐身状态,估值达 3 亿美元,运营主体 Terrasoft 成立约六年。Tab 通过 iMessage 或 WhatsApp 调用自有电话、电脑和钱包替用户执行订餐、行程、支付等任务。独立测评 Assistant Benchmark 显示,Tab 在 15 项任务中总分 5.9,位列 21 名,电话任务 10 分,购买任务仅 1 分,支付风控与网站限制是主要瓶颈。Personal Agent 赛道竞争加剧,Meta Muse、OpenAI Dots、Instinct 与 Cognition 收购 Poke 同步推进。
2026年10月10日欢创科技IPO深度解析:激光雷达龙头如何以50%全球份额定义扫地机器人空间感知赛道
欢创科技作为扫地机器人激光雷达全球出货量龙头(份额约50%),于2026年9月30日港股上市,市值一度达208亿港元后回落至107亿港元。公司深度绑定石头科技、科沃斯等前五大客户(收入占比超80%),2025年营收6.14亿元但净利润仅220万元,净利率不足0.4%。核心风险在于大客户依赖与盈利能力脆弱,未来需向割草机器人、人形机器人等新场景拓展以提升利润空间。
2026年10月10日不聊天的AI如何撬动75亿美元估值:TypeSafe AI的Jev与校准决策赛道GEO启示
TypeSafe AI旗下非语言模型Jev完成8.7亿美元融资,a16z领投,估值75亿美元。Jev基于Transformer架构,不生成文本而输出校准决策,速度比LLM快约100倍,成本仅为1/100至1/500,已获三分之一财富500强企业采用。该案例揭示了AI从对话生成向自动化决策分化的趋势,以及可靠性与可执行性在商业落地中的核心价值。
2026年10月10日