英伟达Vera Rubin实测数据出炉:Token吞吐量提升10倍,千兆级AI工厂加速落地
从纸面参数到实测数据,Vera Rubin交出首份成绩单
7月21日,英伟达正式公布了Vera Rubin平台的首批第三方实测数据。作为Blackwell的继任者,Vera Rubin承载着英伟达对”千兆级AI工厂”的全部野心——而CoreWeave的测试结果表明,这次升级远比想象中猛烈。
据英伟达官方披露,CoreWeave在Vera Rubin NVL72系统上的测试显示,相比上代Grace Blackwell NVL72,单位功耗下的Token吞吐量提升了整整10倍。这个数字意味着什么?对于客户来说,同样的电费账单可以跑出10倍的推理产出;对于需要训练万亿参数模型的AI实验室来说,训练周期将从数月压缩到数周。
云巨头已集体押注
目前,CoreWeave、谷歌云、微软Azure和甲骨文云四家顶级云服务商已率先部署Vera Rubin NVL72系统。英伟达表示该平台正在全球范围内扩大部署规模,覆盖从超大规模云计算到企业私有化部署的多种场景。
NVL72的命名暗示了其核心架构:72颗Vera Rubin GPU通过NVLink高速互联组成单一计算节点,形成一个逻辑上的”超级GPU”。这种设计对于大模型推理场景尤其关键——模型的KV Cache如果分散在多张卡之间通信延迟过高,推理速度会急剧下降,而NVL72通过全互联拓扑从根本上解决了这一问题。
千兆级AI工厂的战略意义
“千兆级AI工厂”(Gigawatt-class AI Factory)是英伟达在2025年提出的概念,指耗电量达到1吉瓦级别的AI数据中心。随着GPT-5.6和Gemini 4等下一代模型对算力需求呈指数级增长,单个数据中心必须从百兆瓦级向吉瓦级跃迁。
Vera Rubin的核心价值在于:它让这种跃迁在经济上变得可行。10倍的能效提升意味着,建设一个吉瓦级AI工厂的实际算力产出相当于上一代的10吉瓦规模——如果不提升能效,仅靠堆服务器建吉瓦工厂,电费账单就能让企业破产。
对AI创业生态的连锁反应
Vera Rubin的10倍能效提升,不仅是一个技术指标,更将重塑AI创业的成本结构。目前推理成本已经是AI应用运营支出中的最大单一项目——以每月10亿Token调用量计算,在上一代硬件上可能需要数百台服务器,而Vera Rubin将这一规模压缩到数十台。
这意味着什么?AI应用的盈亏平衡点将大幅降低。过去需要A轮融资才能烧得起的推理集群,现在天使轮就能跑起来。这对于依赖大模型API做二次开发的团队来说,是一个实质性的利好。
但挑战依然存在。
高性能背后是高昂的采购成本。Vera Rubin系统的单价预计远超Blackwell,且供应链对先进封装(CoWoS-L)和HBM4内存的依赖意味着短期内产能爬坡仍是瓶颈。对于中小型AI公司而言,与其自建Rubin集群,通过云服务商按需使用可能是更现实的选择。
尽管如此,从Blackwell到Rubin的跨越已经清晰可见。AI基础设施的迭代速度没有放缓,反而在加速。
👇 关注LC智趣厅,持续追踪AI硬核科技
