英伟达双线推进:Blackwell软件优化持续释放性能,Rubin平台加速落地
摘要
Blackwell平台能效跃升:三个月吞吐量提升4倍 英伟达正通过密集的软件栈迭代,显著延长Blackwell平台生命周期。针对GB200 NVL72系统,在运行DeepSeek R1 0528模型(1K输入/1K输出)时,其每兆瓦算力吞吐量(TPS/MW)...
Blackwell平台能效跃升:三个月吞吐量提升4倍
英伟达正通过密集的软件栈迭代,显著延长Blackwell平台生命周期。针对GB200 NVL72系统,在运行DeepSeek R1 0528模型(1K输入/1K输出)时,其每兆瓦算力吞吐量(TPS/MW)在三个月内实现4倍增长。
38项优化驱动,90%成果可跨模型复用
这一提升源于四个月内完成的38项重大软件与系统级优化。所有方案均经过超25万次模拟配置筛选,并依托累计140万GPU小时的真实负载验证。尤为关键的是,其中超过90%的优化具备通用性,可直接迁移至其他主流大模型,无需硬件变更即可生效。
GB300训练性能刷新纪录,六个月内再提1.5倍
在AI训练维度,GB300 NVL72持续突破性能边界。256卡规模下,基于Megatron Core框架执行DeepSeek-V3 671B预训练任务,单GPU实测吞吐达1648 TFLOPs,较GB200的606 TFLOPs提升约3倍,创同类任务历史最高值。该指标自2025年11月起持续演进,六个月内累计提升1.5倍。
主流框架深度适配,PyTorch与JAX收益显著
在PyTorch生态中,通过TorchTitan训练栈优化,GB300对DeepSeek-V3 671B的训练性能从199 TFLOPs/GPU跃升至1197 TFLOPs/GPU,提升6倍;JAX框架下表现更为突出——每GPU Token吞吐从2026年1月的418 Tokens/s增至7月的4082 Tokens/s,对应1025 TFLOPs/GPU,增幅近10倍。
扩展效率逼近理论极限,800 Gb/s互联成关键支撑
在256至1024卡的大规模训练场景中,GB300 NVL72在Megatron Core、TorchTitan与JAX三大框架下,扩展效率分别达98.5%、97%与97%,已接近理论上限。这一表现高度依赖NVL72机架内置的800 Gb/s Scale-Out网络芯片,其低延迟、高带宽特性大幅压缩跨节点通信开销,成为多机协同效率的核心保障。
Rubin平台进入规模化部署,Blackwell优化并行深化
下一代Vera Rubin架构已启动全球交付。在同等150MW功耗约束下,Vera Rubin NVL72 Token吞吐量达800,000 Tokens/s,相较GB200 NVL72的80,000 Tokens/s提升约10倍。与此同时,英伟达延续Hopper世代策略——新旧平台并行推进,以持续软件更新激活存量硬件潜力。此举既延长客户投资回报周期,也不断加固其AI基础设施层的软件护城河。
评论 (5)
英伟达这优化能力挺强啊,软件迭代让平台性能大幅提升,新旧平台并行策略也不错,能延长回报周期。
GB300训练性能提升太猛了,六个月就提1.5倍,主流框架适配效果也挺好。
Blackwell平台能效跃升厉害,三个月吞吐量提升4倍,而且超90%优化能跨模型用。
Vera Rubin架构交付,吞吐量提升约10倍,英伟达在AI领域优势更明显了。
这扩展效率都逼近理论极限,800 Gb/s互联芯片作用很大,挺厉害的。