风险提示:理性看待区块链,提高风险意识!
USDT USDT $1.00 0.01%
XRP XRP $1.43310000 0.19%
BNB BNB $637.54000000 0.02%
USDC USDC $0.99963000 0.01%
SOL SOL $86.49000000 0.99%
TRX TRX $0.32360000 1.25%
BTC BTC $67,234.00 2.34%
ETH ETH $3,456.00 1.23%
CoinMeta Skill
限时免费体验

让 AI 更快获取有效、准确、可行动的币圈全景信息

英伟达双线推进:Blackwell软件优化持续释放性能,Rubin平台加速落地

摘要

Blackwell平台能效跃升:三个月吞吐量提升4倍 英伟达正通过密集的软件栈迭代,显著延长Blackwell平台生命周期。针对GB200 NVL72系统,在运行DeepSeek R1 0528模型(1K输入/1K输出)时,其每兆瓦算力吞吐量(TPS/MW)...

英伟达双线推进:Blackwell软件优化持续释放性能,Rubin平台加速落地

Blackwell平台能效跃升:三个月吞吐量提升4倍

英伟达正通过密集的软件栈迭代,显著延长Blackwell平台生命周期。针对GB200 NVL72系统,在运行DeepSeek R1 0528模型(1K输入/1K输出)时,其每兆瓦算力吞吐量(TPS/MW)在三个月内实现4倍增长。

38项优化驱动,90%成果可跨模型复用

这一提升源于四个月内完成的38项重大软件与系统级优化。所有方案均经过超25万次模拟配置筛选,并依托累计140万GPU小时的真实负载验证。尤为关键的是,其中超过90%的优化具备通用性,可直接迁移至其他主流大模型,无需硬件变更即可生效。

GB300训练性能刷新纪录,六个月内再提1.5倍

在AI训练维度,GB300 NVL72持续突破性能边界。256卡规模下,基于Megatron Core框架执行DeepSeek-V3 671B预训练任务,单GPU实测吞吐达1648 TFLOPs,较GB200的606 TFLOPs提升约3倍,创同类任务历史最高值。该指标自2025年11月起持续演进,六个月内累计提升1.5倍。

主流框架深度适配,PyTorch与JAX收益显著

在PyTorch生态中,通过TorchTitan训练栈优化,GB300对DeepSeek-V3 671B的训练性能从199 TFLOPs/GPU跃升至1197 TFLOPs/GPU,提升6倍;JAX框架下表现更为突出——每GPU Token吞吐从2026年1月的418 Tokens/s增至7月的4082 Tokens/s,对应1025 TFLOPs/GPU,增幅近10倍。

扩展效率逼近理论极限,800 Gb/s互联成关键支撑

在256至1024卡的大规模训练场景中,GB300 NVL72在Megatron Core、TorchTitan与JAX三大框架下,扩展效率分别达98.5%、97%与97%,已接近理论上限。这一表现高度依赖NVL72机架内置的800 Gb/s Scale-Out网络芯片,其低延迟、高带宽特性大幅压缩跨节点通信开销,成为多机协同效率的核心保障。

Rubin平台进入规模化部署,Blackwell优化并行深化

下一代Vera Rubin架构已启动全球交付。在同等150MW功耗约束下,Vera Rubin NVL72 Token吞吐量达800,000 Tokens/s,相较GB200 NVL72的80,000 Tokens/s提升约10倍。与此同时,英伟达延续Hopper世代策略——新旧平台并行推进,以持续软件更新激活存量硬件潜力。此举既延长客户投资回报周期,也不断加固其AI基础设施层的软件护城河。

评论 (5)

登录 后即可发表评论
景隆
景隆 1周前

英伟达这优化能力挺强啊,软件迭代让平台性能大幅提升,新旧平台并行策略也不错,能延长回报周期。

0 回复
一次就好

GB300训练性能提升太猛了,六个月就提1.5倍,主流框架适配效果也挺好。

0 回复
DNF跨6柔道化骨《菜鸟基金版》

Blackwell平台能效跃升厉害,三个月吞吐量提升4倍,而且超90%优化能跨模型用。

0 回复
高山上的花环

Vera Rubin架构交付,吞吐量提升约10倍,英伟达在AI领域优势更明显了。

0 回复
我知我无知

这扩展效率都逼近理论极限,800 Gb/s互联芯片作用很大,挺厉害的。

0 回复
更多