Bitget App
Trading inteligente
Comprar criptoMercadosTradingFuturosRendaCentralMais
À medida que Rubin é altamente aguardado, Nvidia continua otimizando Blackwell e a eficiência energética do GB200 quadruplica em três meses

À medida que Rubin é altamente aguardado, Nvidia continua otimizando Blackwell e a eficiência energética do GB200 quadruplica em três meses

华尔街见闻华尔街见闻2026/07/22 08:27
Mostrar original
Por:华尔街见闻

A Nvidia está estendendo o ciclo de vida da plataforma Blackwell por meio de otimizações contínuas de sua pilha de software, ao mesmo tempo em que prepara terreno para a implantação em larga escala da próxima geração da arquitetura Rubin.

Com a aceleração do lançamento da nova plataforma Rubin, a Nvidia revelou que, em apenas três meses, quadruplicou a eficiência do GB200 NVL72 em throughput por megawatt (TPS/MW) executando o modelo DeepSeek R1 0528. Esse resultado é fruto de 38 otimizações importantes realizadas em quatro meses, apoiadas por mais de 250 mil testes de configuração simulada e um total de 1,4 milhão de horas de validação otimizando GPUs.

Paralelamente, a plataforma GB300 “Blackwell Ultra” continua a quebrar recordes em benchmarks de treinamento de IA. Com 256 GPUs, o GB300 NVL72 atingiu um recorde histórico de 1648 TFLOPs por GPU na tarefa de pré-treinamento do DeepSeek-V3 671B, aproximadamente três vezes mais que os 606 TFLOPs do GB200, desempenho esse que, nos últimos seis meses, já aumentou 1,5 vez.

A eficiência energética do GB200 salta significativamente, otimizações cobrem mais de 90% dos modelos

Segundo a Nvidia, a série de otimizações direcionadas à plataforma GB200 NVL72 permitiu que, ao executar DeepSeek R1 0528 (configuração 1K entrada/1K saída), o throughput por megawatt quadruplicasse em apenas três meses.

À medida que Rubin é altamente aguardado, Nvidia continua otimizando Blackwell e a eficiência energética do GB200 quadruplica em três meses image 0

A base desse salto foi a realização, em quatro meses, de 38 grandes iterações de otimização. Essas melhorias passaram por mais de 250 mil testes de configuração simulada e acumularam 1,4 milhão de horas de validação prática em GPUs. A Nvidia destacou que mais de 90% dessas otimizações podem ser reaproveitadas em outros modelos de sua linha de produtos de IA, não sendo customizadas para uma única tarefa.

Isso significa que clientes de data centers existentes podem obter ganhos expressivos de eficiência energética apenas atualizando o software, sem trocar o hardware — um benefício direto para gigantes da nuvem e corporações altamente sensíveis ao custo computacional.

GB300 bate novo recorde de treinamento, ganho de performance de 1,5 vez em seis meses

No treino de IA, o GB300 NVL72 também demonstra desempenho robusto. Com 256 GPUs, utilizando o framework Megatron Core para pré-treinar o modelo DeepSeek-V3 671B, o GB300 NVL72 atingiu throughput de 1648 TFLOPs por GPU, saltando de 606 TFLOPs no GB200 para quase três vezes mais, estabelecendo um novo recorde global para essa tarefa.

À medida que Rubin é altamente aguardado, Nvidia continua otimizando Blackwell e a eficiência energética do GB200 quadruplica em três meses image 1

É importante destacar que esse resultado não se trata de um limite fixo de hardware. Sob o framework Megatron Core, o GB300 NVL72 passou de 1088 TFLOPs/GPU em novembro de 2025 para 1648 TFLOPs/GPU em junho de 2026 — um ganho acumulado de aproximadamente 1,5 vez em seis meses.

À medida que Rubin é altamente aguardado, Nvidia continua otimizando Blackwell e a eficiência energética do GB200 quadruplica em três meses image 2

Na otimização conjunta com frameworks de IA populares, a colaboração da Nvidia com as comunidades PyTorch e JAX também trouxe ganhos expressivos. Com TorchTitan (stack de treinamento nativo PyTorch), o desempenho do GB300 NVL72 no treinamento do DeepSeek-V3 671B avançou seis vezes em relação à configuração base não otimizada, aumentando de 199 TFLOPs/GPU para 1197 TFLOPs/GPU. No JAX, o avanço foi ainda mais impressionante: até julho de 2026, o throughput por GPU atingiu 4082 Tokens/s, correspondendo a 1025 TFLOPs/GPU, cerca de 10 vezes maior do que os 418 Tokens/s de janeiro de 2026.

À medida que Rubin é altamente aguardado, Nvidia continua otimizando Blackwell e a eficiência energética do GB200 quadruplica em três meses image 3

Eficiência de escalonamento próxima ao limite teórico, rede de 800 Gb/s é fundamental

A eficiência de escalonamento em cenários de treinamento em larga escala sempre foi um dos principais parâmetros para medir a utilidade da infraestrutura de IA. De acordo com a Nvidia, no intervalo de 256 a 1024 GPUs, o GB300 NVL72 manteve eficiência próxima ao limite teórico nos três principais frameworks: 98,5% com Megatron Core e 97% tanto com TorchTitan quanto JAX.

A Nvidia atribui esse desempenho à rede Scale-Out de 800 Gb/s integrada nos racks do NVL72. A interconexão de alta velocidade determina diretamente o custo de comunicação em treinamentos multi-nó e, portanto, impacta a eficiência global de escalonamento, tornando essa infraestrutura de rede o elemento-chave por trás do alto desempenho cross-framework observado.

À medida que Rubin é altamente aguardado, Nvidia continua otimizando Blackwell e a eficiência energética do GB200 quadruplica em três meses image 4

Plataforma Rubin acelera implantação, otimizações Blackwell continuam em andamento

No contexto deste anúncio de avanços, a próxima geração da plataforma Vera Rubin da Nvidia já iniciou implantação global. Segundo relatos, o Vera Rubin NVL72 multiplicou por cerca de 10 vezes o throughput de tokens em relação ao Blackwell: o GB200 NVL72 processa cerca de 80.000 tokens/s, enquanto o Vera Rubin NVL72 pode chegar a 800.000 tokens/s sob o mesmo consumo de 150MW.

No entanto, a plataforma Blackwell já está instalada em inúmeros data centers ao redor do mundo, e a estratégia da Nvidia segue a da geração Hopper: além de lançar a nova plataforma, investe em extrair ainda mais potencial do hardware já instalado por meio de otimizações de software. Tal abordagem não só prolonga o ciclo de retorno dos investimentos de hardware dos clientes, mas também reforça o vínculo da Nvidia no ecossistema de infraestrutura de IA. Para o mercado, diante do avanço simultâneo de Blackwell e Rubin, a Nvidia constrói uma barreira de software que dificulta o avanço dos concorrentes no curto prazo.

0
0

Aviso Legal: o conteúdo deste artigo reflete exclusivamente a opinião do autor e não representa a plataforma. Este artigo não deve servir como referência para a tomada de decisões de investimento.

PoolX: bloqueie e ganhe!
Até 10% de APR - Quanto mais você bloquear, mais poderá ganhar.
Bloquear agora!
© Bitget 2026