Nvidia anuncia produção em larga escala do Groq 3 LPX, eficiência de inferência do Vera Rubin multiplica várias vezes, SpaceXAI reforça investimento em agentes inteligentes e IA espacial
A Nvidia afirmou que, com base nas cargas de trabalho AgentX da SemiAnalysis e utilizando o modelo DeepSeek V4 Pro, o Vera Rubin atinge até 30 vezes mais throughput por megawatt em comparação com a geração anterior GB300 NVL72, e reduz o custo por token em até 35 vezes. A SpaceXAI utilizará o Vera CPU para acelerar as aplicações de IA de próxima geração de agentes inteligentes e expandirá a construção de plataformas baseadas no Vera Rubin. A SpaceXAI planeja estender a versão otimizada Vera Rubin NVL72 para o espaço, sendo utilizada nos satélites Starmind AI da primeira geração.
A Nvidia está acelerando a competição pela infraestrutura de IA, levando-a da tradicional performance de treinamento e inferência de modelos para uma nova fase centrada na geração de Tokens, consumo energético e custos, com foco na IA Agente (Agentic AI).
No dia 24 de junho, segunda-feira, no horário do leste dos EUA, a Nvidia anunciou que o Groq 3 LPX para inferência interativa de IA entrou oficialmente em plena produção. Como uma parte fundamental da plataforma Vera Rubin, o Groq 3 LPX destaca-se por sua geração de Tokens com ultra-baixa latência. Segundo a Nvidia, em testes Artificial Analysis, ao rodar o modelo Gemma 4 31B com contexto de até 100.000 Tokens, o Groq 3 LPX alcançou a marca de 3400 Tokens de saída por segundo, estabelecendo um recorde para esse modelo; para cargas de trabalho de programação de agentes, sua velocidade de resposta chega a ser até 4 vezes superior à das plataformas concorrentes.
Ao mesmo tempo, a Nvidia divulgou novos resultados de testes do Vera Rubin NVL72 sob cargas reais de trabalho de agentes: com base na carga AgentX da SemiAnalysis e utilizando o modelo DeepSeek V4 Pro, o Vera Rubin atingiu a taxa de transferência de dados por megawatt (MW) até 30 vezes maior que a geração anterior GB300 NVL72, com custo por Token reduzido em até 35 vezes. A Nvidia enfatiza que as tarefas de agentes diferem de chats ou resumos tradicionais, pois o contexto da tarefa se acumula por centenas de etapas, chegando até centenas de milhares de Tokens.

No mesmo dia, a Nvidia também anunciou que a SpaceXAI irá adotar a CPU Vera para impulsionar a próxima geração de aplicações agentic AI, ampliando também a construção da plataforma baseada em Vera Rubin, à medida que sua capacidade computacional caminha para atingir alguns GW; além disso, a SpaceXAI planeja levar uma versão otimizada do Vera Rubin NVL72 para o espaço, integrando-a no satélite Starmind AI de primeira geração.
Groq 3 LPX em plena produção, Nvidia completa o “último quilômetro” do agente IA
O objetivo principal da Nvidia ao colocar o Groq 3 LPX em plena produção não é substituir as GPUs por chips dedicados à inferência, mas sim complementar o Vera Rubin com capacidade tradicional de GPUs na geração de Tokens com baixa latência.
Para agentes de IA, uma tarefa geralmente não é apenas "pergunta e resposta": um agente precisa ler arquivos, acionar ferramentas, executar códigos, verificar resultados e continuar inferindo com base nesses resultados, podendo repetir esse ciclo centenas ou milhares de vezes. Durante esse processo, a velocidade de geração de cada Token impacta no tempo total de execução da tarefa.
A Nvidia afirma que a agentic AI traz dois desafios computacionais distintos: de um lado, é necessário processar contextos crescentes de larga escala de forma eficiente; de outro, gerar Tokens continuamente com latência extremamente baixa. O Vera Rubin NVL72 cuida do treinamento, da inferência e do processamento de contexto em larga escala, enquanto o Groq 3 LPX é otimizado para a velocidade de interação individual, aumentando a taxa de geração de Tokens.
Testes recentes da Nvidia mostram que, sob o modelo Gemma 4 31B com contexto de 100K, o Groq 3 LPX alcança 3400 Tokens gerados por segundo; em tarefas de agentes e outras aplicações sensíveis à latência, a resposta chega a ser 4 vezes mais rápida que a das plataformas concorrentes. Segundo a Nvidia, essa velocidade possibilita aos agentes completar tarefas contínuas como programação de código, testes, chamadas de ferramentas e validação de resultados muito mais rapidamente.
No aspecto comercial, a provedora de serviços de IA em nuvem Nebius será a primeira a adotar o Groq 3 LPX, planejando implementá-lo em sua plataforma Nebius Token Factory para inferência produtiva. O Groq também planeja ser um dos primeiros adotantes dessa plataforma.
Isso significa que, com a entrada em produção plena do Groq 3 LPX, as capacidades desenvolvidas pela Nvidia através da aquisição da tecnologia Groq estão sendo verdadeiramente integradas ao ecossistema de produtos do data center Vera Rubin.
30 vezes maior não se refere à “velocidade”, mas sim à realização de mais tarefas de agentes por MW
Mais do que o índice de performance de 3400 Tokens/segundo, a Nvidia chama atenção para a taxa de transferência por megawatt e o custo por Token.
Dados de testes apresentados pela Nvidia mostram que, sob a carga de trabalho AgentX da SemiAnalysis, o Vera Rubin NVL72 atinge até 30 vezes mais taxa de transferência por MW em relação ao GB300 NVL72, com o custo por Token reduzido até 35 vezes. O teste utiliza trilhas reais de programação de agentes, mantendo o crescimento do contexto, chamadas de ferramentas e geração de subagentes características do uso real.

Portanto, o ganho de 30 vezes por megawatt reflete principalmente a alta eficiência da inferência de IA — não significa simplesmente que o chip está 30 vezes mais rápido.
Esse índice é especialmente relevante para data centers de IA.
Serviços baseados em grandes modelos tradicionalmente focam em latência e throughput por requisição, enquanto cargas de agentes consomem Tokens continuamente. A Nvidia cita dados do OpenRouter indicando que o consumo de Tokens em cargas de agentic AI pode ser até 15 vezes maior do que em simples chats. Isso porque um agente pode primeiro consultar bancos de dados, depois pesquisar notícias e arquivos, chamar subagentes para análise, rodar códigos e validar múltiplas vezes — com contexto sempre crescendo durante o processo.
Assim, a economia da infraestrutura de IA começa a ser medida sob um novo prisma: com um mesmo megawatt, quantas tarefas de agentes podem ser concluídas efetivamente?
Em um cenário onde energia e recursos de data center se tornam gargalos para expansão de IA, aumentar a quantidade de Tokens gerados por unidade de energia poderá ser mais importante do que simplesmente aumentar o pico de poder computacional.
De “plataforma GPU” à fábrica de IA completa: a transformação do Vera Rubin
Do ponto de vista da arquitetura, o Groq 3 LPX não é um produto isolado, mas integra-se à rota de "cogestão extrema" da arquitetura Vera Rubin da Nvidia.

A Nvidia já definiu o Vera Rubin como uma plataforma-fábrica de IA para a era da agentic AI. O sistema não é composto apenas por GPUs, mas foi desenhado de forma coesa entre computação, rede, armazenamento e software, incluindo Rubin GPU, Vera CPU, Groq 3 LPX, BlueField-4 DPU, Spectrum-6 SPX e outros componentes.
Nessa arquitetura, a Rubin GPU executa grandes treinamentos, inferências e processamento de contexto; o Groq 3 LPX cuida da geração rápida de Tokens; a Vera CPU processa as extensas tarefas intensivas em CPU geradas entre chamadas de modelo do agente, como orquestração de ferramentas, execução de códigos, processamento de dados e simulações.
Informações previamente divulgadas pela Nvidia mostram que a plataforma Vera Rubin foi concebida com sete tipos de chips em cinco racks dedicados, com o intuito de cada hardware executar as tarefas para as quais é mais adequado — evitando que um único tipo de processador assuma toda a carga de trabalho de IA.
Ou seja, a Nvidia está elevando a infraestrutura de IA de um mero "cluster de GPU" para um verdadeiro sistema de computação heterogênea.
Para provedores de nuvem de IA, isso significa poder alocar recursos conforme a etapa — treinamento, inferência de contexto longo, geração de Tokens, chamadas de ferramentas, etc. — otimizando a utilização e o retorno econômico do data center.
SpaceXAI aposta em Vera: agentic AI do data center ao espaço
No mesmo momento em que o Groq 3 LPX entra em produção plena, a SpaceXAI anuncia a ampliação do uso da arquitetura Vera Rubin da Nvidia.
Em 24 de agosto, a Nvidia anunciou que a SpaceXAI irá implantar a CPU Vera em aplicações de próxima geração de agentic AI. Vera é projetada especialmente para cargas de trabalho de CPU fora da inferência de modelos, incluindo chamadas a ferramentas, execução de códigos, processamento de dados, orquestração de tarefas e simulações.
O Vera utiliza 88 núcleos Olympus desenvolvidos pela própria Nvidia, com memória LPDDR5X de alta largura de banda, atingindo até 1,2TB/s. Segundo a Nvidia, em cargas de agentic AI, aprendizado por reforço e processamento de dados, o Vera pode completar tarefas até 1,8 vez mais rápido que CPUs x86.
Para a SpaceXAI, o valor do Vera vai além do simples aumento de performance de CPU.
Durante a execução de agentes, muitas tarefas ocorrem entre as inferências da GPU — como executar código, processar dados, chamar ferramentas e coordenar diferentes agentes. Se essas tarefas forem lentas na CPU, as GPUs podem ficar ociosas, reduzindo a eficiência da "fábrica de IA".
Por isso, a SpaceXAI espera usar o Vera para processar essas tarefas "fora do modelo", deixando as GPUs focadas em treinamento e inferência — aumentando a eficiência do sistema como um todo.
A SpaceXAI também planeja expandir a infraestrutura Grok AI baseada em Vera Rubin à medida que a capacidade computacional chega a alguns GW; além disso, eles pretendem usar uma versão otimizada do Vera Rubin NVL72 no primeiro satélite Starmind AI.
Isso significa que o sistema acelerador de computação da Nvidia está se expandindo dos data centers terrestres para a computação orbital.
De “chatbots” à “execução autônoma”, a demanda de poder computacional de IA está mudando de fase
Do Groq 3 LPX em plena produção, passando pelo Vera Rubin atingindo 30 vezes mais throughput por megawatt, até a SpaceXAI levando o Vera Rubin ao satélite Starmind, as novidades da Nvidia apontam para uma mesma tendência: as aplicações de IA estão migrando de produção de conteúdo para execução autônoma de tarefas.
Em chats e resumos, os usuários geralmente só precisam de uma resposta textual rápida do modelo. Porém, em cenários de agentes, o modelo precisa inferir continuamente, chamar ferramentas, executar código, acessar dados externos e validar resultados repetidamente.
Isto significa que, no futuro, os principais indicadores de infraestrutura de IA também poderão mudar — passando de "treinar um modelo maior" para focar em quantos Tokens úteis são gerados por unidade de energia, quantas tarefas podem ser concluídas por custo unitário e qual o tempo necessário para que um agente complete uma tarefa complexa.
A integração do Groq 3 LPX, da Vera CPU e da Rubin GPU em um único sistema-fábrica de IA mostra que a Nvidia está redesenhando sua infraestrutura para esse novo cenário.
E a SpaceXAI oferece uma direção ainda mais visionária de aplicação: se esse sistema puder ser expandido do data center ao espaço, as fronteiras da computação de IA não estarão mais limitadas ao tradicional CPD (data center) terrestre.
Aviso Legal: o conteúdo deste artigo reflete exclusivamente a opinião do autor e não representa a plataforma. Este artigo não deve servir como referência para a tomada de decisões de investimento.
Talvez também goste
Relatório financeiro da Nvidia (NVDA.US) testa a fé na IA: mercado de opções prevê volatilidade de US$ 280 bilhões em valor de mercado
Os traders de opções estão precificando a variação do valor de mercado da Nvidia (NVDA.US) após a divulgação do relatório financeiro do segundo trimestre, que será anunciado após o fechamento do mercado de ações dos EUA na quarta-feira, e esperam uma oscilação de até US$ 280 bilhões em seu valor de mercado.

Ascensão do arbitragem de spread no Golfo atrelado ao dólar: Banco Comercial do Catar e Banco da Arábia Saudita tornam-se os dois pilares de depósitos alavancados do UBS (UBS.US)
Fontes familiarizadas revelaram que o UBS Group está intensificando os esforços para oferecer aos clientes depósitos alavancados em instituições de crédito no Oriente Médio, a fim de aproveitar as taxas de poupança mais altas da região.

Goldman Sachs: O preço do ouro atingirá US$ 4.900 por onça até o final do ano
US$ 1 bilhão foge! ETF alavancado de chips da Coreia do Sul registra primeira saída líquida mensal, investidores individuais migram rapidamente para índices de ações dos EUA em busca de proteção
À medida que o entusiasmo dos investidores por negociações baseadas em Inteligência Artificial (IA) diminui, e os órgãos reguladores implementam medidas para conter a demanda excessiva, ETFs alavancados vinculados a gigantes sul-coreanas de chips como Samsung Electronics e SK Hynix estão enfrentando grandes saídas de capital.

