Focando no mercado de inferência de IA de baixa latência, Nvidia (NVDA.US) Groq 3 LPX entra em produção em massa total; os primeiros sistemas serão implantados na NEBIUS (NBIS.US)
A Nvidia anunciou na segunda-feira que o sistema em rack Groq 3 LPX entrou em plena produção em massa, marcando que, após a aquisição de ativos relacionados à Groq por cerca de 20 bilhões de dólares no ano passado, essa tecnologia de inferência de IA de baixa latência entrou oficialmente na fase de comercialização.
A Mídia Financeira Zhihui informa que a Nvidia (NVDA.US) anunciou nesta segunda-feira que o sistema Groq 3 LPX em nível de rack entrou em plena produção em massa, marcando a fase de comercialização desta tecnologia de inferência de IA de baixa latência após a aquisição, no ano passado, de ativos da Groq por cerca de 20 bilhões de dólares. Os primeiros sistemas serão implantados no provedor de serviços de computação em nuvem de IA, NEBIUS (NBIS.US), e deverão entrar em operação ainda este ano.
O diretor sênior da Nvidia, Dion Harris, afirmou à imprensa que o Groq 3 LPX será implementado juntamente com os processadores centrais Vera e as GPUs Rubin da Nvidia nos data centers da Nebius.
A rápida produção em massa do produto Groq reflete a tendência de que, à medida que as aplicações de IA passam do treinamento de modelos para a implantação real, a inferência de IA de baixa latência está se tornando um novo mercado-chave para a Nvidia. Especialmente em aplicações como agentes de IA e programação de IA, modelos precisam gerar conteúdo continuamente a uma velocidade maior, reduzindo o tempo de espera do usuário.
No final de dezembro do ano passado, a Nvidia gastou cerca de 20 bilhões de dólares para adquirir ativos relacionados à startup de chips de IA, Groq, que tornou-se a maior aquisição da história da empresa.
Uma característica marcante da arquitetura do chip Groq é a integração de 500MB de SRAM de alta velocidade dentro do próprio chip, para reduzir possíveis gargalos de transferência de dados causados por acessos à memória tradicional, aumentando assim a velocidade de resposta durante a inferência de modelos de IA.
Diferente das GPUs principais da Nvidia, fabricadas pela TSMC (TSM.US), os chips Groq são produzidos pela Samsung.
Atualmente, a Nvidia integra 256 chips Groq 3 em um rack LPX. Segundo dados de benchmark citados pela Nvidia do Artificial Analysis, o sistema Groq 3 LPX consegue gerar cerca de 3.400 tokens por segundo.
Para IA generativa, um token pode ser entendido como a unidade básica que o modelo processa e gera em texto. Uma taxa superior de tokens gerados por segundo significa que a IA pode responder mais rapidamente às solicitações dos usuários, o que é especialmente importante para aplicações sensíveis à latência como IA para programação e agentes em tempo real.
Harris afirmou que, para empresas de computação em nuvem que oferecem serviços de inferência de IA, menor latência significa que elas podem oferecer serviços premium de maior preço para clientes que exigem respostas mais rápidas.
No entanto, os chips Groq não foram projetados para substituir as GPUs tradicionais da Nvidia.
As GPUs ainda são o núcleo da infraestrutura de computação de IA atualmente, capazes de tanto treinar modelos de IA quanto executar tarefas de inferência, além de oferecerem maior versatilidade para diferentes modelos e arquiteturas tecnológicas.
Chips como os da Groq, com baixa latência, são mais focados em etapas específicas do processo de inferência, especialmente na fase de “decodificação” durante a geração de conteúdo pelo modelo.
Harris acrescentou: "Não se trata de substituir as GPUs, mas sim de usar o processador com o melhor preço e desempenho para cada parte da carga de trabalho."
Isso significa que a Nvidia está buscando estabelecer uma arquitetura de computação de IA mais segmentada: as CPUs Vera e as GPUs Rubin continuam realizando tarefas de computação de IA mais amplas, enquanto os chips Groq são otimizados para cargas de trabalho de inferência altamente sensíveis à latência.
À medida que o setor de IA avança da fase de treinamento de modelos em grande escala para uma rápida expansão da demanda de inferência, a competição no mercado de inferência de baixa latência está se intensificando.
A AMD (AMD.US) anunciou, no início deste ano, que iria integrar seus sistemas de IA em rack com os chips da Cerebras (CBRS.US), também com foco em inferência de IA de baixa latência.
A importância desse segmento está aumentando com a popularização de aplicações como programação de IA. De acordo com a reportagem, o modo Ultrafast recém-anunciado pela OpenAI promete até 750 tokens por segundo, sendo a capacidade de processamento fornecida pela Cerebras.
Em comparação, dados de benchmark citados pela Nvidia mostram que o Groq 3 LPX pode atingir 3.400 tokens por segundo. No entanto, as condições de teste e os cenários de aplicação dos diferentes sistemas podem variar, portanto esses números não devem ser considerados como uma comparação direta de desempenho.
Ao mesmo tempo, a Nvidia está acelerando as entregas de seus sistemas Vera Rubin, que já entraram em produção no início deste ano.
O CEO da Nvidia, Jensen Huang, estimou durante o lançamento dos sistemas Vera Rubin e Groq 3 LPX em março deste ano que, do atual chip Blackwell até a nova geração Vera Rubin, as vendas acumuladas poderiam atingir 1 trilhão de dólares até 2027.
Jensen Huang também revelou na época que, nos espaços de data centers dedicados a aplicações de programação de IA, planeja alocar cerca de um quarto para chips Groq e o restante para sistemas Vera Rubin.
Essa proporção de alocação mostra ainda mais o foco da Nvidia no mercado de inferência de baixa latência. À medida que agentes de IA, programação de IA e aplicações de IA generativa em tempo real se desenvolvem rapidamente, a velocidade de inferência está se tornando um importante diferencial competitivo para empresas de computação em nuvem e desenvolvedores de IA.
O início da produção em massa do Groq 3 LPX também indica que a Nvidia está expandindo seu papel de fornecedora de chips de IA centrados em GPUs para oferecer arquiteturas computacionais dedicadas para diferentes cargas de trabalho de IA.
O mercado agora acompanha de perto os mais recentes resultados da Nvidia. A empresa divulgará seu balanço nesta quarta-feira, e além da demanda por Blackwell e Vera Rubin, os avanços nos negócios de inferência de IA e a comercialização do Groq também podem se tornar novos destaques para os investidores.
Aviso Legal: o conteúdo deste artigo reflete exclusivamente a opinião do autor e não representa a plataforma. Este artigo não deve servir como referência para a tomada de decisões de investimento.
Talvez também goste
O “Deus das Ações do Capitólio” pela primeira vez investe em “Energia de IA”, e Bloom responde com alta
A família de Pelosi, conhecida como o “oráculo da bolsa do Capitólio” nos Estados Unidos, teve suas transações mais recentes expostas: investiram milhões de dólares pela primeira vez nas ações de energia de IA da Bloom Energy e aumentaram simultaneamente sua posição na Intel. Impulsionada por isso, a Bloom Energy teve um aumento diário de mais de 4%. A notícia rapidamente desencadeou uma onda de seguidores, com mais de 20 mil investidores apostando um total de 44 milhões de dólares, reacendendo o debate sobre a conformidade das operações de parlamentares no mercado de ações.
Futuros do VIX soam o alarme antecipadamente! Eleições intermediárias de novembro nos EUA devem se tornar uma janela de alta volatilidade para as ações americanas
Os operadores do mercado de derivativos de ações já começaram a se preparar para o aumento potencial da volatilidade antes e depois das eleições de meio de mandato dos Estados Unidos em novembro.

A infraestrutura de IA passa de "narrativa tecnológica" a "veneno eleitoral"! Wall Street faz alerta em uníssono: Negociações de IA enfrentam riscos políticos nas eleições intermediárias
Wall Street alerta que a ira dos eleitores dos Estados Unidos em relação ao desenvolvimento de inteligência artificial pode colocar em risco as negociações relacionadas à IA.

A intervenção de Bescent começa a mostrar resultados: o spread dos títulos do Tesouro dos EUA diminuiu significativamente e operadores de títulos de longo prazo apostam em nova queda dos rendimentos
Apesar de os rendimentos dos títulos do Tesouro dos EUA de longo prazo ainda estarem próximos dos níveis mais altos em anos, os indicadores de mercado mais recentes mostram que a intervenção do Tesouro já começou a surtir efeito, e os traders estão cada vez mais relutantes em enfrentar essa força política, apelidada pelo mercado de "opção de venda Baisent".

