A NVIDIA anunciou, durante a conferência Hot Chips em Palo Alto, a entrada em produção do sistema Groq 3 LPX, uma solução de aceleração de inferência concebida para integrar a plataforma Vera Rubin NVL72. Este lançamento marca um passo estratégico da empresa na transição da indústria de IA, que se desloca do foco exclusivo no treino de modelos para a fase de raciocínio e execução por agentes autónomos. Segundo a fabricante, a arquitetura foi desenhada para otimizar a geração de tokens, um requisito crítico para sistemas que necessitam de processar janelas de contexto extensas e realizar tarefas complexas em tempo real.
Os resultados de desempenho apresentados pela NVIDIA, baseados em benchmarks da Artificial Analysis, indicam que o sistema Groq 3 LPX alcançou uma velocidade de 3.400 tokens por segundo ao executar o modelo Gemma 4 31B. Este valor, obtido em cenários de contexto de 100.000 tokens, representa, segundo a empresa, uma performance quatro vezes superior à das alternativas mais próximas atualmente disponíveis no mercado. A tecnologia foca-se na redução da latência de descodificação, um desafio técnico que se torna mais evidente à medida que os agentes de IA interagem com ferramentas externas e outros sistemas de forma sequencial.
A estratégia da NVIDIA assenta no conceito de codesign, onde o hardware de computação, a rede e a aceleração de inferência são desenvolvidos como um sistema unificado. A integração do Groq 3 LPX com a plataforma Vera Rubin NVL72 permite que as unidades de processamento gráfico Rubin se encarreguem do processamento de contexto em larga escala, enquanto o acelerador LPX gere as cargas de trabalho de inferência sensíveis à latência. Esta abordagem visa eliminar o compromisso tradicional entre a velocidade de resposta e o rendimento total do sistema, garantindo maior eficiência para fornecedores de nuvem e centros de dados.
A adoção desta tecnologia já começou a ganhar tração entre parceiros industriais. A Nebius tornou-se o primeiro fornecedor de nuvem de IA a implementar o Groq 3 LPX, visando oferecer aos seus utilizadores capacidades superiores para o desenvolvimento de agentes interativos e sistemas de codificação. Simultaneamente, a CoreWeave iniciou a produção com a rede Spectrum-X Multiplane, que utiliza comutadores paralelos para assegurar uma infraestrutura de rede de alta largura de banda, essencial para a comunicação eficiente entre os racks da plataforma Vera Rubin.
Além das infraestruturas de nuvem, a SpaceXAI anunciou a integração dos novos CPUs NVIDIA Vera na sua arquitetura de IA. A empresa pretende utilizar estes processadores para acelerar tarefas intensivas, como a orquestração de agentes, a execução de código e a simulação de dados, tanto em centros de dados terrestres como em aplicações espaciais. Esta parceria sublinha a versatilidade da plataforma Vera Rubin, que procura oferecer um desempenho previsível sob carga, permitindo que os agentes concluam tarefas com maior rapidez e mantendo a infraestrutura de computação acelerada em níveis elevados de utilização.
Porque importa
A transição para sistemas de agentes autónomos exige uma infraestrutura capaz de gerir latências mínimas em cadeias de raciocínio complexas. A aposta da NVIDIA no Groq 3 LPX demonstra como o hardware especializado está a ser redesenhado para suportar a próxima vaga de aplicações de IA, onde a velocidade de geração de tokens é um fator determinante para a viabilidade operacional de sistemas de agentes.