A NVIDIA anunciou o sistema Vera Rubin NVL72, uma plataforma concebida para responder à crescente procura computacional dos agentes de inteligência artificial. Segundo dados da empresa, as cargas de trabalho agentic, que envolvem processos complexos como a pesquisa financeira ou o desenvolvimento de software, consomem cerca de 15 vezes mais tokens do que uma interação de chat convencional. Este aumento deve-se à natureza iterativa dos agentes, que necessitam de consultar bases de dados, invocar subagentes e sintetizar informações de forma contínua, exigindo uma gestão de contexto de longo alcance extremamente eficiente.

Os testes de desempenho realizados pela NVIDIA, utilizando a carga de trabalho SemiAnalysis AgentX, revelaram resultados significativos para a nova arquitetura. O sistema Vera Rubin NVL72 demonstrou uma capacidade de processamento até 30 vezes superior por megawatt em comparação com o sistema GB300 NVL72. Além da eficiência energética, a empresa reporta uma redução de 35 vezes no custo por milhão de tokens, um fator determinante para a viabilidade económica da implementação de agentes de IA em escala industrial, onde o consumo de energia é frequentemente um dos maiores constrangimentos operacionais.

Para alcançar estes números, a NVIDIA apostou numa estratégia de co-design que abrange todas as camadas da plataforma. Entre as inovações técnicas destacam-se a separação entre o processamento de contexto e a geração de respostas, bem como a utilização de técnicas avançadas de paralelismo de especialistas e a distribuição de cache KV através do domínio de escala da GPU. Estas otimizações permitem que o sistema mantenha o contexto acessível sem a necessidade de recomputação constante, mantendo as GPUs ativas e minimizando os tempos de espera por dados.

A arquitetura beneficia da quinta geração de Tensor Cores e do motor Transformer de terceira geração, que aceleram as fases de prefill e decode da inferência. A introdução da quantização NVFP4, que comprime os pesos dos modelos para uma precisão de 4 bits, contribui igualmente para aumentar o rendimento sem comprometer a qualidade dos resultados. Estas tecnologias, integradas no domínio NVL72, facilitam a comunicação de alta largura de banda e baixa latência entre GPUs, elementos essenciais para o funcionamento de modelos complexos.

Embora os resultados apresentados pela NVIDIA sejam promissores, a empresa sublinha que estes dados ainda aguardam uma revisão independente por parte da SemiAnalysis. Além disso, os testes atuais não incorporam o desempenho dos processadores Vera CPU em tarefas de chamada de ferramentas. À medida que a IA agentic se torna uma realidade em diversos setores, a capacidade de maximizar o rendimento por megawatt será, segundo a fabricante, o fator decisivo para a rentabilidade e a escalabilidade das infraestruturas de centros de dados modernos.

Porque importa

A transição de modelos de chat simples para agentes autónomos exige uma infraestrutura radicalmente mais eficiente. A capacidade de processar contextos longos com menor consumo energético é um obstáculo para a adoção em massa de agentes de IA, tornando estes avanços de hardware cruciais para a viabilidade financeira e sustentabilidade dos centros de dados.

Fontes

Up to 30x More Work Per Watt: NVIDIA Vera Rubin NVL72 Sets a New Efficiency Standard for AI AgentsNVIDIA ↗