A NVIDIA revelou os primeiros resultados de desempenho da sua nova plataforma Vera Rubin NVL72 no âmbito dos testes MLPerf Inference v6.1, marcando um avanço na eficiência da infraestrutura de inteligência artificial. De acordo com os dados publicados a 16 de setembro de 2026, o sistema demonstrou uma capacidade de processamento até 3,7 vezes superior à do modelo GB300 NVL72 em cenários de inferência complexos. Estes resultados sublinham a importância da co-design entre hardware e software na otimização da economia da IA, onde o aumento do rendimento por rack se traduz numa maior geração de tokens e numa redução do custo operacional por unidade processada.
Nos testes realizados com modelos de linguagem e visão, como o DeepSeek-R1 e o Qwen3-VL, a plataforma Vera Rubin NVL72 destacou-se pela sua capacidade de processamento acelerado. A utilização de bibliotecas especializadas, como a NVIDIA TensorRT-LLM e o framework open source vLLM, permitiu otimizar as fases de preenchimento e descodificação da inferência. A introdução da precisão NVFP4 foi um fator determinante, reduzindo a pegada de memória dos pesos do modelo e do cache KV, o que permitiu elevar o rendimento global sem comprometer a qualidade da saída, um requisito crítico para aplicações de escala industrial.
A arquitetura Vera Rubin beneficia da sexta geração da tecnologia NVLink e de switches dedicados, que asseguram uma latência três vezes inferior à das soluções Ethernet convencionais. Esta infraestrutura de interconexão permite que técnicas avançadas, como o paralelismo de especialistas e o serviço desagregado, sejam executadas com eficácia ao nível do rack. Além disso, em testes de agentes autónomos, como o benchmark SemiAnalysis AgentX, a nova plataforma registou um desempenho até 30 vezes superior ao da geração anterior, evidenciando a sua aptidão para lidar com fluxos de trabalho que exigem raciocínio e planeamento multi-etapa.
Paralelamente, a NVIDIA demonstrou a eficiência de escala da sua tecnologia GB300 NVL72, que atingiu uma eficiência de 99% ao escalar de um único rack para quatro racks, totalizando 288 unidades de processamento gráfico. Este resultado confirma que o rendimento cresce de forma quase linear à medida que o hardware é adicionado, evitando as perdas de eficiência comuns em sistemas menos otimizados. A empresa sublinha que a escalabilidade é um pilar fundamental para as organizações que procuram maximizar o retorno do investimento em infraestruturas de computação de alto desempenho.
Por fim, a NVIDIA destacou o papel das otimizações de software contínuas, que permitiram ganhos de desempenho de até 1,6 vezes em comparação com a versão anterior do MLPerf. Estes progressos, que continuaram mesmo após a submissão oficial dos resultados, reforçam a estratégia da empresa em manter a fungibilidade da plataforma, permitindo que o mesmo hardware suporte uma vasta gama de cargas de trabalho, desde a formação de modelos até à inferência em tempo real. A colaboração com parceiros, como a Nebius, que também validou o desempenho da nova arquitetura, reforça a robustez do ecossistema em torno da tecnologia Vera Rubin.
Porque importa
A capacidade de processar inferência de forma mais rápida e eficiente é um motor da viabilidade económica da inteligência artificial. Com estes resultados, a NVIDIA estabelece um novo padrão de eficiência que permite às empresas escalar modelos complexos, como o DeepSeek-R1, com menor custo por token, acelerando a adoção de agentes autónomos e aplicações de IA generativa em larga escala.