A NVIDIA anunciou a expansão da sua plataforma NVLink Fusion com a introdução da NVHBM, uma tecnologia de memória de alta largura de banda personalizada. Esta inovação surge num contexto em que a indústria enfrenta desafios crescentes para suportar cargas de trabalho de IA com biliões de parâmetros e agentes autónomos, exigindo uma integração mais profunda entre computação, memória e rede. A empresa sublinha que o desempenho das infraestruturas modernas depende de uma arquitetura unificada, onde os componentes são desenhados em conjunto para maximizar a eficiência global do sistema.
A principal diferença da NVHBM reside na relocalização do controlador de memória. Nas arquiteturas tradicionais, este componente ocupa espaço no chip de computação (XPU). Com a nova abordagem da NVIDIA, o controlador é integrado diretamente na base da pilha de memória 3D. Segundo a fabricante, esta alteração permite um aumento de até 30% na largura de banda de memória e uma redução de 15% no consumo energético, comparativamente aos padrões HBM4E. Além disso, a libertação de cerca de 25% da área no chip de computação oferece maior flexibilidade para o design de processadores personalizados.
Para facilitar a adoção desta tecnologia, a NVIDIA estabeleceu um padrão de implementação para a NVHBM, que será validado e disponibilizado por parceiros de memória. Esta estratégia visa reduzir o esforço de engenharia necessário para a qualificação de componentes entre diferentes fornecedores, proporcionando aos clientes do NVLink Fusion um caminho mais célere para colocar os seus chips de IA no mercado. A padronização é apresentada como um passo crítico para permitir que os hyperscalers se foquem na inovação dos seus próprios processadores.
A Amazon, através da Annapurna Labs, será a primeira entidade a colaborar com a NVIDIA na implementação desta tecnologia. Esta parceria estende a cooperação já existente em torno do NVLink Fusion, com a Annapurna Labs a planear integrar a NVHBM nos seus futuros chips Trainium, começando pela geração Trainium4. O objetivo é permitir que os chips da Amazon e as GPUs da NVIDIA operem de forma harmoniosa dentro de uma arquitetura comum ao nível do bastidor, otimizando o desempenho para as exigentes cargas de trabalho de inteligência artificial.
O NVLink Fusion continua a permitir que os parceiros conectem XPUs e CPUs personalizadas à plataforma de rack da NVIDIA, utilizando tecnologias como NVLink-C2C e switches dedicados. Ao oferecer este ecossistema, a NVIDIA pretende reduzir os riscos associados ao desenvolvimento de infraestruturas semi-personalizadas. Esta abordagem permite que empresas focadas em IA aproveitem uma pilha tecnológica comprovada para a expansão de redes e sistemas, mantendo a liberdade para inovar ao nível do silício, num mercado que exige maior eficiência energética e capacidade de processamento.
Porque importa
A introdução da NVHBM representa uma mudança arquitetural na forma como a memória é gerida em sistemas de IA de alto desempenho. Ao descentralizar o controlador de memória, a NVIDIA permite que os fabricantes de chips otimizem o espaço disponível para computação, um fator crítico para a escalabilidade de modelos de IA cada vez mais complexos e exigentes em termos de recursos.