A NVIDIA anunciou uma expansão no seu ecossistema de inteligência artificial de código aberto, focando-se na capacidade de execução local para programadores. O destaque desta iniciativa é o lançamento do Nemotron 3.5 Lightning, um modelo de 30 mil milhões de parâmetros baseado na arquitetura mixture-of-experts (MoE). Segundo a empresa, este modelo foi desenhado para agentes inteligentes que necessitam de estar ativos, oferecendo uma velocidade de geração de tokens até quatro vezes superior e uma redução de 30% no tempo de conclusão de tarefas em comparação com outros modelos abertos da mesma categoria.

A natureza de pesos abertos do Nemotron 3.5 Lightning permite que os utilizadores realizem ajustes finos com os seus próprios dados, adaptando o comportamento do modelo a fluxos de trabalho específicos. A NVIDIA sugere que esta flexibilidade é ideal para criar assistentes personalizados, capazes de redigir documentos seguindo estilos predefinidos, aprender terminologias técnicas de áreas como a fotografia ou o design 3D, e auxiliar na escrita e revisão de código. Esta personalização, quando combinada com o acesso a ficheiros e ferramentas locais, visa potenciar experiências de IA mais privadas e eficientes.

Para garantir uma implementação técnica, a NVIDIA estabeleceu colaborações com plataformas como vLLM, Ollama, llama.cpp e LM Studio, disponibilizando o modelo em formatos NVFP4 e GGUF. O suporte inicial também inclui otimizações através do Unsloth Studio. A versatilidade do hardware é um dos pilares desta estratégia, com o modelo a ser compatível desde computadores equipados com placas gráficas NVIDIA RTX até sistemas de data center, passando pelas plataformas Jetson para computação na periferia e estações de trabalho profissionais.

Paralelamente ao novo modelo, a empresa introduziu o NeMo Switchyard, uma biblioteca de roteamento de código aberto disponível no GitHub. Esta ferramenta foi concebida para ajudar as empresas a gerir os custos da adoção de IA generativa. O sistema encaminha automaticamente cada etapa de um fluxo de trabalho de um agente para o modelo mais adequado, equilibrando critérios de precisão, velocidade e custo. Testes internos da NVIDIA indicam que esta abordagem permite manter níveis de desempenho comparáveis aos modelos de fronteira, reduzindo os custos operacionais para cerca de um terço do valor de uma solução única.

Esta série de anúncios insere-se num esforço da NVIDIA ao longo do mês de agosto para impulsionar a comunidade de IA local. Além das novas ferramentas de software, a empresa continua a promover recursos educativos e bibliotecas que facilitam a entrada de novos utilizadores no desenvolvimento de agentes. Com a disponibilidade do Nemotron 3.5 Lightning através de serviços como o NVIDIA NIM e parceiros de nuvem, a estratégia da tecnológica consolida a sua posição tanto no hardware de alto desempenho como no software que viabiliza a execução local de modelos complexos.

Porque importa

A aposta da NVIDIA em modelos abertos e ferramentas de roteamento como o NeMo Switchyard demonstra uma estratégia para tornar a IA generativa mais acessível e economicamente sustentável para empresas, permitindo que estas utilizem modelos especializados localmente em vez de dependerem exclusivamente de grandes modelos proprietários na nuvem.

Fontes

NVIDIA and Local AI Community Fuel Open Source Models and Intelligent AgentsNVIDIA ↗