NVIDIA lança Nemotron 3.5 Lightning: modelo open source MoE de 30 bilhões para IA local

NVIDIA lança Nemotron 3.5 Lightning: modelo MoE open source de 30B para IA local, com NeMo Switchyard para roteamento e otimização de custos.

NVIDIA lança Nemotron 3.5 Lightning: modelo open source MoE de 30 bilhões para IA local

RESUMO ✦

Sem tempo? A Lili IA resume para você

Gerando resumo com IA...

NVIDIA lança Nemotron 3.5 Lightning: modelo open source MoE de 30 bilhões para IA local

NVIDIA ampliou a família Nemotron com o lançamento do Nemotron 3.5 Lightning, um modelo open source baseado em arquitetura Mixture-of-Experts (MoE) de 30 bilhões de parâmetros, concebido para rodar agentes inteligentes diretamente em dispositivos locais. A proposta combina peso aberto para customização com otimizações de execução que visam acelerar o processamento de tokens e reduzir o custo operacional na borda.

Segundo a empresa, o modelo entrega uma velocidade de geração de tokens até quatro vezes superior e reduz os tempos de conclusão de tarefas em cerca de 30% em comparação com soluções concorrentes de mesma faixa. A disponibilização dos pesos abertos permite que desenvolvedores e pesquisadores ajustem o modelo para fluxos de trabalho específicos — desde a produção de textos com estilos e formatos predeterminados até a compreensão de domínios técnicos verticais, como gráficos 3D, desenvolvimento de software e automação doméstica.

Para facilitar a integração em ambientes offline e de borda, a NVIDIA anunciou parcerias e suporte nativo a plataformas e ferramentas como vLLM, Ollama, llama.cpp, LM Studio e Unsloth. Através do Unsloth Studio há compatibilidade com formatos quantizados NVFP4 e GGUF, importantes para reduzir uso de memória e acelerar inferência em hardware limitado.

O escopo de compatibilidade cobre desde PCs com placas RTX até sistemas embarcados da linha NVIDIA Jetson, estendendo-se a estações de trabalho profissionais, datacenters e infraestruturas em nuvem fornecidas por parceiros. Essa amplitude revela a intenção da NVIDIA de tratar o modelo como um componente da infraestrutura digital, pronto para ser integrado em uma diversidade de camadas de serviço e dispositivos.

Em paralelo, a NVIDIA publicou no GitHub a biblioteca open source NeMo Switchyard, uma ferramenta de roteamento projetada para analisar cada etapa do workflow de um agente autônomo e direcionar a execução ao modelo mais adequado com base em critérios de precisão, latência e custo por token. Nos benchmarks internos apresentados, o sistema de roteamento conseguiu manter níveis de desempenho de alto nível enquanto reduzia os custos de conclusão para cerca de um terço do custo observado com o uso isolado de modelos proprietários, citando exemplos como o Opus 4.8.

As instruções técnicas, guias de implementação e recursos complementares foram colocados nos blogs dedicados ao Nemotron 3.5 Lightning, ao NeMo Switchyard e ao ambiente Jetson AI. O modelo também está disponível para distribuição via APIs em build.nvidia.com como microserviço NIM e através da plataforma OpenRouter.

Do ponto de vista sistêmico, o lançamento reforça a tendência de deslocamento de cargas de IA para a borda, transformando modelos grandes em componentes do «sistema nervoso» das cidades e ambientes profissionais. A combinação de pesos abertos e bibliotecas de roteamento como infraestrutura de orquestração cria uma camada de inteligência que pode ser ajustada localmente, reduzindo dependência de conexões contínuas com a nuvem e permitindo decisões mais rápidas e econômicas onde o dado é gerado.

Para organizações europeias e italianas focadas em integração de IA em soluções industriais, domésticas e de produtividade, o Nemotron 3.5 Lightning representa uma peça modular: um algoritmo tratado como infraestrutura, cujos alicerces digitais podem ser afinados conforme requisitos de precisão, latência e custo.