Aller au contenu principal
Produit par Veille Moon AI 9 min de lecture

NVIDIA Nemotron 3.5 Lightning : des agents IA locaux 4 fois plus rapides

NVIDIA élargit sa famille Nemotron 3 avec Lightning, un modèle ouvert à architecture Mixture-of-Experts de 30 milliards de paramètres, dont seulement 3 milliards sont actifs à chaque calcul. Conçu pour faire tourner des agents IA en continu directement sur du matériel local, il génère les tokens jusqu'à quatre fois plus vite que les modèles ouverts comparables et réduit le temps d'exécution de 30 %.

Veille automatisée Rédigé par IA, vérifié par un second modèle, sans relecture humaine préalable. Notre méthode
NVIDIA Nemotron 3.5 Lightning : des agents IA locaux 4 fois plus rapides
NVIDIA Nemotron 3.5 Lightning : des agents IA locaux 4 fois plus rapides

NVIDIA continue d'étoffer sa famille de modèles ouverts Nemotron 3 avec un nouveau venu pensé non pas pour raisonner, mais pour exécuter. Nemotron 3.5 Lightning cible spécifiquement la couche d'exécution des agents IA qui fonctionnent en continu : appels d'outils, validation de résultats, délégation à des sous-agents. Des tâches à fort volume qui, si elles sont confiées à un modèle frontier à chaque étape, alourdissent le coût et la latence. C'est ce compromis que NVIDIA tente de résoudre avec un modèle plus petit, plus rapide, et surtout déployable en local.

Une architecture pensée pour le volume, pas pour la complexité

Nemotron 3.5 Lightning repose sur une architecture hybride Mixture-of-Experts (MoE), combinant des couches Mamba-2, MoE et attention. Le modèle compte 30 milliards de paramètres au total, mais seuls 3 milliards sont activés pour chaque token traité. Ce principe de routage vers un sous-ensemble d'experts permet, selon NVIDIA, d'obtenir la capacité d'un modèle dense plus large pour le coût de calcul d'un modèle bien plus petit.

C'est le membre le plus léger de la famille Nemotron 3, dans laquelle des modèles plus imposants comme Nemotron 3 Ultra assurent la planification et l'orchestration, tandis que Lightning prend en charge les tâches à haut volume et faible latence : relecture de code, surveillance d'alertes de sécurité, réponses à des questions de facturation. NVIDIA décrit ce fonctionnement comme un système de modèles, où chaque brique est spécialisée plutôt qu'un modèle unique censé tout faire.

Jusqu'à quatre fois plus rapide, mais sur quels critères

Selon les données publiées par NVIDIA, Nemotron 3.5 Lightning génère des tokens jusqu'à quatre fois plus rapidement que les modèles ouverts de gabarit comparable, et réduit le temps d'exécution global de 30 % par rapport à ses concurrents de même catégorie. Cette accélération s'appuie sur le décodage spéculatif : le modèle a suivi une phase de pré-entraînement dédiée pour intégrer la prédiction multi-token (MTP), puis une phase de renforcement spécifique à cette capacité. Deux modèles de « brouillon » externes, DSpark et DFlash, viennent compléter ce dispositif selon le scénario de déploiement.

Sur le benchmark interne PinchBench, NVIDIA indique que Nemotron 3.5 Lightning atteint 86 % de précision tout en terminant 10 000 tâches 30 % plus vite que Qwen3.6 35B à précision équivalente. Ces chiffres proviennent des évaluations internes de NVIDIA et n'ont pas été vérifiés de façon indépendante.

Le tableau ci-dessous reprend une partie des résultats publiés par NVIDIA sur Hugging Face, comparant la version BF16 et la version quantifiée NVFP4 du modèle :

BenchmarkNemotron 3.5 Lightning (BF16)Nemotron 3.5 Lightning (NVFP4)
MMLU Pro (connaissances générales)81,9481,62
GPQA Diamond (raisonnement, sans outils)75,4475,57
SWE-bench Verified (codage)51,5652,80
PinchBench (agentique)85,3783,43
IFBench, souple (suivi d'instructions)71,8872,88

Ces chiffres, mesurés par NVIDIA avec un protocole d'évaluation commun (NeMo Gym / Nemo Evaluator SDK), peuvent différer des chiffres auto-déclarés par d'autres éditeurs.

Du PC de bureau au data center, une même base logicielle

Le modèle est disponible dans deux formats principaux, NVFP4 et GGUF, avec un checkpoint BF16 également proposé. Cette diversité de formats vise à couvrir un large spectre de matériels, du poste de travail individuel au data center.

Échelle de déploiementMatériel concerné
Poste individuelPC équipés de GPU NVIDIA RTX, cartes NVIDIA Jetson
Petite station localeNVIDIA DGX Spark, configurations OEM GB10
Poste de travail professionnelStations RTX PRO, NVIDIA DGX Station
Infrastructure d'entrepriseSystèmes GB300, data centers, environnements cloud

Des partenaires comme Acer, ASUS, Dell Technologies, HP, Lenovo et MSI proposent des systèmes NVIDIA Blackwell compatibles avec ce déploiement. Le contexte du modèle monte jusqu'à un million de tokens selon la fiche technique publiée sur Hugging Face, avec une validation confirmée sur cette longueur pour plusieurs configurations, dont un DGX Spark unique ou un H100 unique.

Pour l'intégration logicielle, NVIDIA a collaboré avec vLLM, Ollama, llama.cpp et LM Studio. Unsloth propose également un support dès le lancement, avec des versions optimisées et quantifiées accessibles via Unsloth Studio. Les poids, les données d'entraînement et les recettes sont publiés sous licence OpenMDW-1.1, ce qui autorise un usage commercial sans demander d'autorisation ni verser de redevance à NVIDIA, selon les informations rapportées par CNBC.

NeMo Switchyard : router les tâches pour maîtriser les coûts

En parallèle du modèle, NVIDIA publie NeMo Switchyard, une bibliothèque de routage open source disponible sur GitHub. Son rôle est d'orienter chaque étape d'un flux de travail agentique vers le modèle le plus adapté, selon trois critères : précision, rapidité et coût. Concrètement, un modèle frontier comme Nemotron 3 Ultra ou un modèle propriétaire peut continuer à gérer la planification, tandis que Nemotron 3.5 Lightning prend en charge l'exécution répétitive.

Selon les benchmarks internes de NVIDIA, ce système de routage permet de conserver un niveau de résultat proche des modèles les plus avancés, tout en ramenant le coût d'exécution à environ un tiers de celui d'Opus 4.8 utilisé seul sur l'ensemble d'une tâche. Plusieurs entreprises partenaires ont testé l'outil : LangChain rapporte une baisse de coût de 74 % sur une série de tâches multi-tours en n'envoyant que 7 % des appels vers un modèle frontier, avec un compromis de précision de 6 %. Ramp indique avoir réduit ses coûts de 58 % et son temps d'exécution de 33 % sur son propre benchmark interne. Ces chiffres proviennent des communications de NVIDIA et des entreprises citées, et n'ont pas fait l'objet d'une vérification indépendante.

Ce que cela change pour une entreprise en France

Pour une organisation francophone qui souhaite déployer des agents IA sans dépendre exclusivement d'un fournisseur cloud, Nemotron 3.5 Lightning propose une option concrète : faire tourner le modèle sur du matériel possédé ou loué localement, avec des poids ouverts que l'on peut affiner sur ses propres données. NVIDIA cite des exemples d'usages personnalisés : un agent de gestion d'e-mails et de calendrier, un assistant pour la maison connectée, ou un outil de développement travaillant sur une base de code locale. Le modèle a par ailleurs été personnalisé par des entreprises comme CrowdStrike pour la cybersécurité, Harvey avec Trajectory pour des services juridiques, et CodeRabbit avec Baseten pour la relecture de code, selon NVIDIA.

L'exécution locale répond directement à une préoccupation récurrente des entreprises françaises : garder la main sur les données traitées par les agents IA, sans dépendre d'un envoi systématique vers un cloud tiers. C'est une logique différente de celle des plateformes qui donnent accès à plusieurs modèles via une API distante. Moon AI, par exemple, propose l'accès à plus de 70 modèles (GPT, Claude, Gemini, Mistral, DeepSeek, Llama, Grok, Qwen, plus son modèle maison Moon 6) via un abonnement unique, avec un mécanisme appelé Moon Blur qui remplace les données personnelles par des jetons avant l'envoi aux modèles tiers, puis les rétablit au retour. Ce procédé est réversible : il s'agit d'une pseudonymisation au sens du RGPD, pas d'une anonymisation. L'application et le stockage de Moon AI sont hébergés chez OVHcloud, à Strasbourg et à Roubaix, mais les requêtes adressées aux modèles tiers partent bien chez leurs fournisseurs une fois pseudonymisées. Ces deux approches, exécution locale sur matériel NVIDIA d'un côté, accès mutualisé et pseudonymisé de l'autre, répondent à des besoins différents : la première convient aux entreprises disposant de moyens matériels et d'équipes techniques pour l'entraînement et le déploiement, la seconde à celles qui cherchent un accès simplifié à plusieurs modèles sans investissement en infrastructure.

Un lancement inscrit dans un débat plus large sur l'open source

Ce lancement s'inscrit dans une actualité chargée pour NVIDIA autour des modèles ouverts. Selon CNBC, il s'agit du premier modèle open source de l'entreprise depuis que son PDG Jensen Huang a pris position publiquement en faveur de cette approche, à l'occasion d'un débat déclenché par la sortie du modèle chinois Kimi K3, qui avait suscité des inquiétudes politiques à Washington sur la sécurité nationale et le risque de vol de propriété intellectuelle via distillation. Dans une interview rapportée par CNBC, Huang aurait déclaré : « Free AI should be great for hardware. Free AI should be great for chips » (« l'IA gratuite devrait être une aubaine pour le matériel, l'IA gratuite devrait être une aubaine pour les puces »). Cette déclaration, si elle est confirmée, éclaire la logique commerciale de NVIDIA : un modèle ouvert et gratuit à l'usage encourage l'achat de matériel pour le faire fonctionner.

Questions fréquentes

Nemotron 3.5 Lightning est-il gratuit pour un usage professionnel ?

Les poids, les données d'entraînement et les recettes sont publiés sous licence OpenMDW-1.1. Selon les informations rapportées par CNBC, le modèle est utilisable, modifiable et déployable par des entreprises sans autorisation préalable ni paiement à NVIDIA. Les coûts réels dépendent en revanche du matériel nécessaire pour le faire fonctionner.

Quel matériel faut-il pour le faire tourner ?

Le modèle s'exécute sur des PC équipés de GPU NVIDIA RTX, sur les systèmes DGX Spark, sur les configurations OEM GB10 et sur les cartes Jetson pour un usage local ou embarqué. Pour des besoins plus intensifs, il monte en charge vers les stations RTX PRO, les systèmes DGX Station et GB300, ainsi que vers les data centers et environnements cloud.

Ce modèle remplace-t-il un assistant type GPT ou Claude ?

Non. NVIDIA le présente comme une brique d'exécution destinée aux tâches répétitives et à fort volume au sein d'un flux agentique, tandis que la planification et le raisonnement complexe restent confiés à des modèles frontier comme Nemotron 3 Ultra ou d'autres modèles propriétaires, orchestrés via NeMo Switchyard.

Comment fonctionne le routage entre plusieurs modèles avec NeMo Switchyard ?

NeMo Switchyard est une bibliothèque de routage open source disponible sur GitHub. Elle dirige automatiquement chaque étape d'un flux de travail agentique vers le modèle le plus adapté selon trois critères : précision, rapidité et coût, sans obliger les développeurs à réécrire leurs applications.

Prêt à essayer Moon AI ?

À partir de 9,90 € TTC/mois. 70+ modèles IA, Moon Blur et génération de documents inclus. Sans engagement.

Démarrer