NVIDIA a annoncé Nemotron 3.5 Lightning le 11 août 2026, avec NeMo Switchyard, une bibliothèque open source destinée à router les requêtes entre les modèles utilisés par les agents IA. Le modèle cible les charges de travail agentiques longues ; le routeur doit choisir le modèle capable de traiter chaque requête selon les besoins de l’application.
Nemotron 3.5 Lightning vise les longues tâches agentiques
Nemotron 3.5 Lightning est un modèle de type mixture-of-experts doté de 30 milliards de paramètres. NVIDIA affirme qu’il offre une vitesse de génération jusqu’à quatre fois supérieure à celle d’autres modèles de sa catégorie et réduit de 30 % le temps nécessaire à l’exécution de tâches agentiques.
Ces chiffres proviennent des comparaisons internes de NVIDIA et non d’un benchmark indépendant. Ils décrivent donc l’avantage revendiqué par l’entreprise dans les conditions de ses propres évaluations, sans permettre de généraliser le résultat à tous les usages ou à toutes les infrastructures.
NeMo Switchyard arbitre entre plusieurs modèles
NeMo Switchyard ajoute une couche de routage distincte du modèle. La bibliothèque peut envoyer chaque requête vers le modèle le plus adapté au sein d’un ensemble comprenant des modèles ouverts, propriétaires et NVIDIA. Les développeurs peuvent ajuster cette logique en fonction de la qualité recherchée, de la latence et du coût d’exécution.
NVIDIA affirme que les applications existantes n’ont pas besoin d’être réécrites pour utiliser la bibliothèque. Le changement se situe donc dans la manière de distribuer les appels entre les modèles, avec une politique qui doit être adaptée aux tâches réellement traitées par chaque organisation.
Dans les benchmarks internes de NVIDIA, NeMo Switchyard peut maintenir une précision de niveau modèle de pointe tout en ramenant le coût d’exécution d’une tâche à près d’un tiers de celui obtenu avec Opus 4.8 seul. Ce résultat dépend toutefois de la composition du trafic et des règles appliquées par le routeur.
Les résultats publiés varient selon la charge de travail
Boomi a rapporté une précision de routage de 100 % sur cinq capacités de routage. L’entreprise a envoyé 59 % de son trafic vers un modèle ajusté, cinq fois plus rapide, et réduit de 21 % la latence des tours suivants.
LangChain a fait état d’une baisse des coûts de 74 % sur 145 tâches Deep Agents multi-tours. Dans cette configuration, seulement 7 % des appels ont été envoyés vers un modèle de pointe, avec un compromis de 6 % sur la précision.
Ramp a de son côté rapporté des coûts réduits de 58 % et une exécution 33 % plus rapide sur Ramp SWE-Bench, tout en égalant les performances d’un modèle de pointe. Ces chiffres sont attribués aux organisations citées dans l’annonce de NVIDIA. Ils ne constituent pas une projection pour chaque déploiement : le résultat dépend notamment des requêtes envoyées vers des modèles plus petits ou ajustés et de la méthode utilisée pour mesurer la qualité.
La cybersécurité fait partie des usages cités
NVIDIA cite CrowdStrike parmi les organisations qui personnalisent Nemotron 3.5 Lightning. Les autres exemples mentionnés sont Harvey avec Trajectory pour les services juridiques, et CodeRabbit avec Baseten pour la revue de code.
L’exemple de CrowdStrike situe le modèle dans des flux de travail organisationnels spécialisés, au-delà d’une interface généraliste. NVIDIA indique que les organisations peuvent réaliser le post-entraînement de Nemotron 3.5 Lightning avec NeMo à partir de leurs propres données, outils et flux de travail. Cette possibilité peut servir à adapter le modèle aux pratiques internes, mais l’annonce ne décrit ni le système obtenu par CrowdStrike, ni ses contrôles de sécurité, ni les tâches déployées. Elle ne permet donc pas encore d’évaluer ce que le modèle accomplit dans un environnement de production réel.
Des versions accessibles sur plusieurs environnements
Nemotron 3.5 Lightning est disponible via Hugging Face, ModelScope, OpenRouter et build.nvidia.com sous la forme d’un microservice NVIDIA NIM. NVIDIA affirme qu’il peut fonctionner localement sur des PC NVIDIA RTX, DGX Spark, DGX Station et Jetson, ainsi que sur des appareils edge, des stations de travail NVIDIA RTX PRO, des centres de données et des environnements cloud.
NeMo Switchyard est disponible sur GitHub, tandis que la prise en charge de plateformes partenaires est attendue prochainement. NVIDIA a également publié Nemotron-RL-Agentic-Terminal-Pivot, un jeu de données d’apprentissage par renforcement agentique utilisé pour le post-entraînement des capacités d’agents de programmation.
Pour les organisations de cybersécurité, l’intérêt immédiat tient à l’accès à un modèle ouvert et à une couche de routage adaptables à leurs données, leurs outils et leurs flux de travail internes. Avant un déploiement, elles devront valider sur leurs propres tâches la politique de routage, la qualité du modèle et les garde-fous ; l’annonce ne précise ni le périmètre de cette évaluation ni les détails de mise en œuvre.
Nemotron 3.5 Lightning et NeMo Switchyard forment ainsi une proposition d’infrastructure où chaque tâche peut être orientée vers un modèle différent. Les gains de vitesse et de coût annoncés sont significatifs, mais ils restent liés aux charges de travail, aux choix de routage et aux benchmarks utilisés pour les mesurer.
