Nvidia Nemotron 3.5 Lightning : rapidité record pour l'IA générative
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
Nvidia dévoile Nemotron 3.5 Lightning, un modèle open-weight hybride Mamba-Transformer de 31,6 milliards de paramètres. Avec un score de 24 sur l'Intelligence Index (égal à GPT-OSS-120B) et une vitesse de 670 tokens/s, il surpasse ses concurrents en rapidité. Ses performances sur les benchmarks agentiques (Elo 824) en font un outil prometteur pour les pipelines automatisés.
« Nemotron 3.5 Lightning scores 24 on the Artificial Analysis Intelligence Index, tying with gpt-oss-120b. » - Matthias Bastian, The Decoder · 11 août 2026 · Voir l'article original →
Que faut-il retenir ?
- Nemotron 3.5 Lightning atteint 670 tokens par seconde, soit le débit le plus élevé parmi les modèles comparés.
- Le modèle obtient un score de 24 sur l'Intelligence Index, égal à GPT-OSS-120B.
- Sur GDPval-AA v2, Lightning atteint un Elo de 824, surpassant GPT-OSS-120B (800).
- Le modèle utilise seulement 3,6 milliards de paramètres actifs sur 31,6 milliards totaux.
Pourquoi cette nouvelle compte-t-elle ?
Nemotron 3.5 Lightning représente une avancée majeure pour les applications nécessitant rapidité et efficacité, comme les pipelines agentiques. Ses performances rivalisent avec des modèles plus grands tout en consommant moins de ressources. Son licence ouverte (OpenMDW-1.1) le rend accessible pour des usages commerciaux et industriels, potentiellement réduisant les coûts d'inférence.
670 tokens par seconde
Public concerné : développeurs, entreprises
Quels sont les avantages de Nemotron 3.5 Lightning par rapport aux autres modèles d'IA ?
Nemotron 3.5 Lightning combine rapidité (670 tokens/s) et efficacité (3,6 milliards de paramètres actifs) tout en égalant des modèles plus grands comme GPT-OSS-120B en performance. Son architecture hybride et sa licence ouverte en font un choix optimal pour les applications nécessitant un traitement rapide à moindre coût.
🔧 Outils mentionnés