Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

Cette actualité fait partie d'une fiche comparative plus complète. Voir la fiche comparative →

Nvidia Nemotron 3.5 Lightning : rapidité record pour l'IA générative

1 min de lecture · The Decoder · 11 août 2026 · IA générative · Pertinence : élevée
Nvidia Nemotron 3.5 Lightning : rapidité record pour l'IA générative

Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.

Nvidia dévoile Nemotron 3.5 Lightning, un modèle open-weight hybride Mamba-Transformer de 31,6 milliards de paramètres. Avec un score de 24 sur l'Intelligence Index (égal à GPT-OSS-120B) et une vitesse de 670 tokens/s, il surpasse ses concurrents en rapidité. Ses performances sur les benchmarks agentiques (Elo 824) en font un outil prometteur pour les pipelines automatisés.

« Nemotron 3.5 Lightning scores 24 on the Artificial Analysis Intelligence Index, tying with gpt-oss-120b. » - Matthias Bastian, The Decoder · 11 août 2026 · Voir l'article original →

Que faut-il retenir ?

  • Nemotron 3.5 Lightning atteint 670 tokens par seconde, soit le débit le plus élevé parmi les modèles comparés.
  • Le modèle obtient un score de 24 sur l'Intelligence Index, égal à GPT-OSS-120B.
  • Sur GDPval-AA v2, Lightning atteint un Elo de 824, surpassant GPT-OSS-120B (800).
  • Le modèle utilise seulement 3,6 milliards de paramètres actifs sur 31,6 milliards totaux.

Pourquoi cette nouvelle compte-t-elle ?

Nemotron 3.5 Lightning représente une avancée majeure pour les applications nécessitant rapidité et efficacité, comme les pipelines agentiques. Ses performances rivalisent avec des modèles plus grands tout en consommant moins de ressources. Son licence ouverte (OpenMDW-1.1) le rend accessible pour des usages commerciaux et industriels, potentiellement réduisant les coûts d'inférence.

670 tokens par seconde

Public concerné : développeurs, entreprises

Quels sont les avantages de Nemotron 3.5 Lightning par rapport aux autres modèles d'IA ?

Nemotron 3.5 Lightning combine rapidité (670 tokens/s) et efficacité (3,6 milliards de paramètres actifs) tout en égalant des modèles plus grands comme GPT-OSS-120B en performance. Son architecture hybride et sa licence ouverte en font un choix optimal pour les applications nécessitant un traitement rapide à moindre coût.

🔧 Outils mentionnés

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !