NVIDIA lance Nemotron 3.5 Lightning
NVIDIA a officiellement publié Nemotron 3.5 Lightning 30B-A3B, un modèle à poids ouverts destiné principalement aux workflows agentiques. Il dispose de 30 milliards de paramètres au total, mais seulement environ 3 milliards sont activés pour chaque token.
C'est le principe du Mixture-of-Experts (MoE) : plutôt que de faire travailler tout le modèle à chaque opération, NVIDIA active seulement une partie des « experts » nécessaires.
En simplifiant :
30 milliards de paramètres disponibles
↓
≈ 3 milliards activés à chaque étape
↓
moins de calcul
↓
inférence plus rapide et moins coûteuse
↓
≈ 3 milliards activés à chaque étape
↓
moins de calcul
↓
inférence plus rapide et moins coûteuse
Mais pourquoi NVIDIA a-t-il créé ce modèle ?
Parce que les agents IA ne fonctionnent pas comme un chatbot classique.
Un chatbot peut avoir besoin d'une seule génération :
« Résume ce document. »
Un agent peut effectuer quelque chose comme :
Analyser la demande
↓
Appeler une API
↓
Lire le résultat
↓
Vérifier le résultat
↓
Appeler un autre outil
↓
Demander l'aide d'un sous-agent
↓
Vérifier encore
↓
Produire le résultat final
↓
Appeler une API
↓
Lire le résultat
↓
Vérifier le résultat
↓
Appeler un autre outil
↓
Demander l'aide d'un sous-agent
↓
Vérifier encore
↓
Produire le résultat final
Un agent peut donc générer énormément de tokens et effectuer énormément d'appels au modèle.
NVIDIA explique justement que les agents longue durée passent une grande partie de leur temps dans des tâches d'exécution à volume élevé : appels d'outils, validation des résultats et délégation à des sous-agents.
Et c'est précisément là que Lightning intervient.
La philosophie : ne pas utiliser un modèle géant pour chaque opération
Imagine un agent qui utilise GPT-5.6 ou Claude pour absolument toutes ses opérations.
Ce serait extrêmement puissant, mais potentiellement coûteux et lent.
Avec une architecture comme celle proposée par NVIDIA, on peut imaginer :
Modèle frontier
→ raisonnement complexe / décision importante
→ raisonnement complexe / décision importante
Nemotron 3.5 Lightning
→ appels d'outils / vérifications / tâches répétitives
→ appels d'outils / vérifications / tâches répétitives
Petit modèle spécialisé
→ classification / extraction / routage
→ classification / extraction / routage
C'est une architecture beaucoup plus efficace.
Et NVIDIA pousse justement cette logique avec NeMo Switchyard, qui permet de router les différentes tâches d'un agent vers différents modèles.
Une architecture assez particulière
Nemotron 3.5 Lightning combine plusieurs technologies :
Mamba-2 + Mixture-of-Experts + Attention
NVIDIA décrit son architecture comme une architecture hybride LatentMoE, combinant des couches Mamba-2 et MoE avec certaines couches d'attention.
Le modèle peut également gérer jusqu'à 1 million de tokens de contexte.
C'est particulièrement intéressant pour les agents qui doivent conserver beaucoup d'informations au cours d'une longue session.
Par exemple :
« Analyse cette base documentaire, consulte 40 fichiers, utilise plusieurs outils et garde le contexte de ton travail. »
Un contexte d'un million de tokens peut devenir extrêmement utile pour ce type de workflow.
Et il peut fonctionner localement
C'est un autre élément important.
NVIDIA positionne Lightning pour des déploiements relativement légers, notamment sur un seul GPU dans certaines configurations.
NVIDIA propose également son intégration via NIM, avec une API compatible avec les standards OpenAI, ce qui facilite son intégration dans des applications existantes.
Donc un développeur peut potentiellement avoir :
Application
↓
Agent IA
↓
Nemotron 3.5 Lightning localement
↓
Outils / API / base de données
↓
Agent IA
↓
Nemotron 3.5 Lightning localement
↓
Outils / API / base de données
sans nécessairement envoyer chaque opération vers un modèle propriétaire dans le cloud.
NVIDIA mise aussi sur les modèles ouverts
Nemotron 3.5 Lightning est distribué comme open-weight. NVIDIA fournit également les éléments nécessaires à son utilisation dans son écosystème de développement.
C'est stratégique.
NVIDIA ne veut pas uniquement vendre les GPU sur lesquels les modèles tournent.
L'entreprise construit progressivement :
GPU → infrastructure → modèles → outils → agents
C'est une stratégie beaucoup plus large.
Et il y a un enjeu géopolitique
NVIDIA explique depuis plusieurs mois vouloir renforcer l'écosystème des modèles à poids ouverts, notamment face à la progression des modèles open-weight chinois. Plusieurs analystes voient Nemotron comme une partie de cette stratégie.
Le marché devient donc de plus en plus compétitif :
OpenAI → modèles propriétaires
Anthropic → modèles propriétaires
Google → Gemini
Meta → open-weight
DeepSeek / autres acteurs chinois → open-weight
NVIDIA → open models + infrastructure
Anthropic → modèles propriétaires
Google → Gemini
Meta → open-weight
DeepSeek / autres acteurs chinois → open-weight
NVIDIA → open models + infrastructure
Et NVIDIA possède évidemment un avantage énorme : les GPU sur lesquels ces modèles sont exécutés.

Grok 4.6 : xAI veut passer du chatbot à l’agent IA
xAI présente Grok 4.6 comme une évolution de Grok 4.5 particulièrement axée sur les agents capables de travailler longtemps sur une tâche complexe.
L'idée n'est plus seulement :
« Pose une question → l'IA répond. »
Mais plutôt :
« Donne-moi un objectif → l'IA travaille dessus, utilise des outils, analyse les résultats, corrige ses erreurs et continue jusqu'à obtenir un résultat. »
xAI met notamment en avant le travail sur de longues tâches, le développement logiciel, la recherche et les expériences interactives et visuelles.
Un gros accent sur le développement logiciel
C'est probablement l'un des aspects les plus intéressants de cette sortie.
Grok 4.6 est conçu pour pouvoir travailler sur des bases de code importantes, comprendre plusieurs fichiers, effectuer des modifications et poursuivre une tâche sur plusieurs étapes.
Les premiers résultats publiés autour du modèle montrent notamment une progression importante sur DeepSWE 1.1, où Grok 4.6 atteint 65,9 %, contre 54 % pour Grok 4.5 selon les données rapportées.
Cela place Grok directement dans la compétition des modèles destinés aux AI coding agents, aux côtés des modèles utilisés par des outils comme Cursor et Devin.
🧠 Des performances au niveau des meilleurs modèles
Un chiffre attire particulièrement l'attention.
Selon Artificial Analysis, Grok 4.6 obtient 61 sur son Intelligence Index, soit le même score que GPT-5.6 Sol dans leur classement.
Il ne s'agit évidemment pas de dire que Grok 4.6 est « meilleur que GPT-5.6 » dans tous les domaines : les benchmarks mesurent des capacités différentes et leurs résultats dépendent de la méthodologie.
Mais atteindre le niveau des modèles de pointe tout en étant proposé à un prix beaucoup plus bas est particulièrement intéressant.
💰 Et le prix est l'une des surprises
Pour l'API, Grok 4.6 est annoncé autour de :
$2 / million de tokens en entrée
$6 / million de tokens en sortie
$6 / million de tokens en sortie
Les comparaisons publiées montrent un coût nettement inférieur à certains modèles frontier concurrents.
Pour les développeurs, cela peut être extrêmement important.
Parce qu'un agent IA consomme potentiellement énormément de tokens : il peut réfléchir, appeler des outils, lire des fichiers, modifier du code, vérifier son travail et recommencer.
Le coût par tâche devient donc presque aussi important que la qualité du modèle.
Grok 4.6 devient également plus « visuel »
xAI insiste sur les capacités interactives et visuelles du modèle.
Cela ouvre la porte à des agents capables non seulement de comprendre du texte et du code, mais aussi d'interagir avec des environnements visuels et de construire des expériences interactives.
C'est une évolution importante vers des agents capables de fonctionner dans des environnements beaucoup plus proches de ceux utilisés par les humains.
Où peut-on utiliser Grok 4.6 ?
Au lancement, xAI indique notamment une disponibilité via :
- Grok Build
- Cursor
- l'API xAI
- OpenRouter
- Vercel
- Cloudflare
Donc pour les développeurs, ce n'est pas simplement une nouvelle version de l'application Grok : xAI cherche clairement à faire de Grok 4.6 une brique pour construire des applications et des agents.
Ce que cette annonce signifie pour l'industrie
Chatbots
↓
Modèles de raisonnement
↓
Agents IA
↓
Agents capables de travailler pendant des heures sur un objectif
↓
Modèles de raisonnement
↓
Agents IA
↓
Agents capables de travailler pendant des heures sur un objectif