
Après la course à l’entraînement, la bataille de l’inférence

Pendant plusieurs années, la compétition dans l’intelligence artificielle s’est racontée avec des chiffres toujours plus grands : davantage de paramètres, davantage de GPU, davantage de données, des datacenters toujours plus gigantesques et des milliards de dollars investis pour entraîner les modèles les plus performants.
Cette course n’est évidemment pas terminée. Mais une autre bataille est en train de prendre de l’importance : celle qui commence une fois le modèle entraîné.
Car avoir construit une intelligence artificielle ne suffit pas. Encore faut-il pouvoir la faire travailler, rapidement, pour des millions d’utilisateurs et des milliards de requêtes, sans transformer chaque réponse en petit gouffre énergétique et financier.
Bienvenue dans la bataille de l’inférence.
L’inférence, c’est simplement une IA qui travaille
Le mot peut paraître technique. Le principe ne l’est pas vraiment.
L’entraînement est la phase pendant laquelle un modèle apprend. On lui fait absorber d’immenses quantités de données et l’on ajuste progressivement ses paramètres. Cette opération peut mobiliser des milliers de processeurs pendant des semaines ou des mois.
L’inférence, c’est ce qui se passe ensuite, lorsque nous utilisons le modèle entraîné.

La comparaison avec l’éducation est imparfaite, mais assez parlante : l’entraînement ressemble aux années passées à apprendre un métier ; l’inférence correspond aux années passées à l’exercer.
Et économiquement, cette distinction change beaucoup de choses.
L’entraînement représente un investissement gigantesque mais ponctuel. L’inférence constitue au contraire une dépense répétitive : chaque prompt, chaque réponse, chaque résumé, chaque recommandation ou décision automatisée remet la machine au travail.
Pendant longtemps, toute l’attention s’est portée sur le coût spectaculaire de la première opération. À mesure que l’IA se généralise, c’est la multiplication de la seconde qui devient stratégique.
Le prochain milliard de requêtes compte davantage que votre dernière requête
À l’échelle d’un utilisateur, le coût d’une réponse générée par une IA peut sembler négligeable.
À l’échelle de millions d’utilisateurs, il ne l’est plus du tout.
C’est un changement classique dans l’histoire de l’informatique. Une opération quasiment gratuite devient un enjeu industriel dès lors qu’on la répète quelques milliards de fois.
C’est précisément le basculement décrit par Matthew S. Smith dans The AI Inference Revolution Is Here, publié par IEEE Spectrum en septembre 2026. Après plusieurs années dominées par la course à l’entraînement de modèles toujours plus grands, l’industrie doit désormais optimiser la production massive de réponses par ces modèles.
Et les nouveaux modèles ne simplifient pas nécessairement l’équation.
Les modèles de raisonnement peuvent produire beaucoup plus de tokens avant d’arriver à une réponse. Les contextes s’allongent. Les utilisateurs attendent malgré tout des réponses quasi instantanées. Et surtout, les agents transforment une interaction qui nécessitait autrefois un appel à l’IA en une succession d’appels.
Le problème n’est donc plus seulement : quelle intelligence pouvons-nous construire ? Il devient : combien coûte chaque fois que nous la faisons travailler ?
Une réponse d’IA cache en réalité deux travaux différents
C’est ici qu’un petit détour technique devient utile.
Lorsqu’on interroge un grand modèle de langage, son travail peut grossièrement être séparé en deux phases : le prefill et le decode.
Le prefill correspond à la lecture. Le modèle reçoit votre question, vos instructions et éventuellement des documents ou l’historique de la conversation. Il doit analyser tout ce contexte avant de commencer à répondre.
Le decode correspond à l’écriture. Le modèle génère alors sa réponse progressivement, token après token.
La nuance pourrait sembler réservée aux ingénieurs. Elle est pourtant fondamentale parce que ces deux opérations n’utilisent pas le matériel de la même manière. Le prefill peut fortement exploiter la puissance de calcul parallèle des GPU. Le decode est beaucoup plus séquentiel et dépend notamment de la vitesse avec laquelle le processeur accède aux données en mémoire. (Red Hat Developer)
Imaginez une immense bibliothèque.
Pour comprendre une question, vous pouvez mobiliser simultanément une équipe entière afin qu’elle lise rapidement des milliers de pages : c’est assez proche du prefill.
Pour rédiger la réponse, en revanche, il faut avancer mot après mot tout en retournant constamment chercher les informations nécessaires dans cette gigantesque bibliothèque.
Vous pouvez avoir des chercheurs extrêmement rapides : s’ils passent leur temps à attendre que les livres arrivent, leur intelligence n’est plus le principal problème.
C’est à peu près ce qui arrive aux processeurs.
Le paradoxe du GPU qui attend
C’est probablement l’un des aspects les plus intéressants de cette nouvelle bataille.
Nous avons pris l’habitude d’associer les progrès de l’IA à une augmentation de la puissance de calcul. Plus de GPU, plus de FLOPS, plus de performances.
Mais lors de certaines phases d’inférence, le goulet d’étranglement n’est plus nécessairement la capacité à calculer. Il devient la capacité à déplacer suffisamment vite les données nécessaires au calcul.
Le modèle doit notamment accéder continuellement à ses poids et conserver en mémoire des informations issues du contexte précédent dans ce que les spécialistes appellent le KV cache. Le decode sollicite donc énormément la capacité et surtout la bande passante mémoire. (Red Hat Developer)
IEEE Spectrum rapporte ainsi que, dans certaines configurations étudiées avec des LLM open source, des GPU H100 peuvent passer 50 à 80 % de leur temps inactifs, en attendant les données nécessaires. (IEEE Spectrum)
La situation est presque ironique : après avoir dépensé des fortunes pour acheter des processeurs capables d’effectuer des quantités astronomiques de calculs, le prochain problème consiste parfois à éviter qu’ils attendent.
Dans l’IA, la mémoire pourrait ainsi devenir presque aussi stratégique que le calcul.
Il n’y aura peut-être pas une puce pour les gouverner toutes
C’est là que la bataille industrielle devient particulièrement intéressante.
Pendant la première grande vague de l’IA générative, le GPU s’est imposé comme l’instrument presque naturel de l’intelligence artificielle. Et Nvidia a énormément bénéficié de cette équation simple : IA = GPU.
L’inférence pourrait rendre l’équation beaucoup moins simple.
IEEE Spectrum décrit plusieurs approches parfois radicalement différentes. d-Matrix cherche par exemple à rapprocher mémoire et calcul. Majestic Labs explore au contraire une architecture capable d’accéder à d’immenses volumes de mémoire grâce à de nouvelles interconnexions. D’autres approches privilégient de grandes quantités de SRAM très proches des unités de calcul. (IEEE Spectrum)
Et surtout, les architectures deviennent hétérogènes.
Nvidia associe désormais sa plateforme Vera Rubin aux accélérateurs Groq 3 LPX afin de répondre notamment aux contraintes de génération rapide de tokens des systèmes agentiques. Le principe est révélateur : différentes parties d’une même charge d’inférence peuvent être confiées à des composants différents, chacun optimisé pour un type de travail. (NVIDIA Developer)
Demain, demander « quelle puce fait tourner cette IA ? » pourrait donc devenir aussi réducteur que demander aujourd’hui « quel ordinateur fait tourner Internet ? ».
La réponse sera probablement : plusieurs, chacune là où elle est la plus efficace.
Et si le meilleur calcul était celui qu’on pouvait éviter ?
Une autre façon de gagner la bataille de l’inférence consiste à prendre le problème à l’envers.
Plutôt que d’augmenter sans cesse la puissance disponible, pourquoi ne pas réduire la quantité de travail nécessaire ?
C’est notamment l’objectif de la quantification.
Les paramètres d’un modèle sont représentés par des nombres. Or tous ces nombres n’ont pas nécessairement besoin d’être manipulés avec une très grande précision. Réduire cette précision permet de diminuer la quantité de mémoire nécessaire et les volumes de données à déplacer, tout en accélérant certains calculs.
On pourrait comparer cela à une carte routière. Pour aller de Paris à Lyon, connaître la position de chaque ville au millimètre près n’apporte pas grand-chose. Une représentation légèrement moins précise peut rester parfaitement suffisante tout en étant beaucoup plus légère.
Sur DeepSeek-R1-0528, Nvidia indique par exemple qu’un passage de FP8 à son format NVFP4 conserve des résultats très proches sur sept évaluations, avec une dégradation annoncée de 1 % ou moins sur les principales mesures, tout en réduisant fortement l’empreinte mémoire. (NVIDIA Developer)
D’autres acteurs vont plus loin encore. IEEE évoque notamment Tensordyne, qui expérimente le calcul logarithmique, ou Etched, dont l’approche consiste à concevoir du silicium extrêmement spécialisé pour l’architecture Transformer. (IEEE Spectrum)
La prochaine révolution matérielle de l’IA ne consistera donc pas forcément à calculer toujours plus.
Elle pourrait aussi consister à calculer beaucoup moins, mais beaucoup mieux.
Puis arrivent les agents… et l’addition change d’échelle
Pour le MarTech, c’est probablement ici que le sujet devient le plus concret.
Avec un chatbot classique, le schéma reste relativement simple : une question entre, une réponse sort.
Un agent fonctionne différemment.
Il peut recevoir une mission, réfléchir à la manière de l’accomplir, consulter un CRM, appeler une API, analyser le résultat, effectuer une recherche, modifier son plan, interroger un autre modèle puis vérifier le résultat obtenu.
Pour l’utilisateur, il n’y avait pourtant qu’une demande :
« Prépare-moi une campagne pour réactiver les clients à risque. »
Derrière cette phrase anodine peuvent désormais se cacher des dizaines d’inférences.
C’est ce qui rend l’économie des agents très différente de celle du chatbot. Gartner estime ainsi en 2026 que le coût d’inférence par workflow agentique pourrait être multiplié par plus de cinq d’ici 2028, malgré la baisse continue du coût unitaire des modèles. L’explication tient précisément à la multiplication des étapes, des raisonnements et des tokens nécessaires à chaque tâche. (Gartner)
Voilà un paradoxe intéressant : l’IA devient moins chère à utiliser à l’unité, ce qui nous encourage à l’utiliser beaucoup plus.
Un phénomène que l’informatique connaît bien.
Du coût par token au coût par tâche
Cette évolution pourrait également changer la manière dont les entreprises évaluent leurs solutions d’IA.
Aujourd’hui, les tarifs des modèles sont volontiers comparés en coût par million de tokens. C’est utile, mais cela risque rapidement de devenir insuffisant.
Dans un contexte MarTech, ce qui compte réellement n’est pas de savoir combien coûte un token, mais combien coûte le résultat obtenu.
Combien coûte la résolution automatique d’une demande client ?
Combien coûte la création et l’optimisation d’une campagne ?
Combien coûte la qualification d’un lead ?
Combien coûte une recommandation personnalisée qui conduit effectivement à une conversion ?
Un modèle deux fois plus cher par token peut parfaitement être plus économique s’il accomplit correctement une tâche en trois étapes là où un modèle moins performant en nécessite vingt.
À l’inverse, confier systématiquement chaque microtâche au modèle le plus puissant du marché pourrait revenir à prendre un hélicoptère pour aller chercher le pain.
La sophistication des architectures MarTech pourrait donc progressivement se déplacer vers le routage intelligent : utiliser un petit modèle rapide et économique pour les tâches simples, réserver les modèles les plus coûteux aux problèmes complexes, mettre en cache ce qui peut l’être, réduire les contextes inutiles et n’activer un raisonnement approfondi que lorsqu’il apporte réellement quelque chose.
L’optimisation de l’inférence deviendrait alors non seulement un problème d’infrastructure, mais aussi un problème d’architecture applicative et économique.
L’IA pourrait devenir une nouvelle ligne du coût logiciel
C’est peut-être la conséquence la plus importante pour les éditeurs MarTech.
Le logiciel traditionnel possède des coûts relativement prévisibles : stockage, bases de données, bande passante, serveurs, licences tierces, support…
L’IA ajoute une ressource dont la consommation dépend directement de ce que font les utilisateurs — et bientôt de ce que font leurs agents en leur nom.
Un CRM classique ne déclenche pas des milliers d’opérations coûteuses simplement parce qu’un commercial lui demande de « préparer ma journée ». Un CRM agentique pourrait consulter les comptes, lire les derniers échanges, rechercher des informations externes, évaluer les opportunités, rédiger des recommandations et préparer plusieurs messages.
L’expérience utilisateur paraît extraordinairement simple.
L’infrastructure qui la produit l’est beaucoup moins.
Le coût marginal de l’intelligence devient alors une composante du modèle économique du logiciel.
Cela peut influencer les tarifs, les quotas d’utilisation, les offres premium, les choix de modèles et même la conception fonctionnelle des produits. Toutes les fonctionnalités techniquement possibles ne seront pas nécessairement économiquement pertinentes.
La bonne question ne sera donc plus seulement : « pouvons-nous ajouter de l’IA ici ? »
Mais également : « combien de fois cette IA devra-t-elle réfléchir pour créer suffisamment de valeur ? »
Après les modèles géants, les usines à intelligence
La première époque de l’IA générative nous a habitués à regarder les modèles : GPT contre Gemini, Claude contre Llama, DeepSeek contre les autres.
La suivante pourrait nous obliger à regarder davantage ce qui se trouve derrière eux.
Mémoire, bande passante, consommation électrique, quantification, accélérateurs spécialisés, logiciels d’orchestration, cache, routage entre modèles… l’inférence transforme progressivement l’IA en problème industriel.
Il ne suffit plus de disposer du meilleur moteur. Il faut construire toute l’usine capable de le faire fonctionner à grande échelle.
Et cette usine pourrait être beaucoup plus hétérogène que celle de la première génération : plusieurs modèles, plusieurs niveaux de précision, plusieurs catégories de processeurs et différentes stratégies selon que l’on privilégie la vitesse, le coût, la consommation énergétique ou la qualité.
La bataille de l’entraînement cherchait principalement à répondre à une question spectaculaire :
jusqu’où peut-on rendre les modèles intelligents ?
La bataille de l’inférence en pose une autre, peut-être moins spectaculaire mais tout aussi déterminante :
comment rendre cette intelligence suffisamment rapide, disponible et bon marché pour pouvoir l’utiliser partout ?
Pour le MarTech, la réponse sera essentielle.
Car avec les agents, nous ne nous dirigeons plus seulement vers des logiciels auxquels nous demanderons ponctuellement de réfléchir.
Nous nous dirigeons vers des logiciels qui réfléchiront en permanence.
Et quelqu’un devra payer les tokens.
Quelques références
- « The AI Inference Revolution Is Here » — IEEE Spectrum — Matthew S. Smith — septembre 2026.
- « Gartner Predicts AI Inference Costs Per Agentic Workflow Will Increase More Than Fivefold Through 2028 » — Gartner — août 2026.
- « Designing distributed AI inference: Core concepts and scaling dimensions » — Red Hat Developer — juin 2026.
- « Introducing NVFP4 for Efficient and Accurate Low-Precision Inference » — NVIDIA Technical Blog — Eduardo Alvarez, Omri Almog, Eric Chung et al. — juin 2025.
- « Inside NVIDIA Groq 3 LPX: The Low-Latency Inference Accelerator for the NVIDIA Vera Rubin Platform » — NVIDIA Technical Blog — Kyle Aubrey et Farshad Ghodsian — mars 2026.














