La puissance de calcul investie dans l'entraînement de GPT-4, sorti en 2023, représentait environ 2,1×10²⁵ opérations en virgule flottante (FLOP) selon l'institut de recherche Epoch AI, et le Stanford HAI a estimé le coût de ce calcul à environ 78 millions de dollars. Même le seul entraînement de l'ancien GPT-3 a consommé environ 1 287 MWh d'électricité (estimation de chercheurs de Google en 2021) — plus d'un siècle de consommation d'un foyer moyen, pour construire un seul modèle. Derrière le banal « dis, résume-moi ça » que nous tapons se cache un monde de physique et de liasses de billets.

Cet article creuse en profondeur "le fonctionnement réel d'un LLM (grand modèle de langage)", sous trois angles : mécanisme, énergie et argent. Plus précisément — (1) pourquoi un LLM peut-il produire du langage à partir d'un ensemble de boutons appelés "poids (paramètres)", (2) combien d'électricité une question ou une session d'entraînement consomme-t-elle, et (3) l'affirmation selon laquelle "le développement de LLM de pointe est une guerre d'argent" est-elle vraie ? La réponse courte à la troisième : "Pour l'extrême pointe, c'est essentiellement vrai — mais un contre-courant où 'l'argent seul ne suffit pas' s'est renforcé en 2026." Voilà le tableau exact.

Ma position d'emblée : l'"intelligence" d'un LLM n'est ni magie ni conscience — c'est le résultat d'une gigantesque machine à prédiction de probabilités façonnée à coups d'électricité. Comprendre le mécanisme dissout à la fois l'enthousiasme excessif et la peur excessive. Cet article va jusqu'à un niveau intermédiaire. Si vous partez de "qu'est-ce qu'un LLM au juste", lisez d'abord qu'est-ce qu'un LLM (introduction) ; pour la longueur de contexte voyez la fenêtre de contexte ; pour les tarifs voyez l'API d'IA pour débutants.

FONCTIONNEMENT DES LLM · POIDS × ÉNERGIE × ARGENT

Disséquer un LLM sous trois angles

— De quoi est faite l'intelligence, l'énergie qu'elle brûle, l'argent qu'elle coûte

Mécanisme
Les poids prédisent le mot suivant
Des centaines de milliards à plus de 1 000 milliards de boutons qui calculent juste des probabilités
Énergie
Une requête ≈ 0,2–29 Wh
Une session d'entraînement = 100+ années-foyer d'électricité
Argent
78–191 M$ en 2023
D'ici 2027, des entraînements de plus de 1 Md$ sont anticipés

L'intelligence d'un LLM n'a rien de magique. Elle est le résultat d'une gigantesque machine à probabilités façonnée à coups d'énergie et d'argent.
Connaissez le mécanisme, et l'enthousiasme comme la peur se dissolvent.

1. Un LLM ne fait que deviner sans cesse "le mot suivant"

Cela peut surprendre, mais ChatGPT, Claude et Gemini font tous essentiellement une seule chose. "À partir du texte jusqu'ici, calculer la probabilité du mot le plus vraisemblable (plus précisément, du 'token') comme suite, en choisir un, et les aligner." C'est tout. Donnez-lui "le chat est sur le ___" et il attribue des probabilités à des candidats comme "tapis", "canapé", "sol" et émet celui de plus haute probabilité (ou un échantillonné selon la probabilité). Il répète cela un token à la fois jusqu'à ce que le texte se termine.

Voici la question qui déroute beaucoup de gens. "Comment un simple jeu de devinette de mots peut-il résumer des articles ou écrire du code ?" La réponse : "Pour vraiment deviner le mot suivant avec précision, il n'a d'autre choix que de 'comprendre' la structure du monde dans une certaine mesure." Deviner "la capitale du Japon est ___" exige de la géographie ; "3 + 5 = ___" exige de l'arithmétique ; "la cause de ce bug est ___" exige des connaissances en programmation détenues en interne. Comme sous-produit de l'entraînement à l'extrême de la "devinette du mot suivant" sur d'énormes quantités de texte, des connaissances et un raisonnement émergent. Telle est la nature étrange et essentielle des LLM.

Alors, qu'est-ce qui calcule cette "probabilité du mot suivant" ? Comme annoncé, l'acteur principal est une pile vertigineuse de nombres appelés "poids (paramètres)". Le chapitre suivant révèle ce qu'ils sont.

2. Que sont les "poids" ? — Mille milliards de boutons font l'intelligence

Pour résumer l'intérieur d'un LLM en une analogie : "un gigantesque dispositif de calcul doté de centaines de milliards à plus de mille milliards de 'boutons'." Chaque bouton est un "poids (paramètre)", et lorsque le signal d'un mot d'entrée passe à la couche suivante, il décide "quels signaux renforcer ou affaiblir, et de combien". GPT-3 en avait environ 175 milliards ; les derniers modèles de pointe dépasseraient les mille milliards. Le réglage de ces innombrables boutons est exactement ce qu'est la "connaissance" apprise du modèle.

POIDS

Comment les "poids" se transforment en langage

① Tokeniser
Découper le texte en fragments de mots (tokens) et convertir en vecteurs numériques
② Passer par les poids
Des dizaines de couches Transformer transforment les signaux en multipliant les poids
③ Attention
Les poids jugent sur quels mots de la phrase se concentrer
④ Sortir les probabilités
Calculer la distribution de probabilité du token suivant et en choisir un

"Apprendre", c'est le travail consistant à tourner peu à peu ces mille milliards de boutons vers la bonne réponse.
Le réglage final des boutons (les poids) = la "connaissance" même du modèle.

Le Transformer, apparu en 2017, est le fondement des LLM modernes. Son cœur est le mécanisme d'"Attention", qui juge dynamiquement par les poids "quel mot de la phrase importe pour le mot courant". Que "banque" dans "j'ai vu la rivière devant la banque" désigne un établissement financier ou une berge se décide en pondérant sa relation aux autres mots du contexte — et cette "pondération dépendante du contexte" est précisément la raison pour laquelle un LLM peut renvoyer des réponses cohérentes même sur de longs passages. Quand on dit "un truc à propos de pondération", on parle exactement de cette Attention et des milliers de milliards de multiplications qui la sous-tendent.

Le point crucial : ces poids n'ont pas été réglés à la main. Au départ, ils ne sont qu'un amas de nombres aléatoires, dénués de sens. Le sens y est instillé par l'"apprentissage". Alors, comment cet apprentissage se déroule-t-il ?

3. Deux étapes d'apprentissage — pré-entraînement et post-entraînement (RLHF)

L'apprentissage d'un LLM se divise globalement en deux étapes — le processus par lequel les "boutons aléatoires" du chapitre précédent deviennent des "boutons intelligents".

Étape 1 : pré-entraînement. On lui donne du texte à l'échelle d'Internet (livres, web, code) et on lui fait inlassablement "deviner le mot suivant". À chaque erreur, tous les paramètres sont ajustés d'une infime quantité dans la direction qui réduit l'erreur (cet algorithme d'ajustement est la fameuse "rétropropagation + descente de gradient"). Répétez cela sur des milliers de milliards de tokens, et les fondations de la grammaire, des connaissances et du raisonnement se gravent dans les boutons. Le pré-entraînement consomme l'essentiel de la puissance de calcul, de l'énergie et de l'argent. Les astronomiques ~2×10²⁵ FLOPs d'un modèle de classe GPT-4 se brûlent ici.

Étape 2 : post-entraînement (post-training). Un modèle seulement pré-entraîné est « savant mais mal élevé ». On lui apprend donc, avec le RLHF (apprentissage par renforcement à partir de retours humains) et des méthodes proches, « des façons utiles et sûres de répondre ». Depuis 2025 environ, les laboratoires investissent aussi beaucoup dans le post-entraînement qui exerce le raisonnement long (réfléchir posément), l'usage d'outils et le comportement agentique. Si les modèles récents « réfléchissent avant de répondre », c'est grâce à cette évolution du post-entraînement. Le comportement multi-agent est lui aussi inculqué à ce stade.

4. L'inférence — l'instant où votre question devient de l'électricité

Si l'entraînement est "le chantier de réglage des boutons", alors l'inférence est "l'exploitation consistant à produire réellement des réponses à l'aide des boutons finalisés". Chaque fois que vous tapez une question dans ChatGPT, des milliers de milliards de multiplications parcourent près de mille milliards de boutons, et les tokens sont générés un à la fois. Nous avons vu à quel point l'entraînement est lourd — mais à l'échelle de la société dans son ensemble, c'est l'inférence, et non l'entraînement, qui dévore l'énergie.

La raison est simple : l'entraînement n'a fondamentalement lieu qu'une fois par modèle, mais l'inférence s'exécute des centaines de millions de fois par jour dans le monde. Sur toute la durée de vie d'un modèle, la demande cumulée d'énergie et de calcul pèse donc bien plus lourd du côté de l'inférence que de l'entraînement. "Une question, ce n'est presque pas d'électricité" — vrai, une seule est minuscule. Mais "minuscule × des centaines de millions × chaque jour" s'additionne en un problème énergétique à l'échelle d'une nation. Regardons des chiffres concrets ensuite.

5. L'énergie — combien d'électricité un LLM consomme-t-il ?

On dit souvent que "l'IA dévore l'énergie", mais combien exactement ? Voici les chiffres représentatifs publiés en 2026.

ÉLECTRICITÉ

La consommation des LLM en chiffres

Une requête (courte)
0,42Wh
classe GPT-4o
une question courte
Un raisonnement lourd
29Wh+
modèle le plus lourd, prompt long
plus de 65x le plus efficace
Entraîner GPT-3
1,287MWh
550t+ CO2
(une ancienne génération)
Énergie mondiale des DC
415→945
TWh
prévision 2024→2030

Même une requête courte (0,42Wh), portée à 700 M/jour, équivaut à la consommation de ~35 000 foyers américains (estimation de tiers).
Les racks de centres de données consomment en moyenne moins de 8kW (enquête 2024 de l'Uptime Institute), contre environ 120kW pour un rack NVIDIA DGX GB200 dédié à l'IA (documentation NVIDIA) ; un site de DC d'IA va de moins de 50MW à plus de 1GW (données de suivi d'Epoch AI).

Ce qui frappe, c'est que « la consommation varie de plusieurs ordres de grandeur selon le modèle et la longueur du prompt ». Dans des estimations de tiers (voir le tableau ci-dessous), beaucoup de modèles consomment moins de 0,5 Wh pour une question courte, mais un prompt long envoyé aux modèles les plus gourmands dépasse 29 Wh, soit plus de 65 fois les plus efficaces. Comme évoqué dans le piège des tokens consommés comme mesure du travail, « tout faire avec le modèle le plus puissant » est un luxe, en électricité comme en coût. Confier les petites tâches à un modèle léger, c'est bon pour la planète et pour le portefeuille. Selon l'Agence internationale de l'énergie (AIE), la consommation électrique mondiale des centres de données a atteint environ 415 TWh en 2024 (environ 1,5 % du total mondial) et devrait doubler pour atteindre environ 945 TWh d'ici 2030, l'IA étant le principal moteur de cette hausse.

L'« électricité par requête » dépend de qui l'a mesurée, et comment

Les chiffres « X Wh par requête » sont très cités, mais ils sont obtenus de manières totalement différentes selon la source. Mieux vaut lire séparément les mesures des entreprises elles-mêmes et les estimations extérieures.

ChiffreCe qu'il couvreSourceMéthode
0,24WhUn prompt texte dans l'app Gemini (médiane)Google (août 2025, article interne)Mesuré dans ses propres centres de données, y compris les machines inactives et les dépenses annexes du centre de données
~0,34WhUne requête ChatGPT (moyenne)Blog de Sam Altman, PDG d'OpenAI (juin 2025)Chiffre de l'entreprise elle-même ; la méthode n'a pas été publiée
0,42WhUn prompt court envoyé à GPT-4oJegham et al. (tiers, 2025)Estimé à partir des performances publiques de l'API et de configurations matérielles déduites
29Wh+Un prompt long envoyé aux modèles les plus gourmandsIdemIdem ; plus de 65 fois les modèles les plus efficaces

Les mesures des entreprises reposent sur des conditions homogènes mais ne peuvent pas être vérifiées de l'extérieur ; les estimations de tiers se comparent plus facilement mais reposent sur davantage d'hypothèses. Dans les deux cas, ce sont des valeurs pour une seule requête texte : lire de longs documents, générer des images ou des vidéos et les longues tâches d'agents consomment davantage.

Rapporter ces chiffres à votre propre usage donne un ordre de grandeur. Si vous posez 50 questions courtes par jour, 0,24–0,42 Wh × 50 donne environ 12–21 Wh par jour, à peu près une ampoule LED de 10 W allumée une à deux heures. À l'inverse, un seul prompt long envoyé à un modèle lourd peut dépasser 29 Wh. Ce qui pèse sur l'électricité, c'est moins le nombre de questions que le modèle choisi et le temps de réflexion qu'on lui demande.

6. "Le développement est une guerre d'argent" est-ce vrai ?

Voici la question qui vous intriguait le plus. "Le développement de LLM de pointe est-il une guerre d'argent ?" La conclusion vérifiée d'abord : "Limité au pré-entraînement de la pointe, c'est essentiellement vrai." Les chiffres le confirment.

GUERRE D'ARGENT

Trajectoire du coût d'entraînement de pointe

GPT-3 (2020)
~ 3×10²³ FLOPs. Hors normes pour son époque
GPT-4 (2023)
~ 2,1×10²⁵ FLOP, calcul ~78 M$
2023 Gemini Ultra
calcul ~191 M$ (AI Index 2024)
Prévision 2027
les plus gros entraînements dépassant 1 Md$

Le calcul d'entraînement à la pointe croît de 4 à 5x par an (Epoch AI).
Le coût d'entraînement augmente de 2,4x par an — une vraie bataille d'argent.

Concrètement, l'AI Index 2024 du Stanford HAI a estimé le coût de calcul de l'entraînement à environ 78 millions de dollars pour GPT-4 et environ 191 millions pour Gemini Ultra de Google (AI Index 2024). Un article de l'institut de recherche Epoch AI montre que le coût d'entraînement des plus grands modèles croît de 2,4 fois par an depuis 2016 et que, si la tendance se poursuit, les plus gros entraînements coûteront plus d'un milliard de dollars d'ici 2027 (Cottier et al.). Et il s'agit d'« une session réussie » : derrière s'empilent les essais ratés, la préparation des données, les salaires et l'infrastructure d'inférence. De plus, chaque GPU coûte des milliers de dollars ; en faire tourner des dizaines de milliers pendant des mois fait exploser la facture d'électricité. Un mur d'argent qu'« une idée brillante » ou « un algorithme astucieux » ne peuvent à eux seuls jamais franchir se dresse à l'entrée de la pointe. En ce sens, la « bataille d'argent » n'est pas une exagération, c'est un fait. Voilà pourquoi seule une poignée d'acteurs ayant réuni des capitaux énormes — OpenAI, Google, Anthropic, Meta, xAI — peut se battre en première ligne.

7. Mais l'argent seul ne suffit pas — le reflux de l'efficience

Le chapitre précédent disait "la guerre d'argent est réelle". Mais clore l'histoire là-dessus reviendrait à mal interpréter la réalité de 2026. Il n'est nullement vrai qu'"avec assez d'argent on gagne" — si tant est, un contre-courant s'est renforcé. En guise de réponse honnête, laissez-moi écrire cet autre versant aussi.

Le cas emblématique est la série de coups où le chinois DeepSeek a sorti des modèles proches de la pointe avec un budget relativement modeste, et a été décrit comme ayant « remis à zéro le plancher des coûts ». Des techniques permettant d'obtenir les mêmes performances pour un coût inférieur de plusieurs ordres de grandeur — architectures efficaces, mélange d'experts (MoE), distillation (transférer le savoir d'un grand modèle vers un petit), travail soigné sur la qualité des données — ont été démontrées les unes après les autres, enfonçant un coin dans la formule « capital énorme = victoire ». L'attention du secteur s'élargit de « toujours plus gros » à « comment offrir les mêmes performances pour moins cher et avec moins d'énergie ».

Le tableau exact est donc celui-ci : "La course à la mise à jour des 'performances de pointe' est une guerre d'argent. Mais la course à la livraison de performances 'suffisamment bonnes' à bas coût est une lutte d'esprit et d'efficience." La plupart des modèles que nous utilisons au quotidien bénéficient de la seconde, devenant moins chers, plus rapides et plus économes en énergie année après année. Comme écrit dans jusqu'où on peut aller avec l'offre gratuite, d'ici 2026 même les offres gratuites ont atteint un niveau pratique — un fruit tendu aux utilisateurs par le reflux de l'efficience.

8. La suite — le mur de "l'énergie et de la physique" après l'argent

Alors, peut-on monter à l'échelle indéfiniment juste en empilant l'argent ? Non — et c'est le nouveau mur qui a commencé à apparaître en 2026. Une analyse d'Epoch AI (août 2024) estime que des entraînements d'environ 2×10²⁹ FLOP seront probablement réalisables d'ici 2030, mais que la contrainte qui jouera sans doute en premier est l'électricité, suivie de la capacité de fabrication des puces. Le goulot d'étranglement n'est plus seulement "le budget pour acheter des GPU". Ce qui bloque le chemin, c'est plutôt —

  • Énergie : peut-on fournir en continu une électricité à l'échelle du gigawatt en un seul lieu ? Désormais un problème de centrales électriques et de réseaux
  • Interconnexion : la bande passante pour synchroniser des dizaines à des centaines de milliers de GPU sans latence. Il existe un plafond physique à ce qu'un seul gigantesque travail d'entraînement peut gérer
  • Données : le texte d'entraînement de haute qualité se tarit lui-même (il y a une limite à la quantité de bons écrits que l'humanité a produits)

Ce qui vient après "la guerre d'argent", c'est "une guerre d'énergie, de physique et d'esprit". C'est pourquoi les entreprises se tournent désormais vers l'investissement dans le nucléaire, le développement de leurs propres puces dédiées, l'exploitation de données synthétiques et la recherche d'architectures efficientes. L'ère où l'on pouvait gagner en jetant de l'argent se mue, ironiquement, en une ère où l'on ne peut pas gagner avec l'argent seul.

Résumé

La vraie nature d'un LLM est "un gigantesque dispositif de prédiction où des centaines de milliards à plus de mille milliards de 'poids' calculent sans cesse la probabilité du mot suivant". L'Attention du Transformer gère la "pondération dépendante du contexte", et le pré-entraînement (qui consomme l'essentiel du calcul, de l'énergie et de l'argent) plus le post-entraînement (RLHF, entraînement au raisonnement) rendent les boutons intelligents. L'intelligence n'a rien de magique — c'est un sous-produit de l'entraînement à l'extrême de la "devinette du mot suivant" sur d'énormes quantités de texte.

Côté électricité : une requête consomme 0,24 Wh (médiane) selon la mesure interne de Google, une requête courte 0,42 Wh selon une estimation de tiers, et un prompt long aux modèles les plus lourds dépasse 29 Wh (plus de 65 fois le plus efficace) ; le seul entraînement de GPT-3 a pris 1 287 MWh. À l'échelle de la société, la consommation liée à l'inférence s'accumule, et l'électricité des centres de données mondiaux devrait doubler pour atteindre environ 945 TWh d'ici 2030 (AIE). « Tout faire avec le modèle le plus puissant » est un luxe en électricité comme en coût ; le bon réflexe est de choisir le modèle selon le poids de la tâche.

Et la question centrale — « le développement des LLM est-il une bataille d'argent ? » La réponse est « essentiellement vrai, pour le pré-entraînement de pointe » (environ 78 M$ de calcul pour GPT-4 ; plus de 1 Md$ par entraînement anticipé d'ici 2027). Mais le contre-courant du « l'argent seul ne suffit pas » est fort aussi (la remise à zéro du plancher des coûts par DeepSeek, l'efficacité, la distillation). Repousser les performances maximales est une bataille d'argent ; offrir des performances pratiques à bas coût est une bataille d'ingéniosité — cette structure à deux étages est la réalité de 2026. Et la suite, c'est le mur physique de l'énergie, de l'interconnexion et de la pénurie de données. Voir un LLM non comme une « boîte magique » mais comme une « machine probabiliste alimentée à l'électricité » évite de se laisser emporter par l'engouement comme par la peur. Pour aller plus loin, voyez qu'est-ce qu'un LLM (introduction), la fenêtre de contexte et le comparatif des offres gratuites.

FAQ

Q. Plus de paramètres (poids) signifie-t-il toujours plus intelligent ?
A. "Plus gros était plus intelligent" a longtemps valu presque universellement, mais en 2026 ce n'est plus si simple. Même à nombre de paramètres égal, les performances varient grandement selon la qualité des données, le post-entraînement et l'ingéniosité architecturale. Les modèles petits-mais-intelligents (produits de la distillation et d'une conception efficiente) se sont multipliés, et "nombre de paramètres = intelligence" ne tient plus. Nous sommes entrés dans une ère du "comment c'est entraîné" plutôt que du "combien".

Q. Un LLM "comprend"-il vraiment, ou est-ce de la mémorisation par cœur ?
A. Même les experts ne sont pas d'accord — c'est une question difficile. Ce qui est certain, c'est qu'"il montre une généralisation que la mémorisation par cœur ne peut expliquer" (il résout des problèmes absents de son entraînement). Que ce soit "la même compréhension du sens que les humains" est une question distincte sans réponse claire. En pratique, traitez-le comme "un dispositif de prédiction extrêmement avancé qui se comporte comme s'il comprenait". C'est précisément pourquoi il se trompe avec autant d'assurance (hallucination).

Q. Puis-je construire mon propre LLM ?
A. "De classe pointe", c'est impossible pour un particulier (cela nécessite des centaines de millions de dollars et des dizaines de milliers de GPU). Mais entraîner un petit modèle, ou affiner un modèle ouvert existant, est faisable même pour des particuliers. De plus, la plupart des besoins pratiques sont satisfaits en utilisant des modèles existants via l'API. Il n'y a presque aucun besoin de "tout construire soi-même".

Q. La consommation d'énergie de l'IA est-elle un problème sérieux pour la planète ?
A. C'est un fait que l'ampleur devient non négligeable (l'énergie des centres de données représente environ 1,5 % de celle du monde, devant doubler d'ici 2030 — IEA). Mais l'efficience progresse aussi furieusement en parallèle ; "l'énergie par token" baisse année après année. Le problème tient moins à "l'efficience d'une requête" qu'à "la croissance explosive du volume total × fréquence". Dans quelle mesure le renouvelable, le nucléaire et les puces dédiées pourront compenser cela est l'enjeu futur.

Q. Au final, qu'est-ce qui vaut la peine d'être su en tant qu'utilisateur ?
A. Trois choses. (1) Le modèle est un "prédicteur de probabilités", il se trompe donc même sur un ton assuré (vérifiez les infos importantes). (2) Les questions lourdes coûtent cher en énergie et en argent, choisissez donc le modèle selon le poids de la tâche (les petites courses aux modèles légers). (3) Les "performances de pointe" sont une guerre d'argent, mais les "performances pratiques" deviennent moins chères et plus économes en énergie chaque année (attendre l'évolution des modèles gratuits/bon marché est aussi malin). Plus vous connaissez le mécanisme, plus vous pouvez utiliser l'IA à moindre coût et avec astuce.