LLM et tokens : comment une machine écrit du texte
ChatGPT, Claude, Gemini sont des LLM. Leur seule opération : prédire le prochain token. Comment articles et code émergent, ce que sont tokens et fenêtres de contexte, et leur impact pratique.
Il est temps de se pencher sur les acteurs principaux de cette ère : les grands modèles de langage.
LLM : ce que chaque lettre signifie
Large Language Model. « Language » — il a appris à partir de textes : livres, articles, sites web, code (littéralement une grande partie d'internet). « Large » — des centaines de milliards de poids de la leçon précédente. ChatGPT, Claude, Gemini, DeepSeek sont tous des LLM de différentes entreprises, construits sur le même principe (ce même transformeur de 2017).
Le principe : prédire le prochain élément
Tout ce qu'un LLM fait est de prédire le prochain token. Vous écrivez : « La capitale de la France est ». Le modèle parcourt son vocabulaire et attribue des scores aux continuations possibles : « Paris » — 99 %, « Lyon » — 0,3 %, « banane » — 0,0001 %. Il en choisit une probable, l'ajoute au texte — et prédit le prochain fragment. Encore et encore, mot par mot, et une réponse complète prend forme.
Attendez. Si le modèle ne fait que « deviner le mot suivant » — comment peut-il écrire des essais cohérents et du code fonctionnel ?
La réponse est élégante : pour bien prédire le mot suivant dans n'importe quel texte écrit par l'humanité, le modèle a dû apprendre la grammaire, les faits, les chaînes de raisonnement, les styles et la structure du code. Prédire un mot s'est avéré être une tâche avec une « compréhension » du langage cachée en son sein. C'est la grande découverte de l'ère des LLM — et la grande source de débats sur la question de savoir si un modèle « comprend » réellement quoi que ce soit.
Tokens : la monnaie du monde des LLM
Les fragments avec lesquels un modèle travaille sont appelés tokens. Un token n'est pas toujours un mot : un mot court est un token, un mot long est découpé en plusieurs, un signe de ponctuation est un token à part entière. En moyenne, 1 token ≈ 3 à 4 caractères — mais cette règle ne s'applique qu'à l'anglais. Bon à savoir : dans d'autres langues, surtout celles qui n'utilisent pas l'alphabet latin, les tokens sont plus « chers » — souvent seulement 1 à 2 caractères chacun.
Ainsi, le même texte, sens pour sens, consomme nettement plus de tokens en dehors de l'anglais et atteint plus rapidement les limites et la fenêtre de contexte. En pratique : si vous travaillez dans une autre langue et que vous comptez les coûts ou le volume, prévoyez une marge.
Les tokens ne sont pas une abstraction — ils se manifestent en pratique :
- La fenêtre de contexte — le nombre de tokens que le modèle retient simultanément : votre question, ses réponses, les fichiers que vous avez téléchargés. Tout ce qui ne rentre pas, le modèle l'« oublie ». C'est pourquoi les longues conversations perdent leur début.
- Le prix — lorsque vous intégrez un modèle à votre propre logiciel (c'est ce qu'on appelle une API), vous payez par token. Construire un bot ou une automatisation implique de compter les tokens.
- Les limites des forfaits — les plafonds de « messages par heure » sur les forfaits gratuits découlent également de l'économie des tokens.
Quelle est l'ampleur du « Large » ?
Pour vous donner une idée de l'échelle. L'ensemble d'entraînement d'un LLM phare atteint des milliers de milliards de tokens : une personne lisant un livre par jour aurait besoin de centaines de milliers d'années pour en venir à bout. C'est pourquoi le modèle « connaît » la physique, les recettes de cuisine et la syntaxe de vingt langages de programmation : il a statistiquement assimilé l'expérience écrite de toute l'humanité.
Et pourquoi le pire d'internet s'y trouve aussi — les entreprises déploient d'énormes efforts pour filtrer les données et affiner le comportement (cet apprentissage par renforcement à partir des évaluations humaines de la leçon précédente).
Génération, pas recherche
Une conséquence majeure : un LLM ne cherche pas la réponse dans une base de données — il la génère en prédisant une continuation probable. C'est pourquoi il peut écrire un sonnet sur votre chat, qui n'a jamais existé nulle part sur internet (créativité !). Et également pourquoi il peut écrire avec assurance quelque chose de faux, si cette fausseté « semble probable » (c'est le sujet de toute la prochaine leçon).
Sous le capot (facultatif) : deux faits fascinants
Ce qui suit est une exploration approfondie facultative. Cela ne changera rien en pratique : passez à « Faites ceci maintenant » si vous le souhaitez. Mais les faits sont fascinants — deux nouveaux mots, deux idées.
Émergence. La propriété la plus mystérieuse des grands modèles : à mesure qu'ils se développent, des capacités apparaissent que personne ne leur a enseignées. Le modèle a été entraîné à prédire du texte — et soudain, il peut traduire, résoudre des énigmes logiques, écrire du code, expliquer des blagues. Ces capacités « sorties de nulle part » sont dites émergentes. Où cet effet s'arrête, les scientifiques en débattent encore — et c'est la grande question ouverte des prochaines années : les trois ingrédients (données, puissance, architecture) continuent de croître.
Température. Posez la même question à un modèle deux fois et les réponses différeront. Ce n'est pas un défaut : lors du choix du prochain token, le modèle ne prend pas toujours le plus probable — il est autorisé à « prendre un petit risque » (le paramètre est littéralement appelé température). Une pincée d'aléatoire maintient le texte vivant au lieu de le rendre robotiquement identique. En pratique : si une réponse ne vous plaît pas, il suffit parfois de la régénérer. Et « La capitale de la France est Paris » reste inébranlable : une probabilité de 99 % l'emporte sur tout aléatoire.
Faites ceci maintenant
Exécutez ce prompt ici même, puis appuyez sur Run une seconde fois sans changer un mot :
Continue this sentence five different ways: The morning started with…
Vous observerez de vos propres yeux la nature probabiliste de la génération : un seul modèle, une seule requête identique — et différentes continuations probables.
Short questions on the lesson — with an explanation for every answer.
Skip this lesson →