Neurocourse
Exemple de découpage en tokens : anglais (8) et russe (7)

Tokens : définition simple et coût selon la langue

8 min read

En bref : un token est un fragment de texte sur lequel un réseau neuronal opère. Ni une lettre, ni un mot : un mot court courant prend généralement un token, un mot long ou rare est divisé en plusieurs. En anglais, un token représente environ quatre caractères ; dans de nombreuses autres langues, il est plus proche de deux. Conséquence pratique : la même idée exprimée dans une autre langue que l'anglais nécessite environ deux fois plus de tokens, ce qui la rend plus coûteuse et plus lente. Ci-dessous : comment le constater par vous-même, la différence entre les tokens d'entrée et de sortie, et pourquoi une longue conversation devient plus chère d'elle-même.

Un exemple concret

Prenez une phrase et découpez-la comme le ferait un modèle. La barre verticale marque la limite d'un token.

The cat sleeps on the windowsill.
→ The| cat| sleeps| on| the| windows|ill|.
8 tokens

La règle est visible. Un mot court courant — « the », « cat », « on » — est un seul token. Un mot long ou rare est divisé : « windows|ill ». La ponctuation est un token à part entière. Un espace est généralement lié au mot qui le suit.

Maintenant, la même idée en russe :

Кот спит на подоконнике.
→ Кот| спит| на| подо|конник|е|.
7 tokens — avec deux fois moins de caractères

Un nombre de tokens presque identique pour un texte nettement plus court. C'est l'écart de densité : l'anglais est encodé plus efficacement, car les modèles ont été principalement entraînés sur cette langue et le vocabulaire des tokens a été optimisé pour elle.

Règle générale

En anglais, 1 token ≈ 4 caractères ; dans de nombreuses autres langues, ≈ 2 caractères. Pour établir un budget ou vérifier si un document tiendra, doublez votre estimation en dehors de l'anglais.

Il ne s'agit pas seulement d'argent. Le nombre de tokens détermine si votre texte tient dans la fenêtre du modèle et la rapidité de la réponse.

Comptage des tokens : entrée et sortie

Une conversation avec un modèle se compose de deux portions de tokens, facturées séparément.

  • Entrée — tout ce que vous envoyez : la question, le texte collé, un fichier, une image, l'historique de la conversation.
  • Sortie — tout ce que le modèle vous renvoie.

La différence n'est pas terminologique, mais financière : la sortie coûte plusieurs fois plus cher. Avec Gemini 2.5 Flash-Lite au 30 juillet 2026, l'entrée est à 0,10 $ par million de tokens et la sortie à 0,40 $. Soit quatre fois plus.

Faisons le calcul. Une question de 100 mots représente environ 300 tokens d'entrée — 0,00003 $. Une réponse de 500 mots représente environ 1 500 tokens de sortie — 0,0006 $. La réponse coûte vingt fois plus cher que la question, même si vous avez écrit la vôtre et que le modèle a produit la sienne en quelques secondes.

D'où la règle la plus économique : raccourcissez la réponse, pas la question. Une instruction comme « répondez en un paragraphe » réduit la facture plus que de diviser votre question par deux. Et « expliquez en détail, avec tous les exemples » est la phrase la plus chère que vous puissiez écrire à un modèle.

Pourquoi une longue conversation devient plus chère à chaque message

Le modèle ne se souvient pas des échanges précédents. Pour qu'il suive le fil, l'intégralité de l'échange est renvoyée — à chaque fois, depuis le début. Votre dixième message entraîne les neuf précédents, et tous sont de nouveau comptés comme entrée.

Message 1 : 300 tokens d'entrée.
Message 5 : 300 des vôtres + 1 800 d'historique = 2 100.
Message 10 : 300 des vôtres + 4 500 d'historique = 4 800.

Vous continuez à écrire des réponses tout aussi courtes, tandis que l'entrée augmente d'elle-même. C'est pourquoi un long fil de discussion unique coûte plus cher qu'un nouveau chat avec la même question — et pourquoi le modèle finit par perdre le début de la conversation : l'ancien texte ne tient plus.

La fenêtre de contexte : là où tout s'accumule

Tout ce dont le modèle dispose actuellement se trouve sur une seule table — c'est la fenêtre de contexte. Sur celle-ci, en même temps : l'instruction système, l'historique complet de la conversation, tous les fichiers téléchargés et l'espace pour la réponse qu'il est en train d'écrire.

La taille de cette table est mesurée en tokens. D'ici mi-2026, les meilleurs modèles atteignent environ un million : c'est ce que Claude Sonnet 4.6 (en bêta), Gemini et GPT-5.4 annoncent. Quelques années auparavant, la norme était de 128 000 — huit fois moins.

Un million de tokens représente environ 2 500 pages de texte anglais, ou environ 1 250 pages dans une langue plus dense. Et cela inclut tout : l'historique, les fichiers et la réponse.

Une mise en garde honnête que vous ne trouverez pas dans le marketing : la fenêtre annoncée et la fenêtre de travail sont différentes. Le modèle accepte formellement un million de tokens, mais la qualité diminue sensiblement plus tôt — au milieu d'un texte énorme, il se perd et trouve les informations de manière moins fiable. Plus vous vous rapprochez de la limite, moins vous devriez faire confiance à la réponse.

Que faire de tout cela

  • Limitez explicitement la longueur de la réponse. « Trois phrases », « une liste de cinq » — des économies directes.
  • Nouvelle tâche, nouveau chat. Moins cher et plus précis : le contexte obsolète ne perturbe plus.
  • Ne téléchargez pas un fichier entier si vous n'avez besoin que d'une section. Extrayez la partie pertinente — la réponse sera meilleure, pas seulement moins chère.
  • Essayez les prompts techniques longs en anglais. Les économies de tokens s'ajoutent au fait que les modèles suivent un brief anglais plus précisément.

Où voir votre nombre de tokens

Si vous accédez au modèle via une API, la réponse contient un bloc usageMetadata : le modèle lui-même indique le nombre de tokens d'entrée et de sortie, ventilés par modalité. C'est le moyen le plus fiable de vérifier tout calcul — y compris le nôtre.

🧠Go deeper — in the courseRéseaux de neurones pour débutants

FAQ

Qu'est-ce qu'un token dans un réseau neuronal, en langage simple ?

Un token est un fragment de texte avec lequel le modèle travaille — ni une lettre, ni un mot. Un mot court courant prend généralement un token, un mot long ou rare est divisé en plusieurs, et la ponctuation obtient son propre token. La phrase «The cat sleeps on the windowsill» devient 8 tokens.

Combien de caractères contient un token ?

Environ quatre caractères par token en anglais, et plus proche de deux dans de nombreuses autres langues. La même idée nécessite donc une fois et demie à deux fois plus de tokens en dehors de l'anglais, et coûte proportionnellement plus cher.

Pourquoi une IA coûte-t-elle plus cher dans les langues autres que l'anglais ?

Les modèles sont principalement entraînés sur du texte anglais, et le vocabulaire des tokens a été optimisé pour l'anglais. Les autres langues sont divisées en fragments plus petits, de sorte que la même idée nécessite environ deux fois plus de tokens. La facturation se fait par token, d'où l'écart de prix.

Quelle est la différence entre les tokens d'entrée et de sortie ?

L'entrée est tout ce que vous envoyez au modèle : votre question, les fichiers, l'historique de la conversation. La sortie est ce qu'il vous renvoie. Ils sont facturés séparément et la sortie coûte plus cher : avec Gemini 2.5 Flash-Lite, c'est 0,40 $ contre 0,10 $ par million au 30 juillet 2026.

Pourquoi une longue conversation avec une IA devient-elle plus chère ?

Le modèle ne se souvient pas des échanges précédents — l'intégralité de l'échange est renvoyée à chaque message. Votre dixième message entraîne les neuf précédents, et ils sont de nouveau comptés comme tokens d'entrée. Vous écrivez tout aussi brièvement tandis que l'entrée augmente d'elle-même.

Qu'est-ce qu'une fenêtre de contexte et quelle est sa taille actuelle ?

C'est tout ce dont le modèle dispose actuellement : l'instruction système, l'historique de la conversation, les fichiers téléchargés et l'espace pour la réponse. Elle est mesurée en tokens. D'ici mi-2026, les meilleurs modèles atteignent environ un million — soit environ 2 500 pages de texte anglais. Quelques années auparavant, la norme était de 128 000.

Une fenêtre de contexte d'un million de tokens fonctionne-t-elle vraiment comme un million ?

Non. La fenêtre annoncée et la fenêtre de travail sont différentes. Le modèle accepte formellement un million de tokens, mais la qualité diminue sensiblement plus tôt : au milieu d'un texte énorme, il se perd et récupère les informations de manière moins fiable. Plus vous vous rapprochez de la limite, plus vous devriez considérer la réponse avec prudence.

Comment réduire l'utilisation des tokens ?

Limitez explicitement la longueur de la réponse — les tokens de sortie coûtent quatre fois plus cher que ceux d'entrée. Démarrez un nouveau chat pour une nouvelle tâche, car l'historique est renvoyé à chaque fois. Ne téléchargez pas un fichier entier si une seule section suffit. Rédigez les prompts techniques longs en anglais.