
Ce que coûte réellement une requête IA : nous avons mesuré neuf opérations.
Version courte : le 30 juillet 2026, nous avons exécuté neuf types de requêtes via Google Vertex AI et enregistré le nombre de tokens directement à partir des réponses de l'API. La principale conclusion : lire est bon marché pour une IA, créer est coûteux, et l'écart atteint un facteur mille. Regarder une vidéo YouTube de dix minutes coûte deux cents. Générer huit secondes de vidéo coûte trois dollars vingt. Même technologie, même facture, mais des opérations de nature complètement différente — et vous ne pouvez pas planifier un budget sans comprendre cette différence.
Comment nous l'avons mesuré
Pas à partir de calculateurs sur des pages marketing ni de promesses de blogs de fournisseurs. Chaque requête a été envoyée à Vertex AI sur le compte de service de notre projet, et de chaque réponse, nous avons extrait le bloc usageMetadata — où le modèle lui-même indique le coût en tokens de votre entrée et le coût de sa réponse.
Nous avons ensuite multiplié par les tarifs publiés par Google au 30 juillet 2026 pour la famille Gemini 2.5 Flash-Lite : 0,10 $ par million de tokens d'entrée (texte, images, vidéo), 0,30 $ par million de tokens d'entrée audio et 0,40 $ par million de tokens de sortie. Les prix de génération vidéo proviennent de la liste Veo 3.1 : 0,40 $ par seconde en mode standard.
La méthode est importante car elle vous permet de la reproduire : les mêmes chiffres se trouvent dans la réponse à toute requête que vous faites, si vous examinez usageMetadata.
Le tableau : ce qui coûte quoi
| Opération | Ce qui se passe | Coût par exécution |
|---|---|---|
| Une question textuelle | ~300 tokens en entrée, ~500 en sortie | 0,0003 $ |
| Lecture d'une photo | image plus une courte réponse | 0,001 $ |
| Transcription de 30s de parole | l'audio coûte trois fois le texte | 0,0008 $ |
| Lecture d'un paragraphe à voix haute | synthèse vocale | 0,0006 $ |
| Visionnage d'une vidéo de 3 minutes | 51k tokens | 0,006 $ |
| Visionnage d'une vidéo de 10 minutes | 171k tokens | 0,02 $ |
| Génération d'une image | 1 290 tokens de sortie | 0,04 $ |
| 8s de vidéo, mode rapide | facturé à la seconde | 0,64 $ |
| 8s de vidéo, mode standard | facturé à la seconde | 3,20 $ |
La conclusion : regarder est moins cher que créer
Comparez deux lignes. Analyser une vidéo de dix minutes de quelqu'un d'autre : deux cents. Générer huit secondes de votre propre vidéo : trois dollars vingt. C'est 160 fois plus pour soixante-quinze fois moins de secondes.
La raison est la façon dont la facturation fonctionne. Tout ce que vous envoyez au modèle est des tokens d'entrée — la chose la moins chère de la liste de prix. Tout ce qu'il produit est de la sortie, et la sortie coûte plusieurs fois plus cher. Avec Flash-Lite, l'entrée est à 0,10 $ par million et la sortie à 0,40 $ — quatre fois plus. La génération d'images et de vidéos est facturée séparément, à des tarifs entièrement différents.
D'où la règle qui permet d'économiser le plus d'argent : raccourcissez la réponse, pas la question. Une ligne disant « répondez en un paragraphe » réduit votre facture plus que de diviser votre question par deux. La phrase la plus chère que vous puissiez écrire à un modèle est « expliquez en détail, avec tous les exemples ».
Vidéo, seconde par seconde
Nous l'avons mesuré séparément en coupant un clip à différentes longueurs. Le modèle compte la vidéo comme 258 tokens par seconde de métrage et 25 tokens par seconde d'audio. La relation est strictement linéaire — cinq secondes ont donné 1 290 tokens, dix secondes ont donné exactement 2 580.
| Durée | Tokens | Coût d'analyse |
|---|---|---|
| 5 secondes | 1 415 | 0,0002 $ |
| 1 minute | 17 000 | 0,002 $ |
| 5 minutes | 85 000 | 0,010 $ |
| 10 minutes | 171 000 | 0,020 $ |
Ce que cela signifie en pratique : analyser une vidéo n'est pas un luxe. Extraire la substance d'une conférence d'une heure coûte environ douze cents. Votre propre temps pour cadrer la tâche coûtera plus cher.
Pourquoi vous devez quand même faire les calculs
Une seule requête coûte une fraction de centime, ce qui donne l'impression qu'il n'y a rien à compter. Cette impression est fausse pour deux raisons.
Premièrement : une conversation devient plus chère à chaque message. Le modèle ne se souvient pas des tours précédents — pour qu'il suive le contexte, l'intégralité de l'échange est renvoyée à chaque requête. Votre dixième message entraîne les neuf précédents, et tous sont comptés comme entrée à nouveau. Vous continuez à écrire des réponses également courtes tandis que la facture augmente d'elle-même.
Deuxièmement : certaines langues coûtent environ deux fois plus cher que l'anglais. Le modèle ne compte ni les lettres ni les mots, mais les tokens — des fragments de texte. L'anglais se divise en fragments plus grands : un token représente environ quatre caractères, tandis que dans de nombreuses autres langues, il est plus proche de deux. La même pensée coûte une fois et demie à deux fois plus cher.
Que faire à ce sujet
- Limitez explicitement la longueur de la réponse. « Trois phrases », « un paragraphe », « une liste de cinq » — ce sont des économies directes, pas du pinaillage stylistique.
- Commencez un nouveau chat pour une nouvelle tâche. Un long fil de discussion tout-en-un coûte plus cher qu'un nouveau chat avec la même question — et fonctionne mieux, car le contexte obsolète ne gêne plus.
- Ne générez pas ce que vous pouvez trouver. Lire un clip ou un document existant est presque toujours moins cher que de créer le vôtre.
- Pour les prompts techniques longs, essayez l'anglais. Il ne s'agit pas seulement du prix : les modèles ont principalement appris à partir de textes anglais et suivent un brief anglais plus précisément.
Les mises en garde, sans lesquelles les chiffres mentent
Nous avons mesuré un modèle — Gemini 2.5 Flash-Lite — sur un seul cloud. Des modèles plus puissants coûtent plusieurs fois plus cher ; les concurrents ont leurs propres listes de prix. Ce qui est valable partout, c'est l'ordre de grandeur et, plus important encore, le rapport entre les opérations : l'entrée est moins chère que la sortie, la lecture est moins chère que la création.
Deuxièmement : les tarifs changent. Nos chiffres sont datés du 30 juillet 2026. Vérifiez le prix sur la page de tarification du fournisseur plutôt que dans les articles — y compris celui-ci.
FAQ
Combien coûte une seule requête ChatGPT ou Gemini pour un utilisateur ordinaire ?
Si vous utilisez une interface de chat sur abonnement, rien au-delà de l'abonnement — les limites y sont comptées en requêtes, pas en argent. Les chiffres de cet article s'appliquent à l'accès API, où une IA est intégrée à votre propre logiciel et vous payez par token : 0,0003 $ pour une question textuelle, 0,001 $ pour lire une photo, 0,04 $ pour une image générée.
Pourquoi générer une image coûte-t-il plus cher que de lire dix photos ?
Parce que ce sont des opérations de nature différente. Lire une image signifie l'envoyer en entrée, et les tokens d'entrée sont la chose la moins chère de la liste. Créer une image signifie produire une sortie, qui est facturée séparément et beaucoup plus cher. Dans nos mesures, une image générée coûte 0,04 $ tandis que la lecture d'une photo coûte 0,001 $ — quarante fois moins.
Combien coûte l'analyse d'une vidéo YouTube par une IA ?
Mesuré le 30 juillet 2026 avec Gemini 2.5 Flash-Lite : 258 tokens par seconde de métrage plus 25 tokens par seconde d'audio. Un clip de dix minutes représente environ 171 000 tokens, soit environ 0,02 $. Une heure de vidéo coûte environ douze cents.
Est-il vrai que la génération de vidéo coûte des dollars par seconde ?
Oui. Veo 3.1 est facturé à la seconde : 0,40 $ par seconde en mode standard et à partir de 0,05 $ en mode lite. Un clip de huit secondes coûte 3,20 $ en mode standard — plus que l'analyse de cent cinquante heures de vidéo d'une autre personne.
Comment réduire les coûts de l'IA sans perdre en qualité ?
Trois habitudes font l'essentiel du travail. Premièrement, limitez explicitement la longueur de la réponse, car les tokens de sortie coûtent quatre fois plus cher que ceux d'entrée. Deuxièmement, commencez un nouveau chat pour une nouvelle tâche — tout l'historique est renvoyé à chaque message. Troisièmement, ne générez pas ce que vous pouvez trouver et lire à la place.
Pourquoi le texte dans certaines langues coûte-t-il plus cher que l'anglais ?
Le modèle ne compte ni les lettres ni les mots, mais les tokens — des fragments de texte. L'anglais se divise en fragments plus grands : environ quatre caractères par token, contre environ deux dans de nombreuses autres langues. La même idée nécessite 1,5 à 2 fois plus de tokens et coûte proportionnellement plus cher.
Où puis-je consulter le nombre de tokens utilisés par ma requête ?
La réponse de l'API contient un bloc usageMetadata où le modèle indique le nombre de tokens d'entrée et de sortie, ventilé par modalité : texte, image, vidéo, audio. Tous les chiffres de cet article proviennent de là, et vous pouvez reproduire cette mesure sur vos propres requêtes.