
Wat kost een AI-aanvraag? We maten 9 bewerkingen.
De korte versie: op 30 juli 2026 voerden we negen soorten aanvragen uit via Google Vertex AI en logden de tokenaantallen rechtstreeks uit de API-responses. De belangrijkste bevinding: lezen is goedkoop voor een AI, creëren is duur, en het verschil is duizendvoudig. Een YouTube-video van tien minuten bekijken kost twee cent. Acht seconden video genereren kost drie dollar twintig. Zelfde technologie, zelfde rekening, maar bewerkingen van een totaal andere aard — en je kunt geen budget plannen zonder dat verschil te begrijpen.
Hoe we het gemeten hebben
Niet van calculators op marketingpagina's en niet van beloftes op vendorblogs. Elke aanvraag ging naar Vertex AI op het serviceaccount van ons project, en uit elke response haalden we het usageMetadata-blok — waar het model zelf rapporteert hoeveel tokens je input kostte en hoeveel het antwoord kostte.
Vervolgens vermenigvuldigden we met de gepubliceerde prijzen van Google per 30 juli 2026 voor de Gemini 2.5 Flash-Lite-familie: $0,10 per miljoen input tokens (tekst, afbeeldingen, video), $0,30 per miljoen audio input tokens en $0,40 per miljoen output tokens. Prijzen voor videogeneratie komen van de Veo 3.1-lijst: $0,40 per seconde in standaardmodus.
De methode is belangrijk omdat je deze kunt herhalen: dezelfde getallen staan in de response van elke aanvraag die je doet, als je naar usageMetadata kijkt.
De tabel: wat kost wat
| Bewerking | Wat er gebeurt | Kosten per keer |
|---|---|---|
| Een tekstvraag | ~300 tokens in, ~500 uit | $0.0003 |
| Een foto lezen | afbeelding plus kort antwoord | $0.001 |
| 30s spraak transcriberen | audio kost drie keer tekst | $0.0008 |
| Een alinea voorlezen | spraakgeneratie | $0.0006 |
| Een video van 3 minuten bekijken | 51k tokens | $0.006 |
| Een video van 10 minuten bekijken | 171k tokens | $0.02 |
| Eén afbeelding genereren | 1,290 output tokens | $0.04 |
| 8s video, snelle modus | per seconde gefactureerd | $0.64 |
| 8s video, standaardmodus | per seconde gefactureerd | $3.20 |
De bevinding: kijken is goedkoper dan maken
Vergelijk twee rijen. Een tien minuten durende video van iemand anders analyseren: twee cent. Zelf acht seconden genereren: drie dollar twintig. Dat is 160 keer meer voor vijfenzeventig keer minder seconden.
De reden is hoe de facturatie werkt. Alles wat je naar het model stuurt, zijn input tokens — het goedkoopste op de prijslijst. Alles wat het produceert, is output, en output kost meerdere keren meer. Met Flash-Lite is input $0,10 per miljoen en output $0,40 — vier keer zoveel. Afbeeldings- en videogeneratie worden weer apart gefactureerd, tegen totaal verschillende tarieven.
Vandaar de regel die het meeste geld bespaart: verkort het antwoord, niet de vraag. Een zin als „antwoord in één alinea” verlaagt je rekening meer dan het halveren van je vraag. De duurste zin die je aan een model kunt schrijven is „leg gedetailleerd uit, met alle voorbeelden”.
Video, seconde voor seconde
We maten dit apart door één clip in verschillende lengtes te knippen. Het model telt video als 258 tokens per seconde beeldmateriaal en 25 tokens per seconde audio. De relatie is strikt lineair — vijf seconden gaf 1,290 tokens, tien seconden gaf precies 2,580.
| Lengte | Tokens | Kosten om te analyseren |
|---|---|---|
| 5 seconden | 1,415 | $0.0002 |
| 1 minuut | 17,000 | $0.002 |
| 5 minuten | 85,000 | $0.010 |
| 10 minuten | 171,000 | $0.020 |
Wat dit in de praktijk betekent: video analyseren is geen luxe. De essentie uit een uur durende lezing halen kost ongeveer twaalf cent. Je eigen tijd om de taak te formuleren zal meer kosten.
Waarom je toch moet rekenen
Een enkele aanvraag kost een fractie van een cent, wat de indruk wekt dat er niets te tellen valt. Die indruk is om twee redenen onjuist.
Ten eerste: een gesprek wordt duurder met elk bericht. Het model onthoudt eerdere beurten niet — om de context te volgen, wordt de hele uitwisseling bij elke aanvraag opnieuw verzonden. Je tiende bericht sleept de negen ervoor mee, en die tellen allemaal weer als input. Je blijft even korte antwoorden schrijven terwijl de rekening vanzelf oploopt.
Ten tweede: sommige talen kosten ongeveer twee keer zoveel als Engels. Het model telt geen letters of woorden, maar tokens — stukjes tekst. Engels splitst in grotere stukken: één token is daar ongeveer vier tekens, terwijl het in veel andere talen dichter bij twee ligt. Dezelfde gedachte kost anderhalf tot twee keer meer.
Wat je eraan kunt doen
- Beperk de antwoordlengte expliciet. „Drie zinnen”, „één alinea”, „een lijst van vijf” — dat is directe besparing, geen stilistisch geneuzel.
- Begin een nieuwe chat voor een nieuwe taak. Een lange alles-in-één-thread kost meer dan een frisse chat met dezelfde vraag — en werkt beter, omdat de verouderde context niet meer in de weg zit.
- Genereer niet wat je kunt vinden. Een bestaande clip of document lezen is bijna altijd goedkoper dan zelf iets creëren.
- Probeer voor lange technische prompts Engels. Het gaat niet alleen om de prijs: modellen leerden voornamelijk van Engelse tekst en volgen een Engelse briefing nauwkeuriger.
De kanttekeningen, zonder welke de cijfers liegen
We maten één model — Gemini 2.5 Flash-Lite — op één cloud. Krachtigere modellen kosten meerdere keren meer; concurrenten hebben hun eigen prijslijsten. Wat overal geldt, is de orde van grootte en, belangrijker nog, de verhouding tussen bewerkingen: input is goedkoper dan output, lezen is goedkoper dan creëren.
Ten tweede: tarieven veranderen. Onze cijfers zijn van 30 juli 2026. Controleer de prijs op de eigen prijspagina van de leverancier in plaats van in artikelen — inclusief dit artikel.
FAQ
Wat kost één ChatGPT- of Gemini-aanvraag voor een gewone gebruiker?
Als je een chatinterface met een abonnement gebruikt, niets buiten het abonnement — limieten worden daar geteld in aanvragen, niet in geld. De cijfers in dit artikel gelden voor API-toegang, waarbij een AI in je eigen software is ingebouwd en je per token betaalt: $0,0003 voor een tekstvraag, $0,001 om een foto te lezen, $0,04 voor een gegenereerde afbeelding.
Waarom kost één afbeelding genereren meer dan tien foto's lezen?
Omdat het bewerkingen van een ander soort zijn. Een afbeelding lezen betekent deze als input versturen, en input tokens zijn het goedkoopste op de lijst. Een afbeelding creëren betekent output produceren, wat apart en veel hoger wordt gefactureerd. In onze metingen kost één gegenereerde afbeelding $0,04 terwijl een foto lezen $0,001 kost — veertig keer minder.
Wat kost het om een AI een YouTube-video te laten analyseren?
Gemeten op 30 juli 2026 met Gemini 2.5 Flash-Lite: 258 tokens per seconde beeldmateriaal plus 25 tokens per seconde audio. Een clip van tien minuten komt neer op ongeveer 171,000 tokens, ruwweg $0,02. Een uur video kost ongeveer twaalf cent.
Klopt het dat videogeneratie dollars per seconde kost?
Ja. Veo 3.1 wordt per seconde gefactureerd: $0,40 per seconde in standaardmodus en vanaf $0,05 in de lite-tier. Een clip van acht seconden kost $3,20 in standaardmodus — meer dan het analyseren van honderdvijftig uur video van iemand anders.
Hoe verlaag ik AI-kosten zonder kwaliteitsverlies?
Drie gewoontes doen het meeste werk. Ten eerste: beperk de antwoordlengte expliciet, want output tokens kosten vier keer zoveel als input. Ten tweede: begin een nieuwe chat voor een nieuwe taak — de hele geschiedenis wordt bij elk bericht opnieuw verzonden. Ten derde: genereer niet wat je kunt vinden en lees het in plaats daarvan.
Waarom kost tekst in sommige talen meer dan Engels?
Het model telt geen letters of woorden, maar tokens — stukjes tekst. Engels wordt opgedeeld in grotere stukken: ongeveer vier tekens per token, tegenover ongeveer twee in veel andere talen. Dezelfde gedachte kost anderhalf tot twee keer zoveel tokens, en is proportioneel duurder.
Waar kan ik zien hoeveel tokens mijn eigen verzoek heeft gebruikt?
De API-respons bevat een usageMetadata-blok waarin het model het aantal input- en outputtokens rapporteert, uitgesplitst per modaliteit: tekst, afbeelding, video, audio. Elk cijfer in dit artikel komt daarvandaan, en je kunt de meting herhalen op je eigen verzoeken.