Neurocourse
De zin „De kat slaapt op de vensterbank” opgesplitst in acht tokens door verticale strepen, naast de Russische tegenhanger opgesplitst in zeven

Tokens uitgelegd: waarom andere talen duurder zijn

8 min read

De korte versie: een token is een stukje tekst waar een neuraal netwerk mee werkt. Geen letter, geen woord: een veelvoorkomend kort woord is meestal één token, een lang of zeldzaam woord wordt in meerdere gesplitst. In het Engels is een token ongeveer vier tekens; in veel andere talen is dat dichter bij twee. Het praktische gevolg: dezelfde gedachte buiten het Engels kost ongeveer twee keer zoveel tokens, dus het is duurder en langzamer. Hieronder: hoe je dit zelf kunt zien, hoe inputtokens verschillen van outputtokens, en waarom een lang gesprek vanzelf duurder wordt.

Makkelijker om te zien

Neem een zin en knip die zoals een model dat doet. De verticale streep is een tokenbegrenzing.

The cat sleeps on the windowsill.
→ The| cat| sleeps| on| the| windows|ill|.
8 tokens

De regel is duidelijk. Een veelvoorkomend kort woord — „the”, „cat”, „on” — is één token. Een lang of zeldzaam woord wordt gesplitst: „windows|ill”. Interpunctie is een eigen token. Een spatie plakt meestal aan het woord dat erop volgt.

Nu dezelfde gedachte in het Russisch:

Кот спит на подоконнике.
→ Кот| спит| на| подо|конник|е|.
7 tokens — with half as many characters

Bijna hetzelfde aantal tokens voor aanzienlijk minder tekst. Dat is het dichtheidsverschil: Engels is efficiënter verpakt, omdat modellen er voornamelijk op zijn getraind en de tokenwoordenschat erop is afgestemd.

De vuistregel

In het Engels 1 token ≈ 4 characters; in veel andere talen ≈ 2 characters. Voor budgettering, of om te bepalen of een document past — verdubbel je schatting buiten het Engels.

Dit gaat niet alleen over geld. Het aantal tokens bepaalt of je tekst überhaupt in het venster van het model past, en hoe snel het antwoord komt.

Tokens worden dubbel geteld: in en uit

Een gesprek met een model bestaat uit twee delen tokens, die apart worden gefactureerd.

  • Input — alles wat je stuurt: de vraag, geplakte tekst, een bestand, een afbeelding, de gespreksgeschiedenis.
  • Output — alles wat het model terugschrijft.

Het verschil zit niet in de terminologie, maar in het geld: output kost meerdere keren meer. Met Gemini 2.5 Flash-Lite per 30 juli 2026 is input $0.10 per miljoen tokens en output $0.40. Vier keer zoveel.

Laten we tellen. Een vraag van 100 woorden is ongeveer 300 inputtokens — $0.00003. Een antwoord van 500 woorden is ongeveer 1.500 outputtokens — $0.0006. Het antwoord kost twintig keer de vraag, ook al schreef je de jouwe zelf en produceerde het model het zijne in seconden.

Vandaar de regel die het meest bespaart: verkort het antwoord, niet de vraag. Een zin als „antwoord in één alinea” verlaagt de rekening meer dan het halveren van je vraag. En „leg gedetailleerd uit, met alle voorbeelden” is de duurste zin die je aan een model kunt schrijven.

Waarom een lang gesprek duurder wordt per bericht

Het model onthoudt eerdere beurten niet. Om de draad te volgen, wordt de hele uitwisseling opnieuw verzonden — elke keer, vanaf nul. Je tiende bericht sleept de negen ervoor mee, en die tellen allemaal weer als input.

Message 1: 300 input tokens.
Message 5: 300 of your own + 1,800 of history = 2,100.
Message 10: 300 of your own + 4,500 of history = 4,800.

Je blijft even korte antwoorden schrijven terwijl de input vanzelf groeit. Daarom kost een lange alles-in-één-thread meer dan een nieuwe chat met dezelfde vraag — en daarom begint het model uiteindelijk het begin van het gesprek te verliezen: de oude tekst past niet meer.

Het contextvenster: waar alles zich ophoopt

Alles wat het model op dit moment beschikbaar heeft, ligt op één tafel — dat is het contextvenster. Tegelijkertijd liggen daarop: de systeeminstructie, de hele gespreksgeschiedenis, eventuele geüploade bestanden en ruimte voor het antwoord dat het schrijft.

De grootte van die tafel wordt gemeten in tokens. Halverwege 2026 zijn de topmodellen rond een miljoen: dat is wat Claude Sonnet 4.6 (in bèta), Gemini en GPT-5.4 adverteren. Een paar jaar eerder was de standaard 128 duizend — acht keer minder.

Een miljoen tokens is ongeveer 2.500 pagina's Engelse tekst, of ongeveer 1.250 pagina's in een dichtere taal. En dat is voor alles samen: geschiedenis, bestanden en het antwoord.

Een eerlijke waarschuwing die je niet in de marketing zult vinden: het geadverteerde venster en het werkende venster zijn verschillende dingen. Het model accepteert formeel een miljoen tokens, maar de kwaliteit neemt merkbaar eerder af — midden in een enorme tekst raakt het in de war en vindt het dingen minder betrouwbaar. Hoe dichter bij de limiet, hoe minder je het antwoord moet vertrouwen.

Wat je hiermee kunt doen

  • Beperk de antwoordlengte expliciet. „Drie zinnen”, „een lijst van vijf” — directe besparingen.
  • Nieuwe taak, nieuwe chat. Goedkoper en nauwkeuriger: verouderde context stoort niet meer.
  • Upload geen heel bestand als je maar één sectie nodig hebt. Knip het deel eruit dat ertoe doet — het antwoord wordt beter, niet alleen goedkoper.
  • Probeer lange technische prompts in het Engels. De tokenbesparingen komen als een bonus bij het feit dat modellen een Engelse instructie nauwkeuriger volgen.

Waar je je eigen tokentellingen kunt zien

Als je het model via een API benadert, bevat de respons een usageMetadata-blok: het model zelf rapporteert hoeveel tokens erin gingen en hoeveel eruit kwamen, uitgesplitst per modaliteit. Dat is de meest eerlijke manier om elke berekening te controleren — inclusief die van ons.

🧠Go deeper — in the courseNeurale netwerken voor beginners

FAQ

Wat is een token in een neuraal netwerk, simpel uitgelegd?

Een token is een stukje tekst waar het model mee werkt — geen letter, geen woord. Een veelvoorkomend kort woord is meestal één token, een lang of zeldzaam woord wordt in meerdere gesplitst, en interpunctie krijgt een eigen token. De zin „De kat slaapt op de vensterbank” wordt 8 tokens.

Hoeveel tekens zitten er in één token?

Ongeveer vier tekens per token in het Engels, en dichter bij twee in veel andere talen. Dezelfde gedachte kost daarom anderhalf tot twee keer meer tokens buiten het Engels, en is proportioneel duurder.

Waarom is AI duurder in andere talen dan Engels?

Modellen zijn voornamelijk getraind op Engelse tekst, en de tokenwoordenschat is afgestemd op het Engels. Andere talen worden opgesplitst in kleinere stukjes, dus dezelfde gedachte kost ongeveer twee keer zoveel tokens. Facturering is per token, vandaar het prijsverschil.

Wat is het verschil tussen input- en outputtokens?

Input is alles wat je naar het model stuurt: je vraag, bestanden, de gespreksgeschiedenis. Output is wat het terugschrijft. Ze worden apart gefactureerd en output kost meer: met Gemini 2.5 Flash-Lite is het $0.40 tegenover $0.10 per miljoen per 30 juli 2026.

Waarom wordt een lang AI-gesprek duurder?

Het model onthoudt eerdere beurten niet — de hele uitwisseling wordt bij elk bericht opnieuw verzonden. Je tiende bericht sleept de negen ervoor mee, en die tellen weer als inputtokens. Je schrijft even kort terwijl de input vanzelf groeit.

Wat is een contextvenster en hoe groot is het nu?

Het is alles wat het model op dit moment beschikbaar heeft: de systeeminstructie, de gespreksgeschiedenis, geüploade bestanden en ruimte voor het antwoord. Het wordt gemeten in tokens. Halverwege 2026 zijn topmodellen rond een miljoen — ongeveer 2.500 pagina's Engelse tekst. Een paar jaar eerder was de standaard 128 duizend.

Werkt een contextvenster van een miljoen tokens echt als een miljoen?

Nee. Het geadverteerde venster en het werkende venster zijn verschillende dingen. Het model accepteert formeel een miljoen tokens, maar de kwaliteit neemt merkbaar eerder af: midden in een enorme tekst raakt het in de war en haalt het minder betrouwbaar informatie op. Hoe dichter bij de limiet, hoe voorzichtiger je met het antwoord moet omgaan.

Hoe verminder je tokengebruik?

Beperk de antwoordlengte expliciet — outputtokens kosten vier keer zoveel als input. Start een nieuwe chat voor een nieuwe taak, want de geschiedenis wordt elke keer opnieuw verzonden. Upload geen heel bestand als één sectie volstaat. Schrijf lange technische prompts in het Engels.