
Hva tokens er, forklart enkelt – og hvorfor noen språk koster dobbelt så mye
Kortversjonen: et token er en tekstbit et nevralt nettverk opererer med. Verken en bokstav eller et ord: et vanlig kort ord tar vanligvis ett token, et langt eller sjeldent ord blir delt i flere. På engelsk er et token omtrent fire tegn; på mange andre språk er det nærmere to. Den praktiske konsekvensen: den samme tanken utenfor engelsk tar omtrent dobbelt så mange tokens, så det koster mer og går saktere. Nedenfor: hvordan du kan se dette selv, hvordan input-tokens skiller seg fra output-tokens, og hvorfor en lang samtale blir dyrere av seg selv.
Enklere å se selv
Ta en setning og del den slik en modell gjør. Den vertikale streken er en token-grense.
The cat sleeps on the windowsill.
→ The| cat| sleeps| on| the| windows|ill|.
8 tokens
Regelen er synlig. Et vanlig kort ord – «the», «cat», «on» – er et enkelt token. Et langt eller sjeldent ord blir delt: «windows|ill». Tegnsetting lever som sitt eget token. Et mellomrom henger vanligvis sammen med ordet som følger det.
Nå den samme tanken på russisk:
Кот спит на подоконнике.
→ Кот| спит| на| подо|конник|е|.
7 tokens – med halvparten så mange tegn
Nesten samme antall tokens for merkbart mindre tekst. Det er tetthetsgapet: engelsk er pakket mer effektivt, fordi modeller hovedsakelig er trent på det, og token-vokabularet ble finjustert for det.
Tommelfingerregelen
På engelsk er 1 token ≈ 4 tegn; på mange andre språk er det ≈ 2 tegn. Når du budsjetterer, eller skal finne ut om et dokument får plass – doble anslaget ditt utenfor engelsk.
Dette handler ikke bare om penger. Antall tokens avgjør om teksten din i det hele tatt får plass i modellens vindu, og hvor raskt svaret kommer.
Tokens telles to ganger: inn og ut
En samtale med en modell består av to deler tokens, som faktureres separat.
- Input – alt du sender: spørsmålet, limt inn tekst, en fil, et bilde, samtaleloggen.
- Output – alt modellen skriver tilbake.
Forskjellen er ikke terminologi, men penger: output koster flere ganger mer. Med Gemini 2.5 Flash-Lite per 30. juli 2026 er input $0.10 per million tokens og output er $0.40. Fire ganger så mye.
La oss regne. Et spørsmål på 100 ord er omtrent 300 input-tokens – $0.00003. Et svar på 500 ord er omtrent 1500 output-tokens – $0.0006. Svaret koster tjue ganger spørsmålet, selv om du skrev ditt selv og modellen produserte sitt eget på sekunder.
Derfor er regelen som sparer mest: forkort svaret, ikke spørsmålet. En linje som sier «svar i ett avsnitt» kutter regningen mer enn å halvere spørsmålet ditt. Og «forklar i detalj, med alle eksemplene» er den dyreste frasen du kan skrive til en modell.
Hvorfor en lang samtale blir dyrere for hver melding
Modellen husker ikke tidligere innlegg. For at den skal følge tråden, sendes hele utvekslingen på nytt – hver gang, fra bunnen av. Din tiende melding drar de ni før den med seg, og alle teller som input igjen.
Melding 1: 300 input-tokens.
Melding 5: 300 av dine egne + 1800 fra historikken = 2100.
Melding 10: 300 av dine egne + 4500 fra historikken = 4800.
Du fortsetter å skrive like korte svar mens input vokser av seg selv. Det er derfor en lang «alt-i-ett»-tråd koster mer enn en ny chat med samme spørsmål – og hvorfor modellen til slutt begynner å miste begynnelsen av samtalen: den gamle teksten får ikke lenger plass.
Kontekstvinduet: der alt hoper seg opp
Alt modellen har tilgjengelig akkurat nå, ligger på ett bord – det er kontekstvinduet. På det samtidig: systeminstruksjonen, hele samtaleloggen, eventuelle opplastede filer, og plass til svaret den skriver.
Størrelsen på dette bordet måles i tokens. Innen midten av 2026 er toppmodellene rundt en million: det er hva Claude Sonnet 4.6 (i beta), Gemini og GPT-5.4 annonserer. Et par år tidligere var standarden 128 tusen – åtte ganger mindre.
En million tokens er omtrent 2500 sider engelsk tekst, eller rundt 1250 sider på et tettere språk. Og det er for alt samlet: historikk, filer og svaret.
En ærlig advarsel du ikke finner i markedsføringen: det annonserte vinduet og det fungerende er forskjellige ting. Modellen aksepterer formelt en million tokens, men kvaliteten synker merkbart tidligere – midt i en enorm tekst blir den forvirret og finner ting mindre pålitelig. Jo nærmere grensen, desto mindre bør du stole på svaret.
Hva du skal gjøre med alt dette
- Begrens svarlengden eksplisitt. «Tre setninger», «en liste med fem» – direkte besparelser.
- Ny oppgave, ny chat. Billigere og mer nøyaktig: gammel kontekst slutter å forstyrre.
- Ikke last opp en hel fil når du bare trenger én seksjon. Klipp ut den delen som betyr noe – svaret blir bedre, ikke bare billigere.
- Prøv lange tekniske prompts på engelsk. Token-besparelsene kommer som en bonus til det faktum at modeller følger en engelsk brief mer presist.
Hvor du kan se dine egne token-antall
Hvis du når modellen via et API, inneholder svaret en usageMetadata-blokk: modellen selv rapporterer hvor mange tokens som gikk inn og hvor mange som kom ut, fordelt etter modalitet. Det er den ærligste måten å sjekke enhver beregning på – inkludert våre.
FAQ
Hva er et token i et nevralt nettverk, forklart enkelt?
Et token er en tekstbit modellen jobber med – verken en bokstav eller et ord. Et vanlig kort ord tar vanligvis ett token, et langt eller sjeldent ord deles i flere, og tegnsetting får sitt eget token. Setningen «The cat sleeps on the windowsill» blir 8 tokens.
Hvor mange tegn er det i ett token?
Omtrent fire tegn per token på engelsk, og nærmere to på mange andre språk. Den samme tanken tar derfor halvannen til dobbelt så mange tokens utenfor engelsk, og koster proporsjonalt mer.
Hvorfor koster en AI mer på andre språk enn engelsk?
Modeller er hovedsakelig trent på engelsk tekst, og token-vokabularet ble finjustert for engelsk. Andre språk deles i mindre biter, så den samme tanken tar omtrent dobbelt så mange tokens. Fakturering skjer per token, derav prisforskjellen.
Hva er forskjellen mellom input- og output-tokens?
Input er alt du sender modellen: spørsmålet ditt, filer, samtaleloggen. Output er det den skriver tilbake. De faktureres separat, og output koster mer: med Gemini 2.5 Flash-Lite er det $0.40 mot $0.10 per million per 30. juli 2026.
Hvorfor blir en lang AI-samtale dyrere?
Modellen husker ikke tidligere innlegg – hele utvekslingen sendes på nytt med hver melding. Din tiende melding drar de ni før den med seg, og de teller som input-tokens igjen. Du skriver like kort mens input vokser av seg selv.
Hva er et kontekstvindu og hvor stort er det nå?
Det er alt modellen har tilgjengelig akkurat nå: systeminstruksjonen, samtaleloggen, opplastede filer og plass til svaret. Det måles i tokens. Innen midten av 2026 er toppmodellene rundt en million – omtrent 2500 sider engelsk tekst.
Fungerer et kontekstvindu på en million tokens virkelig som en million?
Nei. Det annonserte vinduet og det fungerende er forskjellige ting. Modellen aksepterer formelt en million tokens, men kvaliteten synker merkbart tidligere: midt i en enorm tekst blir den forvirret og henter mindre pålitelig. Jo nærmere grensen, desto mer forsiktig bør du behandle svaret.
Hvordan reduserer jeg token-bruken?
Begrens svarlengden eksplisitt – output-tokens koster fire ganger input. Start en ny chat for en ny oppgave, fordi historikken sendes på nytt hver gang. Ikke last opp en hel fil når én seksjon er nok. Skriv lange tekniske prompts på engelsk.