
Hvad tokens er i almindeligt sprog — og hvorfor nogle sprog koster dobbelt så meget
Den korte version: en token er en tekstbid, et neuralt netværk arbejder med. Hverken et bogstav eller et ord: et almindeligt kort ord tager typisk én token, et langt sjældent ord bliver delt i flere. På engelsk er en token cirka fire tegn; på mange andre sprog er det tættere på to. Den praktiske konsekvens: den samme tanke uden for engelsk kræver cirka dobbelt så mange tokens, så det koster mere og kører langsommere. Nedenfor: hvordan du selv kan se dette, hvordan input-tokens adskiller sig fra output-tokens, og hvorfor en lang samtale bliver dyrere af sig selv.
Nemmere at se med det samme
Tag en sætning og klip den, som en model gør. Den lodrette streg er en token-grænse.
The cat sleeps on the windowsill.
→ The| cat| sleeps| on| the| windows|ill|.
8 tokens
Reglen er synlig. Et almindeligt kort ord — "the", "cat", "on" — er en enkelt token. Et langt eller sjældent ord bliver delt: "windows|ill". Tegnsætning lever som sin egen token. Et mellemrum hæfter sig typisk til ordet, der følger det.
Nu den samme tanke på russisk:
Кот спит на подоконнике.
→ Кот| спит| на| подо|конник|е|.
7 tokens — med halvt så mange tegn
Næsten det samme antal tokens for mærkbart mindre tekst. Det er tæthedsforskellen: engelsk er pakket mere effektivt, fordi modeller primært er trænet på det, og token-vokabularet er blevet finjusteret til det.
Tommelfingerreglen
På engelsk er 1 token ≈ 4 tegn; på mange andre sprog er det ≈ 2 tegn. Når du budgetterer, eller finder ud af om et dokument passer — fordobl dit estimat uden for engelsk.
Dette handler ikke kun om penge. Antallet af tokens afgør, om din tekst overhovedet passer ind i modellens vindue, og hvor hurtigt svaret kommer.
Tokens tælles dobbelt: ind og ud
En samtale med en model er to portioner tokens, der faktureres separat.
- Input — alt hvad du sender: spørgsmålet, indsat tekst, en fil, et billede, samtaleloggen.
- Output — alt hvad modellen skriver tilbage.
Forskellen er ikke terminologi, men penge: output koster flere gange mere. Med Gemini 2.5 Flash-Lite pr. 30. juli 2026 er input $0.10 per million tokens og output $0.40. Fire gange.
Lad os tælle. Et spørgsmål på 100 ord er cirka 300 input-tokens — $0.00003. Et svar på 500 ord er cirka 1.500 output-tokens — $0.0006. Svaret koster tyve gange spørgsmålet, selvom du selv skrev dit, og modellen producerede sit eget på få sekunder.
Derfor reglen, der sparer mest: forkort svaret, ikke spørgsmålet. En linje, der siger "svar i ét afsnit", reducerer regningen mere end at halvere dit spørgsmål. Og "forklar detaljeret, med alle eksemplerne" er den dyreste sætning, du kan skrive til en model.
Hvorfor en lang samtale bliver dyrere for hver besked
Modellen husker ikke tidligere vendinger. For at den kan følge tråden, sendes hele udvekslingen igen — hver gang, fra bunden. Din tiende besked trækker de ni før den med, og alle tæller som input igen.
Besked 1: 300 input-tokens.
Besked 5: 300 af dine egne + 1.800 fra historikken = 2.100.
Besked 10: 300 af dine egne + 4.500 fra historikken = 4.800.
Du bliver ved med at skrive lige korte svar, mens inputtet vokser af sig selv. Det er derfor, en lang alt-i-én-tråd koster mere end en frisk chat med det samme spørgsmål — og hvorfor modellen til sidst begynder at miste begyndelsen af samtalen: den gamle tekst passer ikke længere ind.
Kontekstvinduet: hvor det hele hober sig op
Alt hvad modellen har til rådighed lige nu, ligger på ét bord — det er kontekstvinduet. På det samme tid: systeminstruktionen, hele samtaleloggen, eventuelle uploadede filer og plads til det svar, den skriver.
Størrelsen på det bord måles i tokens. Midt i 2026 er topmodellerne omkring en million: det er hvad Claude Sonnet 4.6 (i beta), Gemini og GPT-5.4 annoncerer. Et par år tidligere var standarden 128 tusind — otte gange mindre.
En million tokens er cirka 2.500 sider engelsk tekst, eller omkring 1.250 sider på et tættere sprog. Og det er for alt samlet: historik, filer og svaret.
En ærlig advarsel, du ikke finder i markedsføringen: det annoncerede vindue og det fungerende vindue er forskellige ting. Modellen accepterer formelt en million tokens, men kvaliteten falder mærkbart tidligere — midt i en kæmpe tekst bliver den forvirret og finder ting mindre pålideligt. Jo tættere på grænsen, jo mindre bør du stole på svaret.
Hvad du skal gøre med alt dette
- Begræns svarlængden eksplicit. "Tre sætninger", "en liste med fem" — direkte besparelser.
- Ny opgave, ny chat. Billigere og mere præcist: forældet kontekst stopper med at forstyrre.
- Upload ikke en hel fil, når du kun har brug for én sektion. Klip den del ud, der er relevant — svaret bliver bedre, ikke kun billigere.
- Prøv lange tekniske prompts på engelsk. Token-besparelserne kommer som en bonus til det faktum, at modeller følger en engelsk instruktion mere præcist.
Hvor du kan se dine egne token-antal
Hvis du tilgår modellen via en API, indeholder svaret en usageMetadata-blok: modellen rapporterer selv, hvor mange tokens der gik ind, og hvor mange der kom ud, opdelt efter modalitet. Det er den mest ærlige måde at tjekke enhver beregning på — inklusive vores.
FAQ
Hvad er en token i et neuralt netværk, i almindeligt sprog?
En token er en tekstbid, modellen arbejder med — hverken et bogstav eller et ord. Et almindeligt kort ord tager typisk én token, et langt eller sjældent ord deles i flere, og tegnsætning får sin egen token. Sætningen «The cat sleeps on the windowsill» bliver til 8 tokens.
Hvor mange tegn er der i én token?
Cirka fire tegn per token på engelsk, og tættere på to på mange andre sprog. Den samme tanke kræver derfor halvanden til to gange flere tokens uden for engelsk, og koster proportionalt mere.
Hvorfor koster en AI mere på andre sprog end engelsk?
Modeller er primært trænet på engelsk tekst, og token-vokabularet er blevet finjusteret til engelsk. Andre sprog opdeles i mindre bidder, så den samme tanke kræver cirka dobbelt så mange tokens. Afregning sker per token, deraf prisforskellen.
Hvad er forskellen mellem input- og output-tokens?
Input er alt, hvad du sender modellen: dit spørgsmål, filer, samtaleloggen. Output er det, den skriver tilbage. De faktureres separat, og output koster mere: med Gemini 2.5 Flash-Lite er det $0.40 mod $0.10 per million pr. 30. juli 2026.
Hvorfor bliver en lang AI-samtale dyrere?
Modellen husker ikke tidligere vendinger — hele udvekslingen sendes igen med hver besked. Din tiende besked trækker de ni før den med, og de tæller som input-tokens igen. Du skriver lige så kortfattet, mens inputtet vokser af sig selv.
Hvad er et kontekstvindue, og hvor stort er det nu?
Det er alt, hvad modellen har til rådighed lige nu: systeminstruktionen, samtaleloggen, uploadede filer og plads til svaret. Det måles i tokens. Midt i 2026 er topmodellerne omkring en million — cirka 2.500 sider engelsk tekst. Et par år tidligere var standarden 128 tusind.
Fungerer et kontekstvindue på en million tokens virkelig som en million?
Nej. Det annoncerede vindue og det fungerende er forskellige ting. Modellen accepterer formelt en million tokens, men kvaliteten falder mærkbart tidligere: midt i en kæmpe tekst bliver den forvirret og henter mindre pålideligt. Jo tættere på grænsen, jo mere forsigtigt bør du behandle svaret.
Hvordan reducerer du token-forbruget?
Begræns svarlængden eksplicit — output-tokens koster fire gange input. Start en ny chat for en ny opgave, fordi historikken sendes igen hver gang. Upload ikke en hel fil, når én sektion er nok. Skriv lange tekniske prompts på engelsk.