
Vad är tokens – och varför vissa språk kostar dubbelt så mycket
Kort sagt: en token är en textbit som ett neuralt nätverk arbetar med. Varken en bokstav eller ett ord: ett vanligt kort ord tar oftast en token, ett långt eller ovanligt delas upp i flera. På engelska är en token ungefär fyra tecken; på många andra språk är det närmare två. Den praktiska konsekvensen: samma tanke utanför engelska tar ungefär dubbelt så många tokens, så det kostar mer och går långsammare. Nedan: hur du kan se detta själv, hur input-tokens skiljer sig från output-tokens, och varför en lång konversation blir dyrare av sig själv.
Lättare att se en gång
Ta en mening och dela upp den som en modell gör. Det vertikala strecket är en token-gräns.
The cat sleeps on the windowsill.
→ The| cat| sleeps| on| the| windows|ill|.
8 tokens
Regeln är tydlig. Ett vanligt kort ord – ”the”, ”cat”, ”on” – är en enda token. Ett långt eller ovanligt delas upp: ”windows|ill”. Interpunktion är en egen token. Ett mellanslag klistras oftast till ordet som följer.
Nu samma tanke på ryska:
Кот спит на подоконнике.
→ Кот| спит| на| подо|конник|е|.
7 tokens – med hälften så många tecken
Nästan samma antal tokens för märkbart mindre text. Det är densitetsgapet: engelska är packat mer effektivt, eftersom modeller tränats mest på det och token-vokabulären anpassats för det.
Tumregeln
På engelska 1 token ≈ 4 tecken; på många andra språk ≈ 2 tecken. När du budgeterar, eller räknar ut om ett dokument får plats – dubbla din uppskattning utanför engelska.
Detta handlar inte bara om pengar. Antalet tokens avgör om din text överhuvudtaget får plats i modellens fönster, och hur snabbt svaret kommer.
Tokens räknas två gånger: in och ut
En konversation med en modell består av två delar tokens, som faktureras separat.
- Input – allt du skickar: frågan, inklistrad text, en fil, en bild, konversationshistoriken.
- Output – allt modellen skriver tillbaka.
Skillnaden är inte terminologi utan pengar: output kostar flera gånger mer. Med Gemini 2.5 Flash-Lite per den 30 juli 2026 är input $0.10 per miljon tokens och output $0.40. Fyra gånger.
Låt oss räkna. En fråga på 100 ord är cirka 300 input-tokens – $0.00003. Ett svar på 500 ord är cirka 1 500 output-tokens – $0.0006. Svaret kostar tjugo gånger mer än frågan, även om du skrev din själv och modellen producerade sitt eget på sekunder.
Därav regeln som sparar mest: förkorta svaret, inte frågan. En rad som säger ”svara i ett stycke” minskar kostnaden mer än att halvera din fråga. Och ”förklara i detalj, med alla exempel” är den dyraste frasen du kan skriva till en modell.
Varför en lång konversation blir dyrare för varje meddelande
Modellen minns inte tidigare turer. För att den ska följa tråden skickas hela utbytet igen – varje gång, från början. Ditt tionde meddelande drar med sig de nio tidigare, och alla räknas som input igen.
Meddelande 1: 300 input-tokens.
Meddelande 5: 300 egna + 1 800 historik = 2 100.
Meddelande 10: 300 egna + 4 500 historik = 4 800.
Du fortsätter skriva lika korta svar medan input växer av sig själv. Det är därför en lång allt-i-ett-tråd kostar mer än en ny chatt med samma fråga – och varför modellen till slut börjar tappa början av konversationen: den gamla texten får inte längre plats.
Kontextfönstret: där allt samlas
Allt modellen har tillgängligt just nu ligger på ett bord – det är kontextfönstret. På det samtidigt: systeminstruktionen, hela konversationshistoriken, eventuella uppladdade filer och utrymme för svaret den skriver.
Storleken på det bordet mäts i tokens. I mitten av 2026 är toppmodellerna runt en miljon: det är vad Claude Sonnet 4.6 (i beta), Gemini och GPT-5.4 annonserar. Ett par år tidigare var standarden 128 tusen – åtta gånger mindre.
En miljon tokens är ungefär 2 500 sidor engelsk text, eller cirka 1 250 sidor på ett tätare språk. Och det är för allt tillsammans: historik, filer och svaret.
En ärlig varning du inte hittar i marknadsföringen: det annonserade fönstret och det fungerande är olika saker. Modellen accepterar formellt en miljon tokens, men kvaliteten sjunker märkbart tidigare – mitt i en enorm text blir den förvirrad och hittar saker mindre tillförlitligt. Ju närmare gränsen, desto försiktigare bör du behandla svaret.
Vad du kan göra med allt detta
- Begränsa svarets längd explicit. ”Tre meningar”, ”en lista med fem” – direkta besparingar.
- Ny uppgift, ny chatt. Billigare och mer exakt: gammal kontext slutar störa.
- Ladda inte upp en hel fil när du bara behöver en sektion. Klipp ut den del som är viktig – svaret blir bättre, inte bara billigare.
- Prova långa tekniska prompts på engelska. Token-besparingarna kommer som en bonus till att modeller följer en engelsk brief mer exakt.
Var du kan se dina egna token-antal
Om du når modellen via ett API, innehåller svaret ett usageMetadata-block: modellen själv rapporterar hur många tokens som gick in och hur många som kom ut, uppdelat per modalitet. Det är det ärligaste sättet att kontrollera alla beräkningar – inklusive våra.
FAQ
Vad är en token i ett neuralt nätverk, på vanligt språk?
En token är en textbit som modellen arbetar med – varken en bokstav eller ett ord. Ett vanligt kort ord tar oftast en token, ett långt eller ovanligt delas upp i flera, och interpunktion får en egen token. Meningen ”The cat sleeps on the windowsill” blir 8 tokens.
Hur många tecken är en token?
Ungefär fyra tecken per token på engelska, och närmare två på många andra språk. Samma tanke tar därför en och en halv till två gånger fler tokens utanför engelska, och kostar proportionellt mer.
Varför kostar AI mer på andra språk än engelska?
Modeller tränades mest på engelsk text, och token-vokabulären anpassades för engelska. Andra språk delas upp i mindre bitar, så samma tanke tar ungefär dubbelt så många tokens. Fakturering sker per token, därav prisskillnaden.
Vad är skillnaden mellan input- och output-tokens?
Input är allt du skickar till modellen: din fråga, filer, konversationshistoriken. Output är vad den skriver tillbaka. De faktureras separat och output kostar mer: med Gemini 2.5 Flash-Lite är det $0.40 mot $0.10 per miljon per den 30 juli 2026.
Varför blir en lång AI-konversation dyrare?
Modellen minns inte tidigare turer – hela utbytet skickas om med varje meddelande. Ditt tionde meddelande drar med sig de nio tidigare, och de räknas som input-tokens igen. Du skriver lika kortfattat medan input växer av sig själv.
Vad är ett kontextfönster och hur stort är det nu?
Det är allt modellen har tillgängligt just nu: systeminstruktionen, konversationshistoriken, uppladdade filer och utrymme för svaret. Det mäts i tokens. I mitten av 2026 är toppmodellerna runt en miljon – ungefär 2 500 sidor engelsk text. Ett par år tidigare var standarden 128 tusen.
Fungerar ett kontextfönster på en miljon tokens verkligen som en miljon?
Nej. Det annonserade fönstret och det fungerande är olika saker. Modellen accepterar formellt en miljon tokens, men kvaliteten sjunker märkbart tidigare: mitt i en enorm text blir den förvirrad och hämtar information mindre tillförlitligt. Ju närmare gränsen, desto försiktigare bör du behandla svaret.
Hur minskar jag token-användningen?
Begränsa svarets längd explicit – output-tokens kostar fyra gånger input. Starta en ny chatt för en ny uppgift, eftersom historiken skickas om varje gång. Ladda inte upp en hel fil när en sektion räcker. Skriv långa tekniska prompts på engelska.