Neurocourse

LLM och tokens: hur en maskin skriver text

ChatGPT, Claude och Gemini är stora språkmodeller (LLM). Deras enda uppgift är att förutsäga nästa token, en textbit. Hur hela artiklar och kod uppstår från denna enkla mekanism, vad tokens och kontextfönster är – och varför allt detta är praktiskt viktigt.

Dags att kika under huven på den här erans huvudrollsinnehavare – stora språkmodeller.

LLM: vad varje bokstav står för

Stor språkmodell. "Språk" – den lärde sig från text: böcker, artiklar, webbplatser, kod (bokstavligen en stor del av internet). "Stor" – hundratals miljarder vikter från förra lektionen. ChatGPT, Claude, Gemini, DeepSeek är alla LLM:er från olika företag, byggda på samma princip (samma transformer från 2017).

Det enkla tricket: gissa nästa bit

Allt en LLM gör är att förutsäga nästa token. Du skriver: "The capital of France is ". Modellen går igenom sitt ordförråd och poängsätter möjliga fortsättningar: "Paris" – 99 %, "Lyon" – 0,3 %, "banana" – 0,0001 %. Den väljer en trolig, lägger till den i texten – och förutsäger nästa bit. Om och om igen, ord för ord, och ett helt svar föds.

Vänta lite. Om modellen bara "gissar nästa ord" – hur kan den då skriva sammanhängande essäer och fungerande kod?

Svaret är elegant: för att förutsäga nästa ord väl i all text som mänskligheten har skrivit, var modellen tvungen att lära sig grammatik, fakta, resonemangskedjor, stilar och kodens struktur. Att förutsäga ett ord visade sig vara en uppgift med "förståelse" av språk gömd inuti den. Det är den stora upptäckten i LLM-eran – och den stora källan till argument om huruvida en modell verkligen "förstår" någonting.

Tokens: valutan i LLM-världen

De bitar en modell arbetar med kallas tokens. En token är inte alltid ett ord: ett kort ord är en token, ett långt delas upp i bitar, ett skiljetecken är en egen token. I genomsnitt är 1 token ≈ 3–4 tecken – men den regeln gäller bara för engelska. Värt att veta: i andra språk, särskilt de som inte använder det latinska alfabetet, är tokens "dyrare" – ofta bara 1–2 tecken vardera.

Så samma text, betydelse för betydelse, förbrukar märkbart fler tokens utanför engelska och når gränser och kontextfönstret snabbare. Praktiskt tips: om du arbetar på ett annat språk och räknar kostnad eller volym, ge dig själv marginal.

Tokens är ingen abstraktion – de syns i praktiken:

  • Kontextfönstret – hur många tokens modellen håller i huvudet samtidigt: din fråga, dess svar, filerna du laddade upp. Det som inte får plats "glömmer" modellen. Därför tappar långa konversationer början.
  • Pris – när du kopplar en modell till din egen programvara (det kallas ett API) betalar du per token. Att bygga en bot eller en automatisering innebär att räkna tokens.
  • Planbegränsningar – begränsningarna för "meddelanden per timme" på gratisplaner kommer också från token-ekonomin.

Hur "stor" är stor?

Få en känsla för skalan. Träningsdata för en flaggskepps-LLM uppgår till biljoner tokens: en person som läser en bok om dagen skulle behöva hundratusentals år för att ta sig igenom så mycket. Därför "kan" modellen fysik, och matlagningsrecept, och syntaxen för tjugo programmeringsspråk: den har statistiskt tuggat igenom all mänsklig skriven erfarenhet. Och därför finns det värsta av internet också där – företag lägger ner enorma ansträngningar på att filtrera data och polera beteendet (den förstärkningsinlärningen från mänskliga bedömningar från förra lektionen).

Generering, inte sökning

En avgörande konsekvens: en LLM slår inte upp svaret i en databas – den genererar det genom att förutsäga en trolig fortsättning. Därför kan den skriva en sonett om din katt, som aldrig funnits någonstans på internet (kreativitet!). Och lika så varför den med säkerhet kan skriva något falskt, om osanningen "låter trolig" (det är vad hela nästa lektion handlar om).

Under huven (valfritt): två intressanta fakta

Detta är en valfri djupdykning. Det kommer inte att ändra något i praktiken: hoppa till "Gör detta nu" om du vill. Men fakta är intressanta – två nya ord, två idéer.

Emergens. Den mest mystiska egenskapen hos stora modeller: när de växer framträder förmågor som ingen tränade in i dem. Modellen tränades för att förutsäga text – och plötsligt kan den översätta, lösa logiska pussel, skriva kod, förklara skämt. Dessa "från ingenstans"-förmågor kallas emergenta. Var effekten slutar, det diskuterar forskare fortfarande – och det är den stora öppna frågan för de närmaste åren: alla tre ingredienser (data, kraft, arkitektur) fortsätter att växa.

Temperatur. Fråga en modell samma fråga två gånger och svaren kommer att skilja sig åt. Det är inget fel: när den väljer nästa token tar modellen inte alltid den mest troliga – den får "ta en liten risk" (inställningen kallas bokstavligen temperatur). En nypa slumpmässighet håller texten levande istället för robotiskt identisk. Praktiskt tips: om du inte gillar ett svar räcker det ibland att bara generera om. Och "The capital of France is Paris" står stadigt: en 99 % sannolikhet överväger all slumpmässighet.

Gör detta nu

Kör denna prompt här, tryck sedan på Kör en andra gång utan att ändra ett ord:

Continue this sentence five different ways:
The morning started with…

Du kommer att se genereringens probabilistiska natur med egna ögon: en modell, en identisk förfrågan – och olika troliga fortsättningar.

Practice · 3 задачи

Short questions on the lesson — with an explanation for every answer.

Skip this lesson →