Neurocourse

LLM-er og tokens: hvordan en maskin skriver tekst

ChatGPT, Claude og Gemini er store språkmodeller (LLM-er). Deres eneste operasjon er å forutsi neste token, en tekstbit. Hvordan hele artikler og kode oppstår fra denne enkle mekanismen, hva tokens og kontekstvinduer er – og hvorfor alt dette er praktisk viktig.

På tide å se nærmere på hovedaktørene i denne æraen — store språkmodeller.

LLM: hva hver bokstav står for

Large Language Model. «Språk» — den lærte fra tekst: bøker, artikler, nettsteder, kode (bokstavelig talt en stor del av internett). «Stor» — hundrevis av milliarder av vekter fra forrige leksjon. ChatGPT, Claude, Gemini, DeepSeek er alle LLM-er fra forskjellige selskaper, bygget på samme prinsipp (den samme transformeren fra 2017).

Det ene trikset: gjett neste bit

Alt en LLM gjør er å forutsi neste token. Du skriver: «Hovedstaden i Frankrike er ». Modellen går gjennom vokabularet sitt og vurderer mulige fortsettelser: «Paris» — 99 %, «Lyon» — 0,3 %, «banan» — 0,0001 %. Den velger en sannsynlig en, legger den til teksten — og forutsier neste bit. Om og om igjen, ord for ord, og et helt svar blir til.

Vent litt. Hvis modellen bare «gjetter neste ord» — hvordan kan den da skrive sammenhengende essays og fungerende kode?

Svaret er elegant: for å forutsi neste ord godt i enhver tekst menneskeheten har skrevet, måtte modellen lære grammatikk, fakta, resonnementskjeder, stiler og kodens struktur. Å forutsi et ord viste seg å være en oppgave med «forståelse» av språk skjult i seg. Det er den store oppdagelsen i LLM-æraen — og den store kilden til diskusjoner om hvorvidt en modell virkelig «forstår» noe.

Tokens: valutaen i LLM-verdenen

Bitene en modell jobber med kalles tokens. Et token er ikke alltid et ord: et kort ord er ett token, et langt ord kuttes i biter, et skilletegn er et eget token. I gjennomsnitt er 1 token ≈ 3–4 tegn — men den regelen gjelder bare for engelsk. Verdt å vite: i andre språk, spesielt de som ikke bruker det latinske alfabetet, er tokens «dyrere» — ofte bare 1–2 tegn hver. Så den samme teksten, meningsmessig, bruker merkbart flere tokens utenfor engelsk og når grenser og kontekstvinduet raskere. Praktisk tips: hvis du jobber på et annet språk og teller kostnad eller volum, gi deg selv slingringsmonn.

  • Kontekstvinduet — hvor mange tokens modellen holder i hodet samtidig: spørsmålet ditt, svarene dens, filene du lastet opp. Det som ikke passer, «glemmer» modellen. Derfor mister lange samtaler begynnelsen.
  • Pris — når du kobler en modell til din egen programvare (det kalles et API), betaler du per token. Å bygge en bot eller en automatisering betyr å telle tokens.
  • Plangrenser — «meldinger per time»-begrensningene på gratisplaner stammer også fra token-økonomi.

Hvor «stor» er stor?

Få en følelse av omfanget. Treningsdatasettet til en flaggskip-LLM er på billioner av tokens: en person som leser en bok om dagen, ville trenge hundretusenvis av år for å komme gjennom så mye. Derfor «kan» modellen fysikk, og matoppskrifter, og syntaksen til tjue programmeringsspråk: den har statistisk sett tygget seg gjennom all menneskehetens skrevne erfaring. Og derfor er det verste av internett også der — selskaper legger ned enorm innsats i å filtrere dataene og forbedre oppførselen (den forsterkningslæringen fra menneskelige vurderinger fra forrige leksjon).

Generering, ikke søk

En viktig konsekvens: en LLM slår ikke opp svaret i en database — den genererer det ved å forutsi en sannsynlig fortsettelse. Derfor kan den skrive en sonett om katten din, som aldri har eksistert noe sted på internett (kreativitet!). Og likeledes hvorfor den trygt kan skrive noe usant, hvis usannheten «høres sannsynlig ut» (det er det hele neste leksjon handler om).

Under panseret (valgfritt): to interessante fakta

Det som følger er et valgfritt dypdykk. Det vil ikke endre noe i praksis: hopp til «Gjør dette nå» hvis du vil. Men faktaene er interessante — to nye ord, to ideer.

Emergens. Den mest mystiske egenskapen ved store modeller: når de vokser, dukker det opp evner som ingen trente dem til. Modellen ble trent til å forutsi tekst — og plutselig kan den oversette, løse logiske gåter, skrive kode, forklare vitser. Disse «ut av intet»-evnene kalles emergente. Hvor effekten stopper, diskuterer forskere fortsatt — og det er det store ubesvarte spørsmålet de neste årene: alle tre ingrediensene (data, kraft, arkitektur) fortsetter å vokse.

Temperatur. Spør en modell det samme spørsmålet to ganger, og svarene vil variere. Det er ikke en feil: når den velger neste token, tar modellen ikke alltid det mest sannsynlige — den har lov til å «ta en liten risiko» (innstillingen kalles bokstavelig talt temperatur). En klype tilfeldighet holder teksten levende i stedet for robotisk identisk. Praktisk tips: hvis du ikke liker et svar, er det noen ganger nok å bare generere på nytt. Og «Hovedstaden i Frankrike er Paris» står fjellstøtt: en 99 % sannsynlighet veier tyngre enn all tilfeldighet.

Gjør dette nå

Kjør denne prompten her, og trykk deretter Kjør en gang til uten å endre et ord:

Continue this sentence five different ways:
The morning started with…

Du vil se den probabilistiske naturen til generering med egne øyne: én modell, én identisk forespørsel — og forskjellige sannsynlige fortsettelser.

Practice · 3 задачи

Short questions on the lesson — with an explanation for every answer.

Skip this lesson →