Neurocourse

Hvorfor modeller bliver bedre: hvad ændrer sig mellem versioner

Hvad der faktisk forbedres i nyere modeller – viden, ræsonnement, pålidelighed, kapacitet – og hvorfor sidste års «AI kan ikke gøre dette» allerede er forældet.

Sommeren 2023 havde modellerne en yndlingsopgave, de snublede over: «hvor mange bogstaver «r» er der i ordet «radise»». De svarede selvsikkert og forkert. Spurgte man, hvad 17 × 24 ville give, fik man et flot tal, der var helt ved siden af. Bad man dem henvise til en artikel, fik man et troværdigt navn på et ikke-eksisterende værk.

I dag løser en almindelig model de samme spørgsmål uden at tøve. Ikke fordi nogen har indtastet svarene i en tabel, men fordi flere generationer er skiftet ud på tre år. Lad os se på, hvad der præcist ændrer sig fra version til version – det er den eneste måde ikke at basere planer på gårsdagens begrænsninger.

Hvad der reelt forbedres

«Modellen er blevet klogere» – det siger ikke noget. Forbedringerne sker inden for fire separate områder, og de er ikke forbundet med hinanden: en model kan regne fremragende og stadig finde på links.

  • Viden. Friskere og bredere træningsdata. Her er fremskridtet det mest kedelige: spørgsmålet er kun, hvad der er lagt i træningsdatasættet.
  • Ræsonnement. Evnen til at holde flere trin i træk uden at miste tråden. Her skete det største spring: modellerne blev lært at «tænke» for sig selv først og derefter svare. Før blev svaret spyttet ud med det samme – som en elev, der begynder at tale, før spørgsmålet er færdigt.
  • Pålidelighed. Hvor ofte modellen selvsikkert lyver. Det er blevet markant sjældnere, og det vigtigste er dukket op – den erkender oftere, at den ikke ved noget, i stedet for at finde på noget troværdigt. Men problemet er ikke løst: opdigtede links og detaljer forekommer stadig, og det er stadig nødvendigt at tjekke.
  • Omfang og sanser. Kontekstvinduet er vokset fra 128 tusind tokens til en million, billeder, lyd, video er blevet tilføjet. Om vinduet handlede den forrige lektion.

Hvorfor forbedres de egentlig?

Tre håndtag, og alle tre fortsætter med at virke.

  1. Flere beregninger til træning. Hver næste generation trænes længere og på et større antal grafikkort. Den mest direkte vej: de samme principper, flere ressourcer.
  2. Bedre data, ikke kun mere. Tidlige modeller blev trænet på hele internettet i flæng. Nu renses datasættet, skrald sorteres fra, og specielt skrevne eksempler på gode ræsonnementer tilføjes. Husker du lektionen om data – der er også svaret på, hvorfor dette er vigtigere end mængden.
  3. Træning baseret på menneskelige vurderinger. Folk får vist par af svar, de markerer det bedste, modellen tilpasser sig. Sådan lærer den ikke at «fortsætte tekst», men at være nyttig: at svare relevant, erkende uvidenhed, ikke være uhøflig.

Sådan ser det ud med en enkelt opgave

Lad os tage en opgave, hvor forskellen er synlig med det blotte øje:

Jeg var 8 år, da min søster var halvt så gammel. Nu er jeg 30. Hvor gammel er min søster?

Fælden ligger i ordene «halvt så gammel». Den, der svarer ud fra første indskydelse, deler den nuværende alder i to og siger 15. Det var præcis sådan, de tidlige modeller svarede – og ærligt talt, det er også sådan halvdelen af mennesker svarer.

Den rigtige fremgangsmåde er en anden. Da jeg var 8, var min søster 4 – det betyder, at hun er 4 år yngre, og denne forskel ændrer sig aldrig. Jeg er 30, så min søster er 26.

Forskellen mellem 15 og 26 er ikke «lidt mere præcis». Det er forskellige svar: det ene forkert, det andet rigtigt. Og det skyldes netop, at modellen først analyserer betingelsen trin for trin, i stedet for at gribe det første passende tal.

Hvad det betyder for dig personligt

Tre konklusioner, der er mere værd end enhver liste over versioner.

  • Din erfaring forældes hurtigere, end du tror. «Jeg har prøvet det, AI'en kan ikke det» – en sætning med udløbsdato. Hvis du prøvede det for et år siden, siger det intet om i dag.
  • Lad dig ikke binde til én model. Lederen skifter hvert par måneder. En nyttig færdighed er ikke at «kende ChatGPT», men at kunne formulere opgaven, så ethvert værktøj forstår den.
  • Det er stadig nødvendigt at tjekke. Modellerne er blevet mere pålidelige, men ikke fejlfri. Jo vigtigere beslutningen er, desto strengere er kontrollen – denne regel er ikke forældet i nogen generation.

Gør det nu: prøv at slå ræsonnement fra

Vi bygger ikke en tidsmaskine, men du kan prøve at forbyde modellen det, den er blevet trænet i de sidste tre år – at tænke før svaret. Kør to prompter i træk og sammenlign.

Første – et forsøg på at genskabe de tidlige modellers måde: svar med det samme, uden trin.

Svar øjeblikkeligt, på én linje, kun det endelige tal. Uden ræsonnement, uden mellemtrin, uden kontrol:
Et abonnement koster 300 rubler om måneden. Fra den fjerde måned steg prisen med 10%, fra den ottende – faldt den med 20% af den seneste pris. Hvor meget er der i alt betalt for 9 måneder?

Anden – hvordan de svarer nu: den samme opgave, men med analyse.

Løs trin for trin, vis hvert trin og mellemsummer. Til sidst tjek svaret ved at lægge alt sammen igen:
Et abonnement koster 300 rubler om måneden. Fra den fjerde måned steg prisen med 10%, fra den ottende – faldt den med 20% af den seneste pris. Hvor meget er der i alt betalt for 9 måneder?

Det rigtige svar er 2748 rubler: tre måneder à 300, fire à 330, to à 264.

Hvad du sandsynligvis vil se

Vi prompterede disse forespørgsler, før vi skrev lektionen, og resultatet viste sig at være mere interessant end forventet.

  • Modellen adlyder ofte ikke den første prompt. Den bliver bedt om én linje uden ræsonnement – men den begynder alligevel at regne højt. Vanen med at tænke før svaret er indlejret så dybt i den, at den omgår et direkte forbud.
  • Når den alligevel adlyder – laver den fejl. På denne opgave stikker det hurtige svar af: det er let at overse, at rabatten beregnes ud fra den allerede forhøjede pris, og ikke fra de oprindelige 300.
  • Den anden prompt giver ikke kun svaret, men også en kæde. Og det er det vigtigste: tallet kan tjekkes. Et hurtigt svar må tages for gode varer.

Forresten, om klassiske fældeopgaver – «bat og bold», «åkander på dammen». Vi tjekkede dem også: dagens model løser dem korrekt selv uden trin, fordi den har set dem tusindvis af gange i træningen. Fælderne, som AI'en snublede over for tre år siden, er holdt op med at virke – det er præcis, hvad hele lektionen handler om.

Praktisk konklusion: «løs trin for trin» – er ikke en høflig anmodning, men en kontakt. Den aktiverer en mekanisme, som flere generationer af modeller er skiftet ud for, og forvandler svaret fra «tro mig» til «tjek mig».

Practice · 3 задачи

Short questions on the lesson — with an explanation for every answer.