Hvorfor modeller stadig blir bedre: hva som faktisk endres mellom versjoner
Hva som faktisk forbedres i nyere modeller – kunnskap, resonnement, pålitelighet, kapasitet – og hvorfor fjorårets «AI kan ikke gjøre dette» allerede er utdatert.
Sommeren 2023 hadde modellene en favorittoppgave de snublet på: «hvor mange «r»-er er det i ordet «reddik»». De svarte selvsikkert og feil. Når de ble spurt om 17 × 24, fikk de et pent tall som var helt feil. Når de ble bedt om å referere til en artikkel, fikk de en troverdig tittel på et ikke-eksisterende verk.
I dag løser en vanlig modell de samme spørsmålene uten problemer. Ikke fordi noen har skrevet svarene inn i en tabell, men fordi flere generasjoner har endret seg på tre år. Vi skal se på hva som endres fra versjon til versjon – dette er den eneste måten å unngå å planlegge basert på gårsdagens begrensninger.
Hva som faktisk blir bedre
«Modellen har blitt smartere» – det sier ingenting. Forbedringene skjer langs fire separate linjer, og de er ikke koblet sammen: en modell kan regne utmerket og likevel finne på lenker.
- Kunnskap. Nyere og bredere treningsdata. Her er fremgangen den kjedeligste: spørsmålet er bare hva som ble lagt i treningsdatasettet.
- Resonnement. Evnen til å holde flere trinn på rad uten å miste tråden. Her skjedde det største spranget: modellene ble lært å først «tenke» for seg selv, og deretter svare. Tidligere ble svaret spyttet ut med en gang – som en elev som begynner å snakke før spørsmålet er ferdig.
- Pålitelighet. Hvor ofte modellen lyver selvsikkert. Det har blitt merkbart sjeldnere, og det viktigste har dukket opp – den innrømmer oftere at den ikke vet noe, i stedet for å dikte opp noe troverdig. Men problemet er ikke løst: oppdiktede lenker og detaljer forekommer fortsatt, og du må fortsatt sjekke.
- Omfang og sanser. Kontekstvinduet vokste fra 128 tusen tokens til en million, bilder, lyd og video ble lagt til. Forrige leksjon handlet om vinduet.
Hvorfor de i det hele tatt blir bedre
Tre spaker, og alle tre fortsetter å virke.
- Mer datakraft til trening. Hver neste generasjon trenes lenger og med flere grafikkort. Den mest direkte veien: de samme prinsippene, mer ressurser.
- Bedre data, ikke bare mer. Tidlige modeller ble trent på hele internett uten videre. Nå renses datasettet, søppel sorteres ut, og spesielt skrevne eksempler på gode resonnementer legges til. Husker du leksjonen om data – der er også svaret på hvorfor dette er viktigere enn volum.
- Trening basert på menneskelige vurderinger. Folk får vist par av svar, de markerer det beste, og modellen justerer seg. Slik lærer den ikke å «fortsette teksten», men å være nyttig: svare relevant, innrømme uvitenhet, ikke være frekk.
Slik ser det ut for én oppgave
La oss ta en oppgave der forskjellen er synlig med det blotte øye:
Jeg var 8 år da søsteren min var halvparten så gammel. Nå er jeg 30. Hvor gammel er søsteren min?
Fellen ligger i ordene «halvparten så gammel». Den som svarer ut fra førsteinntrykket, deler den nåværende alderen i to og sier 15. Akkurat slik svarte tidlige modeller – og, ærlig talt, slik svarer halvparten av folk også.
Den riktige fremgangsmåten er en annen. Da jeg var 8, var søsteren min 4 – det betyr at hun er 4 år yngre, og denne forskjellen endres aldri. Jeg er 30, så søsteren min er 26.
Forskjellen mellom 15 og 26 er ikke «litt mer nøyaktig». Dette er forskjellige svar: ett er feil, det andre er riktig. Og det er nettopp fordi modellen først analyserer betingelsen trinn for trinn, i stedet for å gripe det første passende tallet.
Hva dette betyr for deg personlig
Tre konklusjoner som er verdt mer enn noen versjonsliste.
- Din erfaring blir utdatert raskere enn du tror. «Jeg har prøvd, AI kan ikke dette» – en setning med utløpsdato. Hvis du prøvde for et år siden, sier det ingenting om i dag.
- Ikke bind deg til én modell. Lederen endrer seg hvert par måneder. En nyttig ferdighet er ikke å «kjenne ChatGPT», men å kunne formulere en oppgave slik at ethvert verktøy forstår den.
- Du må fortsatt sjekke. Modellene har blitt mer pålitelige, men ikke feilfrie. Jo viktigere avgjørelsen er, desto strengere er kontrollen – denne regelen har ikke gått ut på dato i noen generasjon.
Gjør dette nå: prøv å slå av resonnementet
Vi kan ikke bygge en tidsmaskin, men du kan prøve å forby modellen det den har lært de siste tre årene – å tenke før den svarer. Kjør to spørsmål etter hverandre og sammenlign.
Første – et forsøk på å gjenopprette manerer fra tidlige modeller: svar umiddelbart, uten trinn.
Svar umiddelbart, på én linje, bare det endelige tallet. Uten resonnement, uten mellomtrinn, uten sjekk: Et abonnement koster 300 rubler i måneden. Fra den fjerde måneden økte prisen med 10 %, fra den åttende – falt den med 20 % av den siste prisen. Hvor mye er totalt betalt for 9 måneder?
Andre – hvordan de svarer nå: samme oppgave, men med analyse.
Løs trinn for trinn, vis hvert trinn og mellomsummer. Til slutt, sjekk svaret ved å legge alt sammen på nytt: Et abonnement koster 300 rubler i måneden. Fra den fjerde måneden økte prisen med 10 %, fra den åttende – falt den med 20 % av den siste prisen. Hvor mye er totalt betalt for 9 måneder?
Riktig svar er 2748 rubler: tre måneder à 300, fire à 330, to à 264.
Hva du mest sannsynlig vil se
Vi kjørte disse spørsmålene før vi skrev leksjonen, og resultatet var mer interessant enn forventet.
- Modellen adlyder ofte ikke den første prompten. Den blir bedt om én linje uten resonnement – men den begynner likevel å regne høyt. Vanen med å tenke før den svarer er så dypt inngrodd at den omgår et direkte forbud.
- Når den likevel adlyder – gjør den feil. På denne oppgaven sklir det raske svaret ut: det er lett å glemme at rabatten beregnes fra den allerede økte prisen, og ikke fra de opprinnelige 300.
- Den andre prompten gir ikke bare svaret, men også en kjede. Og dette er det viktigste: tallet kan sjekkes. Et raskt svar må tas for gitt.
Forresten, om klassiske felleoppgaver – «balltre og ball», «vannliljer på dammen». Vi sjekket dem også: dagens modell løser dem riktig selv uten trinn, fordi den har sett dem i treningen tusenvis av ganger. Fellene som AI snublet på for tre år siden, har sluttet å fungere – akkurat dette handler hele leksjonen om.
Praktisk konklusjon: «løs trinn for trinn» – er ikke en høflig forespørsel, men en bryter. Den aktiverer mekanismen som flere generasjoner modeller har endret seg for, og forvandler svaret fra «tro meg» til «sjekk meg».
Short questions on the lesson — with an explanation for every answer.