Neurocourse

Varför modeller blir bättre: vad som ändras mellan versioner

Vad som faktiskt förbättras i nyare modeller — kunskap, resonemang, tillförlitlighet, kapacitet — och varför förra årets «AI kan inte göra detta» redan är inaktuellt.

Sommaren 2023 hade modellerna en favorituppgift som de snubblade på: ”hur många bokstäver ”r” finns i ordet ”rädisa””. De svarade självsäkert och felaktigt. När man frågade vad 17 × 24 blev, fick man ett snyggt men felaktigt nummer. När man bad om en referens till en artikel, fick man en trovärdig titel på ett icke-existerande verk.

Idag hanterar en vanlig modell samma frågor utan problem. Inte för att någon har skrivit in svaren i en tabell, utan för att flera generationer har bytts ut under tre år. Låt oss titta på exakt vad som förändras från version till version – det är det enda sättet att inte planera utifrån gårdagens begränsningar.

Vad som faktiskt förbättras

”Modellen har blivit smartare” – det säger ingenting. Förbättringarna sker längs fyra separata linjer, och de är inte kopplade till varandra: en modell kan vara utmärkt på att räkna och ändå fortsätta att hitta på referenser.

  • Kunskap. Färskare och bredare träningsdata. Här är framstegen de tråkigaste: frågan är bara vad som lades i träningsurvalet.
  • Resonemang. Förmågan att hålla flera steg i följd utan att tappa tråden. Här skedde det största språnget: modellerna lärdes att först ”tänka” för sig själva och sedan svara. Tidigare spottades svaret ut direkt – som en elev som börjar prata innan frågan är färdigställd.
  • Pålitlighet. Hur ofta modellen självsäkert ljuger. Det har blivit märkbart mer sällsynt, och det viktigaste har kommit – den erkänner oftare att den inte vet något, istället för att hitta på något trovärdigt. Men problemet är inte löst: påhittade referenser och detaljer förekommer fortfarande, och du måste fortfarande kontrollera.
  • Omfattning och sinnen. Kontextfönstret har vuxit från 128 tusen tokens till en miljon, bilder, ljud och video har lagts till. Vi pratade om fönstret i förra lektionen.

Varför de överhuvudtaget förbättras

Tre spakar, och alla tre fortsätter att fungera.

  1. Mer beräkningskraft för träning. Varje nästa generation tränas längre och med fler grafikkort. Den mest direkta vägen: samma principer, mer resurser.
  2. Bättre data, inte bara mer. Tidiga modeller tränades på hela internet. Nu rensas urvalet, skräp filtreras bort och specialskrivna exempel på goda resonemang läggs till. Du minns lektionen om data – där finns också svaret på varför detta är viktigare än volym.
  3. Träning baserad på mänskliga bedömningar. Människor visas par av svar, de markerar det bästa, och modellen anpassar sig. På så sätt lär den sig inte att ”fortsätta texten”, utan att vara användbar: att svara relevant, erkänna okunskap och att inte vara otrevlig.

Hur det ser ut i en uppgift

Låt oss ta en uppgift där skillnaden är uppenbar:

Jag var 8 år när min syster var hälften så gammal. Nu är jag 30. Hur gammal är min syster?

Fällan ligger i orden ”hälften så gammal”. Den som svarar på första intrycket delar den nuvarande åldern på mitten och säger 15. Det var precis så tidiga modeller svarade – och ärligt talat, så svarar hälften av människorna också.

Det rätta sättet är annorlunda. När jag var 8 var min syster 4 – vilket betyder att hon är 4 år yngre, och den skillnaden ändras aldrig. Jag är 30, så min syster är 26.

Skillnaden mellan 15 och 26 är inte ”lite mer exakt”. Det är olika svar: ett felaktigt, ett korrekt. Och det beror just på att modellen först analyserar villkoret steg för steg, istället för att bara ta det första lämpliga numret.

Vad det betyder för dig personligen

Tre slutsatser som är värda mer än någon lista över versioner.

  • Din erfarenhet blir föråldrad snabbare än du tror. ”Jag har provat, AI kan inte det” – är en fras med kort hållbarhet. Om du provade för ett år sedan, säger det ingenting om idag.
  • Fäst dig inte vid en enda modell. Ledaren byts ut varannan månad. En användbar färdighet är inte att ”känna till ChatGPT”, utan att kunna formulera en uppgift så att vilket verktyg som helst förstår den.
  • Du måste fortfarande kontrollera. Modellerna har blivit mer pålitliga, men inte felfria. Ju viktigare beslutet är, desto noggrannare kontroll – den regeln har inte blivit föråldrad under någon generation.

Gör nu: prova att stänga av resonemanget

Vi kan inte bygga en tidsmaskin, men du kan försöka förbjuda modellen det den har lärt sig de senaste tre åren – att tänka innan den svarar. Kör två prompts i rad och jämför.

Första – ett försök att återgå till tidiga modellers sätt: svar direkt, utan steg.

Svara omedelbart, på en rad, endast det slutliga numret. Utan resonemang, utan mellansteg, utan kontroll:
En prenumeration kostar 300 rubel per månad. Från den fjärde månaden ökade priset med 10%, från den åttonde – sjönk det med 20% av det senaste priset. Hur mycket har betalats totalt under 9 månader?

Andra – hur de svarar nu: samma uppgift, men med analys.

Lös steg för steg, visa varje steg och delsummor. Kontrollera svaret i slutet genom att lägga ihop allt igen:
En prenumeration kostar 300 rubel per månad. Från den fjärde månaden ökade priset med 10%, från den åttonde – sjönk det med 20% av det senaste priset. Hur mycket har betalats totalt under 9 månader?

Rätt svar är 2748 rubel: tre månader à 300, fyra à 330, två à 264.

Vad du troligen kommer att se

Vi har kört dessa prompts innan vi skrev lektionen, och resultatet visade sig vara mer intressant än tänkt.

  • Modellen lyder ofta inte den första prompten. Den ombeds om en enda rad utan resonemang – men den börjar ändå räkna högt. Vanan att tänka innan den svarar är så djupt inpräntad att den kringgår ett direkt förbud.
  • När den ändå lyder – gör den fel. I denna uppgift blir det snabba svaret fel: det är lätt att missa att rabatten beräknas från det redan höjda priset, och inte från de ursprungliga 300.
  • Den andra prompten ger inte bara svaret, utan också en kedja. Och det är det viktigaste: siffran kan kontrolleras. Ett snabbt svar måste accepteras på tro.

Förresten, om klassiska fälluppgifter – ”slagträ och boll”, ”näckrosor i dammen”. Vi har också kontrollerat dem: dagens modell löser dem korrekt även utan steg, eftersom den har sett dem tusentals gånger under träningen. Fällorna som AI snubblade på för tre år sedan fungerar inte längre – det är precis vad hela lektionen handlar om.

Den praktiska slutsatsen: ”lös steg för steg” – är inte en artig begäran, utan en omkopplare. Den aktiverar en mekanism som flera generationer av modeller har bytts ut för, och förvandlar svaret från ”tro mig” till ”kontrollera mig”.

Practice · 3 задачи

Short questions on the lesson — with an explanation for every answer.