Waarom modellen beter worden: wat verandert er tussen versies?
Wat verbetert er in nieuwe AI-modellen (kennis, redeneren, betrouwbaarheid, capaciteit) en waarom «AI kan dit niet» van vorig jaar al verleden tijd is.
In de zomer van 2023 hadden modellen een favoriete taak waar ze over struikelden: „hoeveel keer de letter 'r' zit er in het woord 'radijs'”. Ze antwoordden zelfverzekerd en fout. Vroeg je wat 17 × 24 was, dan kreeg je een mooi getal dat er ver naast zat. Vroeg je om een artikel te citeren, dan kreeg je een aannemelijke titel van een niet-bestaand werk.
Vandaag de dag beantwoordt een gewoon model diezelfde vragen zonder haperen. Niet omdat iemand de antwoorden in een tabel heeft gezet, maar omdat er in drie jaar tijd verschillende generaties zijn gewisseld. We bekijken wat er precies verandert van versie tot versie — dit is de enige manier om geen plannen te baseren op verouderde beperkingen.
Wat er echt verbetert
„Het model is slimmer geworden” — dat zegt niets. Verbeteringen vinden plaats op vier afzonderlijke gebieden, en die staan los van elkaar: een model kan uitstekend rekenen en tegelijkertijd nog steeds links verzinnen.
- Kennis. Recentere en bredere trainingsdata. Hier is de vooruitgang het saaist: het gaat er alleen om wat er in de trainingsset is gestopt.
- Redeneren. Het vermogen om meerdere stappen achter elkaar te volgen zonder de draad kwijt te raken. Hier vond de grootste sprong plaats: modellen leerden eerst intern te „denken” en daarna pas te antwoorden. Voorheen werd het antwoord er meteen uit geflapt — als een leerling die begint te praten voordat de vraag is afgemaakt.
- Betrouwbaarheid. Hoe vaak het model overtuigend liegt. Het is aanzienlijk minder vaak geworden, en het belangrijkste is verschenen — het geeft vaker toe dat het iets niet weet, in plaats van iets aannemelijks te verzinnen. Maar het probleem is niet opgelost: verzonnen links en details komen nog steeds voor, en controleren blijft nodig.
- Omvang en zintuigen. Het contextvenster is gegroeid van 128 duizend tokens naar een miljoen, afbeeldingen, geluid en video zijn toegevoegd. Over het venster ging de vorige les.
Waarom ze überhaupt verbeteren
Drie hefbomen, en alle drie blijven werken.
- Meer rekenkracht voor training. Elke volgende generatie wordt langer en met meer grafische kaarten getraind. De meest directe weg: dezelfde principes, meer middelen.
- Betere data, niet alleen meer. Vroege modellen werden getraind op het hele internet. Nu wordt de dataset opgeschoond, rommel eruit gefilterd en worden er speciaal geschreven voorbeelden van goede redeneringen toegevoegd. Herinner je de les over data — daar vind je ook het antwoord waarom dit belangrijker is dan volume.
- Training op basis van menselijke beoordelingen. Mensen krijgen paren antwoorden te zien, ze markeren de beste, en het model past zich aan. Zo leert het niet om „tekst voort te zetten”, maar om nuttig te zijn: ter zake antwoorden, onwetendheid toegeven, niet onbeleefd zijn.
Hoe dit eruitziet bij één taak
Laten we een taak nemen waarbij het verschil met het blote oog zichtbaar is:
Ik was 8 jaar oud toen mijn zus de helft van die leeftijd had. Nu ben ik 30. Hoe oud is mijn zus?
De valkuil zit in de woorden „de helft van die leeftijd”. Wie op de eerste indruk antwoordt, deelt de huidige leeftijd door twee en zegt 15. Precies zo antwoordden vroege modellen — en eerlijk gezegd antwoordt de helft van de mensen ook zo.
De juiste aanpak is anders. Toen ik 8 was, was mijn zus 4 — dat betekent dat ze 4 jaar jonger is, en dat verschil verandert nooit. Ik ben 30, dus mijn zus is 26.
Het verschil tussen 15 en 26 is niet „iets preciezer”. Het zijn verschillende antwoorden: het ene is fout, het andere is correct. En dat komt precies omdat het model eerst de voorwaarde stap voor stap analyseert, in plaats van het eerste geschikte getal te pakken.
Wat dit persoonlijk voor jou betekent
Drie conclusies die meer waard zijn dan welke versielijst dan ook.
- Jouw ervaring veroudert sneller dan je denkt. „Ik heb het geprobeerd, AI kan dit niet” — een zin met een houdbaarheidsdatum. Als je het een jaar geleden probeerde, zegt dat niets over vandaag.
- Bind je niet aan één model. De leider wisselt elke paar maanden. Een nuttige vaardigheid is niet „ChatGPT kennen”, maar de taak zo kunnen formuleren dat elk hulpmiddel het begrijpt.
- Controleren blijft nodig. Modellen zijn betrouwbaarder geworden, maar niet foutloos. Hoe belangrijker de beslissing, hoe strenger de controle — deze regel is in geen enkele generatie verouderd.
Doe nu: probeer redeneren uit te schakelen
Een tijdmachine bouwen we niet, maar je kunt proberen het model te verbieden wat het de afgelopen drie jaar heeft geleerd — denken vóór het antwoord. Voer twee prompts achter elkaar uit en vergelijk.
De eerste — een poging om de manier van vroege modellen terug te brengen: antwoord direct, zonder stappen.
Antwoord direct, op één regel, alleen het eindgetal. Zonder redenering, zonder tussenstappen, zonder controle: Een abonnement kost 300 roebel per maand. Vanaf de vierde maand steeg de prijs met 10%, vanaf de achtste daalde deze met 20% van de laatste prijs. Hoeveel is er in totaal betaald over 9 maanden?
De tweede — hoe ze nu antwoorden: dezelfde taak, maar met analyse.
Los stap voor stap op, toon elke stap en tussensommen. Controleer aan het einde het antwoord door alles opnieuw op te tellen: Een abonnement kost 300 roebel per maand. Vanaf de vierde maand steeg de prijs met 10%, vanaf de achtste daalde deze met 20% van de laatste prijs. Hoeveel is er in totaal betaald over 9 maanden?
Het juiste antwoord is 2748 roebel: drie maanden à 300, vier à 330, twee à 264.
Wat je waarschijnlijk zult zien
We hebben deze prompts uitgevoerd voordat we de les schreven, en het resultaat was interessanter dan verwacht.
- Het model luistert vaak niet naar de eerste prompt. Ze vragen om één regel zonder redenering — en toch begint het hardop te rekenen. De gewoonte om na te denken vóór het antwoord is er zo diep ingebakken, dat het een direct verbod omzeilt.
- Als het toch luistert — maakt het fouten. Bij deze taak wijkt het snelle antwoord af: het is gemakkelijk te missen dat de korting wordt berekend op basis van de reeds verhoogde prijs, en niet op de oorspronkelijke 300.
- De tweede prompt geeft niet alleen het antwoord, maar ook de stappen. En dit is het belangrijkste: het getal kan worden gecontroleerd. Een snel antwoord moet je voor waar aannemen.
Over klassieke valkuilopgaven gesproken — „knuppel en bal”, „waterlelies op de vijver”. We hebben ze ook getest: het huidige model lost ze correct op, zelfs zonder stappen, omdat het ze duizenden keren heeft gezien tijdens de training. De valkuilen waar AI drie jaar geleden over struikelde, werken niet meer — precies daarover gaat de hele les.
Praktische conclusie: „los stap voor stap op” — is geen beleefd verzoek, maar een schakelaar. Het activeert een mechanisme waarvoor meerdere generaties modellen zijn gewisseld, en verandert het antwoord van „geloof me” in „controleer me”.
Short questions on the lesson — with an explanation for every answer.