Warum KI-Modelle immer besser werden
Was sich in neueren KI-Modellen wirklich verbessert – Wissen, Argumentation, Zuverlässigkeit, Kapazität – und warum „KI kann das nicht“ von gestern ist.
Im Sommer 2023 gab es eine Lieblingsaufgabe, an der die Modelle scheiterten: „Wie viele Buchstaben ‚r‘ sind im Wort ‚Radieschen‘?“ Sie antworteten selbstbewusst und falsch. Fragte man, wie viel 17 × 24 ist, erhielt man eine schöne, aber falsche Zahl. Bat man sie, einen Artikel zu zitieren, bekam man einen plausiblen Titel einer nicht existierenden Arbeit.
Heute beantwortet ein gewöhnliches Modell dieselben Fragen ohne Probleme. Nicht, weil jemand die Antworten in eine Tabelle eingetragen hat, sondern weil sich in drei Jahren mehrere Generationen geändert haben. Wir schauen uns an, was sich von Version zu Version ändert – das ist der einzige Weg, um nicht mit den Einschränkungen von gestern zu planen.
Was sich wirklich verbessert
„Das Modell ist schlauer geworden“ – das sagt nichts aus. Verbesserungen erfolgen in vier separaten Bereichen, die nicht miteinander verbunden sind: Ein Modell kann hervorragend rechnen und trotzdem weiterhin Links erfinden.
- Wissen. Aktuellere und umfassendere Trainingsdaten. Hier ist der Fortschritt am langweiligsten: Es geht nur darum, was in den Trainingsdatensatz aufgenommen wurde.
- Argumentation. Die Fähigkeit, mehrere Schritte hintereinander zu verfolgen, ohne den Faden zu verlieren. Hier gab es den größten Sprung: Modelle wurden darauf trainiert, zuerst „für sich selbst zu denken“ und dann zu antworten. Früher wurde die Antwort sofort herausgeschleudert – wie ein Schüler, der anfängt zu sprechen, bevor er die Frage zu Ende gehört hat.
- Zuverlässigkeit. Wie oft das Modell selbstbewusst lügt. Das ist deutlich seltener geworden, und das Wichtigste ist aufgetaucht: Sie gibt häufiger zu, etwas nicht zu wissen, anstatt etwas Plausibles zu erfinden. Das Problem ist jedoch nicht gelöst: Erfundene Links und Details tauchen immer noch auf, und du musst sie weiterhin überprüfen.
- Umfang und Sinne. Das Kontextfenster ist von 128.000 Tokens auf eine Million angewachsen, Bilder, Ton und Video wurden hinzugefügt. Über das Fenster ging es in der letzten Lektion.
Warum sie sich überhaupt verbessern
Drei Hebel, und alle drei funktionieren weiterhin.
- Mehr Rechenleistung für das Training. Jede nächste Generation wird länger und mit mehr Grafikkarten trainiert. Der direkteste Weg: dieselben Prinzipien, mehr Ressourcen.
- Bessere Daten, nicht nur mehr. Frühe Modelle wurden mit dem gesamten Internet trainiert. Jetzt wird die Auswahl bereinigt, Müll aussortiert und speziell geschriebene Beispiele für gute Argumentationen hinzugefügt. Erinnerst du dich an die Lektion über Daten – dort findest du auch die Antwort, warum das wichtiger ist als die Menge.
- Training mit menschlichen Bewertungen. Menschen werden Antwortpaare gezeigt, sie markieren die bessere, das Modell passt sich an. So lernt sie nicht, „Text fortzusetzen“, sondern nützlich zu sein: sachlich zu antworten, Unwissenheit zuzugeben, nicht unhöflich zu sein.
Wie das bei einer Aufgabe aussieht
Nehmen wir eine Aufgabe, bei der der Unterschied mit bloßem Auge sichtbar ist:
Ich war 8 Jahre alt, als meine Schwester halb so alt war. Jetzt bin ich 30. Wie alt ist meine Schwester?
Die Falle liegt in den Worten „halb so alt“. Wer aus dem Bauch heraus antwortet, halbiert das aktuelle Alter und sagt 15. Genau so antworteten frühe Modelle – und, ehrlich gesagt, die Hälfte der Menschen antwortet genauso.
Der richtige Ansatz ist anders. Als ich 8 war, war meine Schwester 4 – das heißt, sie ist 4 Jahre jünger, und dieser Unterschied ändert sich nie. Ich bin 30, also ist meine Schwester 26.
Der Unterschied zwischen 15 und 26 ist nicht „etwas genauer“. Es sind unterschiedliche Antworten: eine falsch, die andere richtig. Und das Ergebnis kommt genau deshalb zustande, weil das Modell die Aufgabe zuerst Schritt für Schritt analysiert und nicht die erste passende Zahl nimmt.
Was das persönlich für dich bedeutet
Drei Erkenntnisse, die mehr wert sind als jede Versionsliste.
- Deine Erfahrung veraltet schneller, als du denkst. „Ich habe es versucht, die KI kann das nicht“ – ein Satz mit ablaufendem Verfallsdatum. Wenn du es vor einem Jahr versucht hast, sagt das nichts über heute aus.
- Binde dich nicht an ein Modell. Der Marktführer wechselt alle paar Monate. Eine nützliche Fähigkeit ist nicht, „ChatGPT zu kennen“, sondern die Aufgabe so stellen zu können, dass jedes Tool sie versteht.
- Überprüfen musst du weiterhin. Modelle sind zuverlässiger geworden, aber nicht fehlerfrei. Je wichtiger die Entscheidung, desto strenger die Prüfung – diese Regel ist in keiner Generation veraltet.
Mach es jetzt: Versuch, die Argumentation abzuschalten
Eine Zeitmaschine bauen wir nicht, aber du kannst versuchen, dem Modell das zu verbieten, was es die letzten drei Jahre gelernt hat – vor der Antwort zu denken. Starte zwei Anfragen nacheinander und vergleiche.
Der erste – ein Versuch, die Art früherer Modelle zurückzubringen: Antwort sofort, ohne Schritte.
Antworte sofort, in einer Zeile, nur die Endzahl. Ohne Argumentation, ohne Zwischenschritte, ohne Überprüfung: Ein Abonnement kostet 300 Rubel pro Monat. Ab dem vierten Monat stieg der Preis um 10 %, ab dem achten fiel er um 20 % vom letzten Preis. Wie viel wurde insgesamt für 9 Monate bezahlt?
Der zweite – wie sie jetzt antworten: dieselbe Aufgabe, aber mit Analyse.
Löse Schritt für Schritt, zeige jeden Schritt und die Zwischensummen. Überprüfe am Ende die Antwort, indem du alles neu zusammenzählst: Ein Abonnement kostet 300 Rubel pro Monat. Ab dem vierten Monat stieg der Preis um 10 %, ab dem achten fiel er um 20 % vom letzten Preis. Wie viel wurde insgesamt für 9 Monate bezahlt?
Die richtige Antwort ist 2748 Rubel: drei Monate zu 300, vier zu 330, zwei zu 264.
Was du wahrscheinlich sehen wirst
- Das Modell gehorcht oft dem ersten Prompt nicht. Man bittet sie um eine Zeile ohne Argumentation – und sie fängt trotzdem an, laut zu rechnen. Die Gewohnheit, vor der Antwort zu denken, ist so fest in sie eingeprägt, dass sie ein direktes Verbot umgeht.
- Wenn sie doch gehorcht – macht sie Fehler. Bei dieser Aufgabe weicht die schnelle Antwort ab: Es ist leicht zu übersehen, dass der Rabatt vom bereits erhöhten Preis berechnet wird und nicht von den ursprünglichen 300.
- Der zweite Prompt liefert nicht nur die Antwort, sondern auch eine Kette. Und das ist das Wichtigste: Die Zahl kann überprüft werden. Eine schnelle Antwort muss man glauben.
Übrigens, zu klassischen Fangfragen – „Schläger und Ball“, „Seerosen auf dem Teich“. Wir haben sie auch überprüft: Das heutige Modell löst sie korrekt, sogar ohne Schritte, weil es sie im Training tausende Male gesehen hat. Die Fallen, an denen die KI vor drei Jahren scheiterte, funktionieren nicht mehr – genau darum geht es in dieser Lektion.
Praktische Schlussfolgerung: „Löse Schritt für Schritt“ – ist keine höfliche Bitte, sondern ein Schalter. Er aktiviert einen Mechanismus, für den mehrere Modellgenerationen gewechselt wurden, und verwandelt die Antwort von „Glaub mir“ in „Überprüf mich“.
Short questions on the lesson — with an explanation for every answer.