Neurocourse

Pourquoi les modèles d'IA s'améliorent : ce qui change entre les versions

Ce qui s'améliore dans les nouveaux modèles d'IA — connaissances, raisonnement, fiabilité, capacité — et pourquoi les affirmations de l'année dernière sur les limites de l'IA sont déjà obsolètes.

L'été 2023, les modèles avaient une tâche favorite sur laquelle ils butaient : « combien de lettres « r » dans le mot « редиска » ». Ils répondaient avec assurance et à tort. On leur demandait combien faisait 17 × 24, — ils donnaient un joli nombre à côté de la plaque. On leur demandait de citer un article — ils donnaient un titre plausible d'un ouvrage inexistant.

Aujourd'hui, les modèles courants résolvent ces mêmes questions sans accroc. Non pas parce que quelqu'un a inscrit les réponses dans un tableau, mais parce qu'en trois ans, plusieurs générations se sont succédé. Nous allons analyser ce qui change exactement d'une version à l'autre — c'est le seul moyen de ne pas élaborer de plans basés sur les limitations d'hier.

Ce qui s'améliore réellement

« Le modèle est devenu plus intelligent » — cela ne veut rien dire. Les améliorations se font sur quatre axes distincts, et ils ne sont pas liés entre eux : un modèle peut exceller en calcul tout en continuant à inventer des références.

  • Connaissances. Des données d'apprentissage plus récentes et plus vastes. Ici, le progrès est le plus ennuyeux : la question est simplement de savoir ce qui a été inclus dans l'échantillon d'apprentissage.
  • Raisonnement. La capacité à maintenir plusieurs étapes consécutives sans perdre le fil. C'est ici que le saut majeur s'est produit : les modèles ont appris à « réfléchir » d'abord en interne, puis à répondre. Auparavant, la réponse était donnée immédiatement — comme un élève qui commence à parler sans avoir écouté la question jusqu'au bout.
  • Fiabilité. La fréquence à laquelle le modèle ment avec assurance. C'est devenu nettement plus rare, et le plus important est apparu : il admet plus souvent qu'il ne sait pas quelque chose, au lieu d'inventer une réponse plausible. Mais le problème n'est pas résolu : des références et des détails inventés se rencontrent encore aujourd'hui, et il faut toujours vérifier.
  • Volume et organes sensoriels. La fenêtre contextuelle est passée de 128 000 tokens à un million, des images, du son, de la vidéo ont été ajoutés. La leçon précédente portait sur la fenêtre.

Pourquoi s'améliorent-ils ?

Trois leviers, et les trois continuent de fonctionner.

  1. Plus de calculs pour l'entraînement. Chaque génération suivante est entraînée plus longtemps et sur un plus grand nombre de cartes graphiques. C'est la voie la plus directe : les mêmes principes, plus de ressources.
  2. De meilleures données, pas seulement plus nombreuses. Les premiers modèles étaient entraînés sur l'ensemble d'internet. Aujourd'hui, l'échantillon est nettoyé, les déchets sont filtrés et des exemples de bons raisonnements spécialement rédigés sont ajoutés. Vous vous souvenez de la leçon sur les données — la réponse est là, pourquoi c'est plus important que le volume.
  3. Apprentissage basé sur les évaluations humaines. On montre aux gens des paires de réponses, ils désignent la meilleure, le modèle s'adapte. Ainsi, il apprend non pas à « continuer le texte », mais à être utile : répondre de manière pertinente, admettre son ignorance, ne pas être impoli.

Comment cela se manifeste sur une tâche unique

Prenons une tâche où la différence est visible à l'œil nu :

J'avais 8 ans quand ma sœur avait la moitié de mon âge. J'ai 30 ans maintenant. Quel âge a ma sœur ?

Le piège réside dans les mots « la moitié de mon âge ». Ceux qui répondent sur la première impression divisent l'âge actuel par deux et disent 15. C'est ainsi que répondaient les premiers modèles — et, honnêtement, c'est aussi ce que répond la moitié des gens.

La bonne approche est différente. Quand j'avais 8 ans, ma sœur en avait 4 — elle a donc 4 ans de moins, et cette différence ne change jamais. J'ai 30 ans, donc ma sœur a 26 ans.

La différence entre 15 et 26 n'est pas « un peu plus précis ». Ce sont des réponses différentes : l'une est fausse, l'autre est juste. Et cela s'explique précisément par le fait que le modèle analyse d'abord la condition étape par étape, au lieu de saisir le premier nombre qui lui convient.

Ce que cela signifie pour vous personnellement

Trois conclusions qui valent plus cher que n'importe quelle liste de versions.

  • Votre expérience devient obsolète plus vite qu'il n'y paraît. « J'ai essayé, l'IA ne sait pas faire ça » — une phrase avec une date de péremption. Si vous avez essayé il y a un an, cela ne dit rien de la situation actuelle.
  • Ne vous attachez pas à un seul modèle. Le leader change tous les quelques mois. La compétence utile n'est pas de « connaître ChatGPT », mais de savoir poser une tâche de manière à ce que n'importe quel outil la comprenne.
  • Il faut toujours vérifier. Les modèles sont devenus plus fiables, mais pas infaillibles. Plus la décision est importante, plus la vérification doit être rigoureuse — cette règle n'a pas vieilli, quelle que soit la génération.

Faites-le maintenant : essayez de désactiver le raisonnement

Nous ne construirons pas de machine à voyager dans le temps, mais vous pouvez essayer d'interdire au modèle ce qu'on lui a appris ces trois dernières années — penser avant de répondre. Lancez deux requêtes consécutives et comparez.

Le premier — une tentative de retrouver la manière des premiers modèles : réponse immédiate, sans étapes.

Répondez instantanément, sur une seule ligne, uniquement le nombre final. Sans raisonnement, sans étapes intermédiaires, sans vérification :
L'abonnement coûte 300 roubles par mois. À partir du quatrième mois, le prix a augmenté de 10 %, et à partir du huitième, il a baissé de 20 % par rapport au dernier prix. Combien a été payé au total sur 9 mois ?

Le second — comment ils répondent maintenant : la même tâche, mais avec une analyse détaillée.

Résolvez étape par étape, en montrant chaque étape et les sommes intermédiaires. À la fin, vérifiez la réponse en additionnant tout à nouveau :
L'abonnement coûte 300 roubles par mois. À partir du quatrième mois, le prix a augmenté de 10 %, et à partir du huitième, il a baissé de 20 % par rapport au dernier prix. Combien a été payé au total sur 9 mois ?

La bonne réponse est 2748 roubles : trois mois à 300, quatre à 330, deux à 264.

Ce que vous verrez probablement

Nous avons exécuté ces requêtes avant d'écrire la leçon, et le résultat s'est avéré plus intéressant que prévu.

  • Le modèle n'obéit souvent pas au premier prompt. On lui demande une seule ligne sans raisonnement — et il commence quand même à calculer à voix haute. L'habitude de réfléchir avant de répondre est si profondément ancrée en lui qu'il contourne l'interdiction directe.
  • Quand il obéit — il se trompe. Sur cette tâche, la réponse rapide est erronée : il est facile d'oublier que la réduction est calculée sur le prix déjà augmenté, et non sur les 300 initiaux.
  • Le second prompt donne non seulement la réponse, mais aussi la chaîne de raisonnement. Et c'est là l'essentiel : le nombre peut être vérifié. Une réponse rapide doit être acceptée sur parole.

À propos, concernant les problèmes classiques pièges — « la batte et la balle », « les nénuphars sur l'étang ». Nous les avons également vérifiés : le modèle actuel les résout correctement même sans étapes, car il les a vus des milliers de fois lors de son entraînement. Les pièges sur lesquels l'IA butait il y a trois ans ont cessé de fonctionner — c'est précisément le sujet de toute cette leçon.

Conclusion pratique : « résolvez étape par étape » n'est pas une demande polie, mais un interrupteur. Il active le mécanisme pour lequel plusieurs générations de modèles se sont succédé, et transforme la réponse de « croyez-moi » en « vérifiez-moi ».

Practice · 3 задачи

Short questions on the lesson — with an explanation for every answer.