Neurocourse

Perché i modelli continuano a migliorare: cosa cambia effettivamente tra le versioni

Cosa migliora effettivamente nei modelli più recenti — conoscenza, ragionamento, affidabilità, capacità — e perché il «l'IA non può fare questo» dell'anno scorso è già obsoleto.

Nell'estate del 2023, i modelli avevano un compito preferito su cui inciampavano: «quante lettere «r» ci sono nella parola «редиска»». Rispondevano con sicurezza e in modo errato. Chiedevano quanto fa 17 × 24 e ottenevano un bel numero, ma sbagliato. Chiedevano di citare un articolo e ottenevano un titolo plausibile di un'opera inesistente.

Oggi, un modello comune risolve gli stessi problemi senza esitazione. Non perché qualcuno abbia inserito le risposte in una tabella, ma perché in tre anni sono cambiate diverse generazioni. Analizziamo cosa cambia esattamente da una versione all'altra: è l'unico modo per non fare piani basati sulle limitazioni di ieri.

Cosa migliora davvero

«Il modello è diventato più intelligente» non significa nulla. I miglioramenti avvengono su quattro linee separate e non sono collegati tra loro: un modello può calcolare perfettamente e allo stesso tempo inventare ancora riferimenti.

  • Conoscenze. Dati di addestramento più recenti e più ampi. Qui il progresso è il più noioso: la questione è solo cosa è stato inserito nel set di dati di addestramento.
  • Ragionamento. La capacità di mantenere più passaggi consecutivi senza perdere il filo. Qui è avvenuto il salto principale: i modelli sono stati addestrati a «pensare» prima tra sé e sé, e poi a rispondere. Prima la risposta veniva sparata subito, come uno studente che inizia a parlare senza aver ascoltato la domanda.
  • Affidabilità. Quanto spesso il modello mente con sicurezza. È diventato notevolmente meno frequente, e la cosa più importante è apparsa: ammette più spesso di non sapere qualcosa, invece di inventare qualcosa di plausibile. Ma il problema non è risolto: riferimenti e dettagli inventati si trovano ancora oggi, e bisogna comunque controllare.
  • Volume e organi di senso. La finestra di contesto è cresciuta da 128 mila token a un milione, sono state aggiunte immagini, audio, video. L'ultima lezione parlava della finestra.

Perché migliorano, in generale

Tre leve, e tutte e tre continuano a funzionare.

  1. Più calcoli per l'addestramento. Ogni generazione successiva viene addestrata più a lungo e su un numero maggiore di schede grafiche. Il percorso più diretto: gli stessi principi, più risorse.
  2. Dati migliori, non solo di più. I primi modelli venivano addestrati su tutto internet. Ora il set di dati viene pulito, si scartano i dati inutili e si aggiungono esempi di buoni ragionamenti scritti appositamente. Ricordi la lezione sui dati? Lì c'è anche la risposta sul perché questo sia più importante del volume.
  3. Addestramento basato su valutazioni umane. Alle persone vengono mostrate coppie di risposte, loro indicano la migliore, il modello si adatta. Così impara non a «continuare il testo», ma a essere utile: rispondere in modo pertinente, ammettere di non sapere, non essere scortese.

Come si presenta con un solo compito

Prendiamo un compito in cui la differenza è visibile a occhio nudo:

«Avevo 8 anni quando mia sorella ne aveva la metà. Ora ne ho 30. Quanti anni ha mia sorella?»

La trappola è nelle parole «la metà». Chi risponde di primo istinto, divide l'età attuale a metà e dice 15. È così che rispondevano i primi modelli — e, onestamente, è così che risponde anche metà delle persone.

Il ragionamento corretto è un altro. Quando avevo 8 anni, mia sorella ne aveva 4 — significa che è più giovane di 4 anni, e questa differenza non cambia mai. Io ho 30 anni, quindi mia sorella ne ha 26.

La differenza tra 15 e 26 non è «un po' più precisa». Sono risposte diverse: una sbagliata, l'altra giusta. E si ottiene proprio perché il modello prima analizza la condizione passo dopo passo, e non afferra il primo numero adatto.

Cosa significa questo per te personalmente

Tre conclusioni che valgono più di qualsiasi elenco di versioni.

  • La tua esperienza invecchia più velocemente di quanto sembri. «Ho provato, l'IA non è in grado di farlo» — è una frase con una data di scadenza. Se hai provato un anno fa, questo non dice nulla sul presente.
  • Non legarti a un solo modello. Il leader cambia ogni pochi mesi. L'abilità utile non è «conoscere ChatGPT», ma saper impostare il compito in modo che qualsiasi strumento lo capisca.
  • Bisogna comunque controllare. I modelli sono diventati più affidabili, ma non infallibili. Più importante è la decisione, più rigoroso deve essere il controllo — questa regola non è invecchiata con nessuna generazione.

Fallo ora: prova a disattivare il ragionamento

Non costruiremo una macchina del tempo, ma puoi provare a proibire al modello ciò che gli è stato insegnato negli ultimi tre anni: pensare prima di rispondere. Esegui due prompt di seguito e confronta.

Il primo — un tentativo di ripristinare il modo dei primi modelli: risposta immediata, senza passaggi.

Rispondi immediatamente, in una sola riga, solo il numero finale. Senza ragionamenti, senza passaggi intermedi, senza verifica:
L'abbonamento costa 300 rubli al mese. Dal quarto mese il prezzo è aumentato del 10%, dall'ottavo è diminuito del 20% rispetto all'ultimo prezzo. Quanto è stato pagato in totale per 9 mesi?

Il secondo — come rispondono ora: lo stesso compito, ma con un'analisi.

Risolvi passo dopo passo, mostrando ogni passaggio e le somme intermedie. Alla fine, verifica la risposta sommando tutto di nuovo:
L'abbonamento costa 300 rubli al mese. Dal quarto mese il prezzo è aumentato del 10%, dall'ottavo è diminuito del 20% rispetto all'ultimo prezzo. Quanto è stato pagato in totale per 9 mesi?

La risposta corretta è 2748 rubli: tre mesi a 300, quattro a 330, due a 264.

Cosa vedrai, molto probabilmente

Abbiamo eseguito questi prompt prima di scrivere la lezione, e il risultato si è rivelato più interessante del previsto.

  • Il modello spesso non obbedisce al primo prompt. Gli si chiede una sola riga senza ragionamenti — eppure inizia comunque a calcolare ad alta voce. L'abitudine di pensare prima di rispondere è stata così profondamente radicata in esso che aggira il divieto diretto.
  • Quando invece obbedisce — sbaglia. In questo compito, la risposta rapida si allontana: è facile perdere di vista che lo sconto è calcolato sul prezzo già aumentato, e non sui 300 iniziali.
  • Il secondo prompt non dà solo la risposta, ma anche la catena. Ed è questo il punto principale: il numero può essere verificato. La risposta rapida deve essere presa per buona.

A proposito, sui classici compiti-trappola — «mazza e palla», «ninfee nello stagno». Li abbiamo controllati anche noi: il modello odierno li risolve correttamente anche senza passaggi, perché li ha visti nell'addestramento migliaia di volte. Le trappole su cui l'IA inciampava tre anni fa hanno smesso di funzionare — è proprio di questo che parla l'intera lezione.

Conclusione pratica: «risolvi passo dopo passo» non è una richiesta cortese, ma un interruttore. Attiva il meccanismo per cui sono cambiate diverse generazioni di modelli, e trasforma la risposta da «fidati di me» a «controllami».

Practice · 3 задачи

Short questions on the lesson — with an explanation for every answer.