Dlaczego modele AI są coraz lepsze: co się zmienia w wersjach
Co poprawia się w nowszych modelach AI — wiedza, rozumowanie, niezawodność, pojemność — i dlaczego zeszłoroczne „AI tego nie potrafi” jest już nieaktualne.
Latem 2023 roku modele miały ulubione zadanie, na którym się potykały: „ile liter «r» jest w słowie «rzodkiewka»”. Odpowiadały pewnie i błędnie. Pytano, ile to 17 × 24, — otrzymywały ładną liczbę, która mijała się z prawdą. Proszono o podanie artykułu — otrzymywały wiarygodny tytuł nieistniejącej pracy.
Dziś te same pytania zwykły model załatwia bez zająknięcia. Nie dlatego, że ktoś wpisał odpowiedzi do tabeli, ale dlatego, że w ciągu trzech lat zmieniło się kilka generacji. Rozbierzemy, co dokładnie zmienia się z wersji na wersję — to jedyny sposób, by nie opierać planów na wczorajszych ograniczeniach.
Co tak naprawdę się poprawia
„Model stał się mądrzejszy” — to nic nie znaczy. Ulepszenia idą w czterech oddzielnych obszarach i nie są ze sobą powiązane: model może świetnie liczyć, a jednocześnie nadal wymyślać linki.
- Wiedza. Świeższe i szersze dane treningowe. Tutaj postęp jest najbardziej nudny: pytanie tylko, co zostało umieszczone w zbiorze treningowym.
- Rozumowanie. Zdolność do utrzymywania kilku kroków pod rząd, nie tracąc wątku. Tutaj nastąpił główny skok: modele nauczono najpierw „myśleć w głowie”, a potem odpowiadać. Wcześniej odpowiedź wypadała od razu — jak uczeń, który zaczyna mówić, nie dosłuchawszy pytania.
- Niezawodność. Jak często model pewnie kłamie. Stało się to znacznie rzadziej, i pojawiło się najważniejsze — częściej przyznaje, że czegoś nie wie, zamiast wymyślać coś wiarygodnego. Ale problem nie jest rozwiązany: wymyślone linki i szczegóły nadal się pojawiają, i nadal trzeba sprawdzać.
- Objętość i zmysły. Okno kontekstowe wzrosło ze 128 tysięcy tokenów do miliona, dodano obrazy, dźwięk, wideo. O oknie była poprzednia lekcja.
Dlaczego w ogóle się poprawiają
Trzy dźwignie, i wszystkie trzy nadal działają.
- Więcej obliczeń na trening. Każdą kolejną generację uczy się dłużej i na większej liczbie kart graficznych. Najprostsza droga: te same zasady, więcej zasobów.
- Lepsze dane, a nie tylko więcej. Wczesne modele uczono na całym internecie bez selekcji. Teraz zbiór danych jest czyszczony, odrzuca się śmieci i dodaje specjalnie napisane przykłady dobrych rozumowań. Pamiętasz lekcję o danych — tam też jest odpowiedź, dlaczego to ważniejsze niż objętość.
- Uczenie na podstawie ocen ludzkich. Ludziom pokazuje się pary odpowiedzi, oni wskazują najlepszą, model się dostosowuje. W ten sposób uczy się nie „kontynuować tekst”, ale być użyteczną: odpowiadać na temat, przyznawać się do niewiedzy, nie być arogancką.
Jak to wygląda na jednym zadaniu
Weźmy zadanie, gdzie różnica jest widoczna gołym okiem:
Miałem 8 lat, gdy moja siostra miała o połowę mniej. Teraz mam 30. Ile lat ma siostra?
Pułapka tkwi w słowach „o połowę mniej”. Kto odpowiada pod wpływem pierwszego wrażenia, dzieli obecny wiek na pół i mówi 15. Dokładnie tak odpowiadały wczesne modele — i, szczerze mówiąc, tak samo odpowiada połowa ludzi.
Prawidłowe podejście jest inne. Gdy miałem 8 lat, siostra miała 4 — to znaczy, że jest młodsza o 4 lata, i ta różnica nigdy się nie zmienia. Mam 30 lat, więc siostra ma 26.
Różnica między 15 a 26 — to nie jest „trochę dokładniej”. To są różne odpowiedzi: jedna błędna, druga poprawna. I wynika to dokładnie z tego, że model najpierw analizuje warunek krok po kroku, a nie chwyta pierwszej pasującej liczby.
Co to oznacza osobiście dla ciebie
Trzy wnioski, które są warte więcej niż jakakolwiek lista wersji.
- Twoje doświadczenie starzeje się szybciej, niż się wydaje. „Próbowałem, AI tego nie potrafi” — to zdanie z upływającym terminem ważności. Jeśli próbowałeś rok temu, to nic nie mówi o dniu dzisiejszym.
- Nie przywiązuj się do jednego modelu. Lider zmienia się co kilka miesięcy. Przydatna umiejętność — to nie „znać ChatGPT”, ale umieć postawić zadanie tak, aby zrozumiało je każde narzędzie.
- Nadal trzeba sprawdzać. Modele stały się bardziej niezawodne, ale nie bezbłędne. Im ważniejsza decyzja, tym surowsza weryfikacja — ta zasada nie zestarzała się w żadnej generacji.
Zrób to teraz: spróbuj wyłączyć rozumowanie
Maszyny czasu nie zbudujemy, ale możesz spróbować zabronić modelowi tego, czego uczono go przez ostatnie trzy lata — myślenia przed odpowiedzią. Uruchom dwa zapytania pod rząd i porównaj.
Pierwszy — próba przywrócenia maniery wczesnych modeli: odpowiedź od razu, bez kroków.
Odpowiedz natychmiast, w jednej linii, tylko ostateczną liczbę. Bez rozumowania, bez pośrednich kroków, bez sprawdzania: Subskrypcja kosztuje 300 rubli miesięcznie. Od czwartego miesiąca cena wzrosła o 10%, od ósmego — spadła o 20% od ostatniej ceny. Ile łącznie zapłacono za 9 miesięcy?
Drugi — jak odpowiadają teraz: to samo zadanie, ale z analizą.
Rozwiąż krok po kroku, pokazując każdy krok i sumy pośrednie. Na koniec sprawdź odpowiedź, sumując wszystko od nowa: Subskrypcja kosztuje 300 rubli miesięcznie. Od czwartego miesiąca cena wzrosła o 10%, od ósmego — spadła o 20% od ostatniej ceny. Ile łącznie zapłacono za 9 miesięcy?
Prawidłowa odpowiedź — 2748 rubli: trzy miesiące po 300, cztery po 330, dwa po 264.
Co najprawdopodobniej zobaczysz
Przeprowadziliśmy te zapytania przed napisaniem lekcji, a wynik okazał się ciekawszy niż zakładano.
- Model często nie słucha się pierwszego promptu. Proszą ją o jedną linię bez rozumowania — a ona i tak zaczyna liczyć na głos. Nawyk myślenia przed odpowiedzią wszczepiono jej tak mocno, że omija bezpośredni zakaz.
- Kiedy jednak słucha — myli się. W tym zadaniu szybka odpowiedź odbiega od prawdy: łatwo przeoczyć, że zniżka jest liczona od już podwyższonej ceny, a nie od początkowych 300.
- Drugi prompt daje nie tylko odpowiedź, ale i ciąg rozumowania. I to jest najważniejsze: liczbę można sprawdzić. Szybką odpowiedź trzeba przyjąć na wiarę.
Swoją drogą, o klasycznych zadaniach-pułapkach — „kij i piłka”, „lilie wodne na stawie”. My też je sprawdziliśmy: dzisiejszy model rozwiązuje je poprawnie nawet bez kroków, ponieważ widział je w treningu tysiące razy. Pułapki, na których AI potykało się trzy lata temu, przestały działać — dokładnie o tym jest cała lekcja.
Praktyczny wniosek: „rozwiąż krok po kroku” — to nie uprzejma prośba, a przełącznik. Włącza on mechanizm, dla którego zmieniło się kilka generacji modeli, i zamienia odpowiedź z „uwierz mi” w „sprawdź mnie”.
Short questions on the lesson — with an explanation for every answer.