Pourquoi les modèles d'IA s'améliorent : ce qui change entre les versions
Ce qui s'améliore dans les nouveaux modèles d'IA — connaissances, raisonnement, fiabilité, capacité — et pourquoi les affirmations de l'année dernière sur les limites de l'IA sont déjà obsolètes.
Летом 2023 года у моделей была любимая задача, на которой они спотыкались: «сколько букв «р» в слове «редиска»». Отвечали уверенно и неверно. Спрашивали, сколько будет 17 × 24, — получали красивое число мимо кассы. Просили сослаться на статью — получали правдоподобное название несуществующей работы.
Сегодня те же вопросы обычная модель закрывает без запинки. Не потому, что кто-то вписал ответы в таблицу, а потому что за три года сменилось несколько поколений. Разберём, что именно меняется от версии к версии, — это единственный способ не строить планы на вчерашних ограничениях.
Что улучшается на самом деле
«Модель стала умнее» — это ни о чём. Улучшения идут по четырём отдельным линиям, и они между собой не связаны: модель может отлично считать и при этом по-прежнему выдумывать ссылки.
- Знания. Более свежие и более широкие данные обучения. Тут прогресс самый скучный: вопрос лишь в том, что положили в обучающую выборку.
- Рассуждение. Способность держать несколько шагов подряд, не потеряв нить. Здесь случился главный скачок: модели научили сначала «думать» про себя, а потом отвечать. Раньше ответ выпаливался сразу — как ученик, который начинает говорить, не дослушав вопрос.
- Надёжность. Как часто модель уверенно врёт. Стало заметно реже, и появилось главное — она чаще признаёт, что чего-то не знает, вместо того чтобы сочинить правдоподобное. Но проблема не решена: выдуманные ссылки и детали встречаются до сих пор, и проверять по-прежнему надо.
- Объём и органы чувств. Контекстное окно выросло со 128 тысяч токенов до миллиона, добавились картинки, звук, видео. Про окно был прошлый урок.
Почему они вообще улучшаются
Три рычага, и все три продолжают работать.
- Больше вычислений на обучение. Каждое следующее поколение учат дольше и на большем числе видеокарт. Самый прямой путь: те же принципы, больше ресурса.
- Лучше данные, а не только больше. Ранние модели учили на всём интернете подряд. Сейчас выборку чистят, отсеивают мусор и добавляют специально написанные примеры хороших рассуждений. Помнишь урок про данные — там же и ответ, почему это важнее объёма.
- Обучение на человеческих оценках. Людям показывают пары ответов, они отмечают лучший, модель подстраивается. Так она учится не «продолжать текст», а быть полезной: отвечать по делу, признавать незнание, не хамить.
Как это выглядит на одной задаче
Возьмём задачу, где разница видна невооружённым глазом:
Мне было 8 лет, когда сестре было вдвое меньше. Сейчас мне 30. Сколько лет сестре?
Ловушка в словах «вдвое меньше». Кто отвечает по первому впечатлению, делит текущий возраст пополам и говорит 15. Именно так отвечали ранние модели — и, честно говоря, так же отвечает половина людей.
Правильный ход другой. Когда мне было 8, сестре было 4 — значит она младше на 4 года, и эта разница не меняется никогда. Мне 30, значит сестре 26.
Разница между 15 и 26 — это не «чуть точнее». Это разные ответы: один неверный, другой верный. И получается он ровно потому, что модель сначала разбирает условие по шагам, а не хватает первое подходящее число.
Что это значит лично для тебя
Три вывода, которые стоят дороже любого списка версий.
- Твой опыт устаревает быстрее, чем кажется. «Я пробовал, ИИ этого не умеет» — фраза с истекающим сроком годности. Если пробовал год назад, это ничего не говорит о сегодняшнем дне.
- Не привязывайся к одной модели. Лидер меняется каждые несколько месяцев. Полезный навык — не «знать ChatGPT», а уметь ставить задачу так, чтобы её понял любой инструмент.
- Проверять по-прежнему надо. Модели стали надёжнее, но не безошибочными. Чем важнее решение, тем строже проверка — это правило не устарело ни на одном поколении.
Сделай сейчас: попробуй отключить рассуждение
Машину времени мы не построим, но можно попробовать запретить модели то, чему её учили последние три года, — думать до ответа. Запусти два запроса подряд и сравни.
Первый — попытка вернуть манеру ранних моделей: ответ сразу, без шагов.
Ответь мгновенно, одной строкой, только итоговое число. Без рассуждений, без промежуточных шагов, без проверки: Подписка стоит 300 рублей в месяц. С четвёртого месяца цена выросла на 10%, с восьмого — упала на 20% от последней цены. Сколько всего заплачено за 9 месяцев?
Второй — как отвечают сейчас: та же задача, но с разбором.
Реши по шагам, показывая каждый шаг и промежуточные суммы. В конце проверь ответ, сложив всё заново: Подписка стоит 300 рублей в месяц. С четвёртого месяца цена выросла на 10%, с восьмого — упала на 20% от последней цены. Сколько всего заплачено за 9 месяцев?
Правильный ответ — 2748 рублей: три месяца по 300, четыре по 330, два по 264.
Что ты, скорее всего, увидишь
Мы прогнали эти запросы перед тем, как писать урок, и результат оказался интереснее задуманного.
- Модель часто не слушается первого промпта. Её просят одну строку без рассуждений — а она всё равно начинает считать вслух. Привычку думать до ответа в неё вшили так прочно, что прямой запрет она обходит.
- Когда всё-таки слушается — ошибается. На этой задаче быстрый ответ уезжает: легко потерять, что скидка считается от уже выросшей цены, а не от начальных 300.
- Второй промпт даёт не только ответ, но и цепочку. И вот это главное: число можно проверить. Быстрый ответ приходится принимать на веру.
Кстати, о классических задачах-ловушках — «бита и мяч», «кувшинки на пруду». Мы их тоже проверили: сегодняшняя модель решает их верно даже без шагов, потому что видела их в обучении тысячи раз. Ловушки, на которых ИИ спотыкался три года назад, перестали работать — ровно об этом весь урок.
Практический вывод: «реши по шагам» — не вежливая просьба, а переключатель. Он включает механизм, ради которого сменилось несколько поколений моделей, и превращает ответ из «поверь мне» в «проверь меня».
Short questions on the lesson — with an explanation for every answer.