Почему модели умнеют: что меняется от версии к версии
Что именно улучшается в новых моделях — знания, рассуждение, надёжность, объём — и почему твой прошлогодний опыт «ИИ этого не умеет» уже неверен.
Летом 2023 года у моделей была любимая задача, на которой они спотыкались: «сколько букв «р» в слове «редиска»». Отвечали уверенно и неверно. Спрашивали, сколько будет 17 × 24, — получали красивое число мимо кассы. Просили сослаться на статью — получали правдоподобное название несуществующей работы.
Сегодня те же вопросы обычная модель закрывает без запинки. Не потому, что кто-то вписал ответы в таблицу, а потому что за три года сменилось несколько поколений моделей. Разберём, что именно меняется от версии к версии, — это единственный способ не строить планы на вчерашних ограничениях.
Что улучшается на самом деле
«Модель стала умнее» — слишком общо. Улучшения идут по четырём отдельным линиям, и они не связаны между собой: модель может отлично считать и по-прежнему выдумывать ссылки.
- Знания. Свежие данные обучения и более широкий охват. Тут прогресс самый скучный: это вопрос того, что положили в обучающую выборку.
- Рассуждение. Способность держать несколько шагов подряд, не потеряв нить. Именно здесь случился главный скачок: модели научили сначала «думать» про себя, а потом отвечать. Раньше ответ выпаливался сразу — как ученик, который начинает говорить, не дослушав вопрос.
- Надёжность. Как часто модель уверенно врёт. GPT-4 в 2023 году был на 19 процентных пунктов точнее предшественника на внутренних тестах на достоверность — не «в разы», но заметно. Полностью это не лечится до сих пор.
- Объём и органы чувств. Контекстное окно выросло с 128 тысяч токенов до миллиона, добавились картинки, звук, видео. Про окно был прошлый урок.
Почему они вообще улучшаются
Три рычага, и все три продолжают работать.
- Больше вычислений на обучение. Каждое следующее поколение обучают дольше и на большем числе видеокарт. Это самый прямой путь: те же принципы, больше ресурса.
- Лучше данные, а не только больше. Ранние модели учили на всём интернете подряд. Сейчас выборку чистят, отсеивают мусор и добавляют специально написанные примеры хороших рассуждений. Помнишь урок про данные — там же и ответ, почему это важнее объёма.
- Обучение на человеческих оценках. Людям показывают пары ответов, они отмечают лучший, модель подстраивается. Так она учится не «продолжать текст», а быть полезной — отвечать по делу, признавать незнание, не хамить.
Как это выглядит на одной задаче
Возьмём вопрос, на котором разница видна без специальных тестов: «В корзине 3 яблока. Я забрал 2, потом положил обратно 1 и съел половину того, что осталось. Сколько осталось?»
Модель 2023 года отвечала мгновенно: «Осталось 1 яблоко». Считала по последнему упомянутому числу и не отслеживала состояние корзины.
Модель 2026 года сначала проговаривает шаги: было 3 → забрал 2, осталось 1 → положил 1, стало 2 → съел половину, значит съел 1 → осталось 1. И только потом отвечает.
Ответ в этом примере совпал случайно — важно другое: вторая модель может показать ход и его можно проверить. На задаче посложнее первая ошибётся, а вторая нет, и разница будет не в удаче.
Что это значит лично для тебя
Три вывода, которые стоят дороже любого списка версий.
- Твой опыт устаревает быстрее, чем кажется. «Я пробовал, ИИ этого не умеет» — фраза с истекающим сроком годности. Если пробовал год назад, это ничего не говорит о сегодняшнем дне.
- Не привязывайся к одной модели. Лидер меняется каждые несколько месяцев. Полезный навык — не «знать ChatGPT», а уметь ставить задачу так, чтобы её понял любой инструмент.
- Проверять по-прежнему надо. Модели стали надёжнее, но не безошибочными. Чем важнее решение, тем строже проверка — это правило не устарело ни на одном поколении.
Сделай сейчас: поймай разницу поколений
Задай мне задачу, где ответ требует нескольких шагов подряд, — и посмотри, покажу ли я ход рассуждения. Именно на таких задачах поколения расходятся сильнее всего.
Реши по шагам, показывая каждый шаг: В корзине 3 яблока. Я забрал 2, потом положил обратно 1 и съел половину того, что осталось. Сколько яблок в корзине? В конце проверь свой же ответ обратным счётом.
Обрати внимание на просьбу проверить себя обратным счётом. Раньше такая инструкция ничего не давала — модель просто дописывала ещё один уверенный абзац. Сейчас она действительно пересчитывает и иногда сама себя поправляет. Это и есть то самое улучшение рассуждения, о котором шла речь выше.
Короткие вопросы по уроку — с разбором каждого ответа.