Нейрокурс

Почему модели умнеют: что меняется от версии к версии

Что именно улучшается в новых моделях — знания, рассуждение, надёжность, объём — и почему твой прошлогодний опыт «ИИ этого не умеет» уже неверен.

Летом 2023 года у моделей была любимая задача, на которой они спотыкались: «сколько букв «р» в слове «редиска»». Отвечали уверенно и неверно. Спрашивали, сколько будет 17 × 24, — получали красивое число мимо кассы. Просили сослаться на статью — получали правдоподобное название несуществующей работы.

Сегодня те же вопросы обычная модель закрывает без запинки. Не потому, что кто-то вписал ответы в таблицу, а потому что за три года сменилось несколько поколений моделей. Разберём, что именно меняется от версии к версии, — это единственный способ не строить планы на вчерашних ограничениях.

Что улучшается на самом деле

«Модель стала умнее» — слишком общо. Улучшения идут по четырём отдельным линиям, и они не связаны между собой: модель может отлично считать и по-прежнему выдумывать ссылки.

  • Знания. Свежие данные обучения и более широкий охват. Тут прогресс самый скучный: это вопрос того, что положили в обучающую выборку.
  • Рассуждение. Способность держать несколько шагов подряд, не потеряв нить. Именно здесь случился главный скачок: модели научили сначала «думать» про себя, а потом отвечать. Раньше ответ выпаливался сразу — как ученик, который начинает говорить, не дослушав вопрос.
  • Надёжность. Как часто модель уверенно врёт. GPT-4 в 2023 году был на 19 процентных пунктов точнее предшественника на внутренних тестах на достоверность — не «в разы», но заметно. Полностью это не лечится до сих пор.
  • Объём и органы чувств. Контекстное окно выросло с 128 тысяч токенов до миллиона, добавились картинки, звук, видео. Про окно был прошлый урок.

Почему они вообще улучшаются

Три рычага, и все три продолжают работать.

  1. Больше вычислений на обучение. Каждое следующее поколение обучают дольше и на большем числе видеокарт. Это самый прямой путь: те же принципы, больше ресурса.
  2. Лучше данные, а не только больше. Ранние модели учили на всём интернете подряд. Сейчас выборку чистят, отсеивают мусор и добавляют специально написанные примеры хороших рассуждений. Помнишь урок про данные — там же и ответ, почему это важнее объёма.
  3. Обучение на человеческих оценках. Людям показывают пары ответов, они отмечают лучший, модель подстраивается. Так она учится не «продолжать текст», а быть полезной — отвечать по делу, признавать незнание, не хамить.

Как это выглядит на одной задаче

Возьмём вопрос, на котором разница видна без специальных тестов: «В корзине 3 яблока. Я забрал 2, потом положил обратно 1 и съел половину того, что осталось. Сколько осталось?»

Модель 2023 года отвечала мгновенно: «Осталось 1 яблоко». Считала по последнему упомянутому числу и не отслеживала состояние корзины.
Модель 2026 года сначала проговаривает шаги: было 3 → забрал 2, осталось 1 → положил 1, стало 2 → съел половину, значит съел 1 → осталось 1. И только потом отвечает.

Ответ в этом примере совпал случайно — важно другое: вторая модель может показать ход и его можно проверить. На задаче посложнее первая ошибётся, а вторая нет, и разница будет не в удаче.

Что это значит лично для тебя

Три вывода, которые стоят дороже любого списка версий.

  • Твой опыт устаревает быстрее, чем кажется. «Я пробовал, ИИ этого не умеет» — фраза с истекающим сроком годности. Если пробовал год назад, это ничего не говорит о сегодняшнем дне.
  • Не привязывайся к одной модели. Лидер меняется каждые несколько месяцев. Полезный навык — не «знать ChatGPT», а уметь ставить задачу так, чтобы её понял любой инструмент.
  • Проверять по-прежнему надо. Модели стали надёжнее, но не безошибочными. Чем важнее решение, тем строже проверка — это правило не устарело ни на одном поколении.

Сделай сейчас: поймай разницу поколений

Задай мне задачу, где ответ требует нескольких шагов подряд, — и посмотри, покажу ли я ход рассуждения. Именно на таких задачах поколения расходятся сильнее всего.

Реши по шагам, показывая каждый шаг:
В корзине 3 яблока. Я забрал 2, потом положил обратно 1
и съел половину того, что осталось. Сколько яблок в корзине?
В конце проверь свой же ответ обратным счётом.

Обрати внимание на просьбу проверить себя обратным счётом. Раньше такая инструкция ничего не давала — модель просто дописывала ещё один уверенный абзац. Сейчас она действительно пересчитывает и иногда сама себя поправляет. Это и есть то самое улучшение рассуждения, о котором шла речь выше.

Практика · 3 задачи

Короткие вопросы по уроку — с разбором каждого ответа.