
Задачи-ловушки, на которых ИИ спотыкался: проверили все четыре в 2026
Коротко: 30 июля 2026 года мы взяли четыре классические задачи-ловушки, на которых нейросети регулярно позорились три года назад, и прогнали их заново — специально запретив модели рассуждать вслух. Все четыре решены верно. А вот что оказалось интереснее: на задаче, которой нет в учебниках, модель просто отказывается подчиняться запрету и всё равно начинает считать по шагам. А там, где подчиняется, — ошибается. Ниже все вопросы, ответы и что из этого следует для вас.
Что мы делали
Каждая задача отправлялась в Gemini 2.5 Flash-Lite через Vertex AI с одинаковой обёрткой:
Ответь мгновенно, одной строкой, только число. Без рассуждений, без шагов, без проверки.
Смысл обёртки в том, чтобы отключить главный механизм, который появился у моделей за последние годы, — «подумать про себя, потом ответить». Именно его отсутствие делало ранние модели такими уязвимыми к задачам с ловушкой.
Задача 1. Бита и мяч
Бита и мяч стоят вместе 1100 рублей. Бита дороже мяча на 1000 рублей. Сколько стоит мяч?
Интуитивный ответ — 100. Правильный — 50: если мяч стоит 50, бита стоит 1050, вместе 1100, разница ровно 1000. Это самая известная задача из теста когнитивной рефлексии, на которой ошибается больше половины взрослых людей.
Ответ модели: 50. Верно, без единого шага рассуждения.
Задача 2. Кувшинки на пруду
Кувшинки удваиваются каждый день и покрывают пруд за 48 дней. За сколько дней они покроют половину пруда?
Интуитивный ответ — 24. Правильный — 47: если площадь удваивается ежедневно, то за день до полного покрытия занята ровно половина.
Ответ модели: 47. Верно.
Задача 3. Пять станков
5 станков делают 5 деталей за 5 минут. За сколько минут 100 станков сделают 100 деталей?
Интуитивный ответ — 100. Правильный — 5: каждый станок делает одну деталь за пять минут, и сто станков параллельно сделают сто деталей за те же пять.
Ответ модели: 5 минут. Верно — и модель даже добавила, на каком допущении считала.
Задача 4. Двойная скидка
Товар стоил 4000. Его уценили на 30%, потом ещё на 20% от новой цены. Сколько он стоит теперь?
Интуитивный ответ — 2000, потому что «скидка 50%». Правильный — 2240: сначала 4000 × 0,7 = 2800, потом 2800 × 0,8 = 2240.
Ответ модели: 2240. Верно.
Почему ловушки перестали работать
Ответ прозаичен: эти задачи слишком известны. Они разобраны в тысячах статей, учебников и форумных веток, и всё это попало в обучающую выборку. Модель не решает «бита и мяч» — она её помнит.
Это важное наблюдение для всех, кто оценивает ИИ по популярным тестам: знаменитая задача проверяет память, а не мышление. Если вы хотите понять, на что модель реально способна, задача должна быть новой.
Что случилось, когда мы дали незнакомую задачу
Мы придумали задачу, которой заведомо нет в учебниках:
Подписка стоит 300 рублей в месяц. С четвёртого месяца цена выросла на 10%, с восьмого — упала на 20% от последней цены. Сколько всего заплачено за 9 месяцев?
Правильный ответ — 2748: три месяца по 300, четыре по 330, два по 264.
И вот тут произошло самое любопытное. Модель нарушила прямой запрет. Её просили ответить одной строкой без рассуждений — она всё равно начала выписывать вычисления. Привычку думать до ответа в неё встроили так прочно, что прямая инструкция «не рассуждай» не срабатывает.
А когда мы всё-таки получили быстрый ответ, он оказался неверным: 2924 вместо 2748. Модель применила вторую скидку не к той цене.
Три вывода, которые стоит забрать
- Старые претензии к ИИ устарели. «Я пробовал, он не умеет считать» — фраза с истекающим сроком годности. Если вы пробовали в 2023 году, это не говорит ничего о сегодняшнем дне.
- Известные тесты ничего не измеряют. Модель видела их тысячи раз. Проверяйте на своих задачах, а не на популярных головоломках.
- «Реши по шагам» — не вежливость, а переключатель. Эта фраза включает механизм пошагового разбора, ради которого сменилось несколько поколений моделей. И главное — она превращает ответ из «поверь мне» в «проверь меня»: цепочку вычислений можно прочитать глазами, голое число нельзя.
Что это значит, если вы пользуетесь ИИ для расчётов
Не отказывайтесь от него из-за старых историй про ошибки в арифметике — но и не принимайте числа на веру. Рабочая привычка выглядит так: просите разбор по шагам, просите проверить ответ обратным счётом и сверяйте хотя бы один промежуточный результат сами. На задаче с подписками именно это и вскрыло бы ошибку.
И помните про природу инструмента: языковая модель не считает, а предсказывает правдоподобное продолжение текста. Пошаговый разбор помогает потому, что каждый шаг короткий и предсказать его правильно легче, чем сразу угадать итог.
Оговорки
Мы тестировали одну модель — Gemini 2.5 Flash-Lite — 30 июля 2026 года. Это недорогая, намеренно быстрая модель; у более мощных результаты будут лучше, у совсем маленьких хуже. Повторить проверку легко: возьмите наши формулировки и прогоните на своём инструменте.
Частые вопросы
Решает ли ИИ задачу про биту и мяч в 2026 году?
Да. 30 июля 2026 года мы прогнали её через Gemini 2.5 Flash-Lite с прямым запретом рассуждать — модель ответила «50», то есть верно, без единого шага разбора. Три года назад на этой задаче нейросети регулярно ошибались.
Почему классические задачи-ловушки больше не работают против ИИ?
Потому что они слишком известны. «Бита и мяч», кувшинки, пять станков разобраны в тысячах статей и форумных веток, и всё это попало в обучающую выборку. Модель не решает такую задачу, а помнит её. Знаменитая задача проверяет память, а не мышление.
Можно ли промптом заставить современную модель вести себя как старая?
Надёжно — нет. Мы пробовали: на запутанной задаче модель просто игнорирует инструкцию «не рассуждай» и всё равно начинает считать по шагам. Привычку думать до ответа встроили слишком прочно, чтобы её выключала одна строчка в промпте.
Ошибается ли ИИ в арифметике сегодня?
Да, на незнакомых многошаговых задачах. В нашем тесте задача про подписку с двумя изменениями цены дала 2924 вместо правильных 2748 — модель применила вторую скидку не к той цене. Ошибка вылезла именно там, где мы запретили пошаговый разбор.
Помогает ли фраза «реши по шагам» на самом деле?
Да, и по двум причинам. Она включает пошаговый разбор, при котором каждый следующий шаг короткий и предсказать его правильно легче, чем угадать итог сразу. И она делает ответ проверяемым: цепочку вычислений можно прочитать глазами, а голое число приходится принимать на веру.
Как правильно проверять ИИ на своих задачах?
Берите задачу, которой нет в учебниках: свои числа, своя структура, несколько шагов подряд. Просите разбор по шагам и проверку ответа обратным счётом. Сверяйте хотя бы один промежуточный результат сами — именно так вскрываются ошибки, незаметные в готовом числе.
Умеет ли языковая модель считать вообще?
Она не считает в привычном смысле, а предсказывает правдоподобное продолжение текста. Именно поэтому пошаговый разбор помогает: каждый отдельный шаг короткий и предсказуемый, а угадать сразу итог сложной цепочки — задача принципиально более трудная.