Нейрокурс

LLM и токены: как машина пишет текст

ChatGPT, Claude и Gemini — большие языковые модели (LLM). Их единственная операция — предсказать следующий токен, кусочек текста. Разбираем, как из этого простого механизма рождаются целые статьи и код, что такое токены и контекстное окно — и почему всё это важно знать практически.

Пришло время открыть капот у главных героев эпохи — больших языковых моделей.

LLM: что значит каждая буква

Large Language Model — большая языковая модель. «Языковая» — училась на текстах: книгах, статьях, сайтах, коде (буквально на значительной части интернета). «Большая» — сотни миллиардов весов из прошлого урока. ChatGPT, Claude, Gemini, DeepSeek — всё это LLM разных компаний, устроенные по одному принципу (тому самому трансформеру 2017 года).

Единственный фокус: угадай следующий кусочек

Всё, что делает LLM, — предсказывает следующий токен. Ты пишешь: «Столица Франции — ». Модель перебирает свой словарь и оценивает вероятности продолжения: «Париж» — 99%, «Лион» — 0,3%, «банан» — 0,0001%. Выбирает вероятное, добавляет к тексту — и предсказывает следующий кусочек. Снова и снова, слово за словом — так рождается целый ответ.

Стоп. Если модель просто «угадывает следующее слово» — как она пишет связные эссе и рабочий код?

Ответ красив: чтобы хорошо предсказывать следующее слово в любом тексте человечества, модели пришлось выучить грамматику, факты, логику рассуждений, стили и структуру кода. Предсказание слова оказалось задачей, внутри которой спрятано «понимание» языка. Это главное открытие эпохи LLM — и главный источник споров о том, «понимает» ли модель по-настоящему.

Токены: валюта мира LLM

Кусочки, которыми оперирует модель, называются токенами. Проще один раз увидеть. Возьмём фразу и разрежем её так, как это делает модель (| — граница токена):

Кот спит на подоконнике.
→ Кот| спит| на| подо|конник|е|.
7 токенов

Видно правило: частое короткое слово («Кот», «спит», «на») — это один токен, а длинное и редкое режется на части («подо|конник|е»). Знак препинания — отдельный токен. Пробел обычно приклеивается к следующему слову.

Теперь та же мысль по-английски:

The cat sleeps on the windowsill.
→ The| cat| sleeps| on| the| windows|ill|.
8 токенов — но символов в полтора раза больше

Отсюда практическое правило: в английском 1 токен ≈ 4 символа, в русском ≈ 2. Один и тот же смысл на русском стоит примерно вдвое больше токенов. Считаешь цену или объём — закладывай на русский двойной запас.

Токены считаются дважды: на входе и на выходе

Разговор с моделью — это две порции токенов, и считают их отдельно.

  • Входящие — всё, что ты отправил: сам вопрос, вставленный текст, фото, история переписки.
  • Исходящие — всё, что модель написала в ответ.

Разница не в терминах, а в деньгах: исходящие стоят в разы дороже входящих. У модели, на которой работает этот бот, вход — $0.10 за миллион токенов, выход — $0.40. Вчетверо.

Посчитаем на живом примере. Ты спрашиваешь коротко, а просишь развёрнуто:

Вопрос на 100 слов по-русски ≈ 300 токенов входящих. Ответ на 500 слов ≈ 1500 токенов исходящих.

Вход обошёлся в $0.00003, выход — в $0.0006. Ответ дороже вопроса в двадцать раз, хотя написал ты его сам за минуту, а модель — за пять секунд.

Отсюда правило, которое экономит больше всего: укорачивать надо ответ, а не вопрос. Строчка «ответь одним абзацем» срезает счёт заметнее, чем сокращение самого вопроса вдвое. И наоборот — «распиши подробно, со всеми примерами» это самая дорогая фраза, которую можно написать модели.

Почему длинный диалог дорожает с каждым сообщением

Модель не помнит предыдущие реплики. Чтобы она понимала, о чём речь, вся переписка отправляется заново — каждый раз, с нуля. Десятое сообщение в диалоге тянет за собой девять предыдущих, и все они снова считаются входящими.

1-е сообщение: 300 токенов на вход. 5-е сообщение: 300 своих + 1 800 истории = 2 100. 10-е сообщение: 300 своих + 4 500 истории = 4 800.

Ты пишешь одинаково короткие реплики, а вход растёт сам. Поэтому длинный разговор «ни о чём» стоит дороже нового чата с тем же вопросом — и поэтому же модель начинает терять начало беседы: старое перестаёт помещаться в окно, о котором речь дальше.

Практический вывод: закончил тему — начинай новый чат. Это и дешевле, и точнее, потому что старый контекст перестаёт мешать.

Контекстное окно: сколько модель держит в голове

У модели нет памяти между сессиями. Всё, чем она располагает прямо сейчас, — это контекстное окно: один «стол», на который разом положено всё, что участвует в разговоре:

  • системная инструкция (как ей себя вести),
  • вся история диалога — и твои сообщения, и её прошлые ответы,
  • файлы, которые ты загрузил,
  • и место под ответ, который она сейчас пишет.

Размер этого стола меряют в токенах — вот что означают числа в описаниях моделей вроде «контекст 1M». Это миллион токенов, и на практике примерно:

1 000 000 токенов ≈ 2 500 страниц английского текста
                  ≈ 1 250 страниц русского (токены-то «дороже»)
— и это на ВСЁ вместе: историю, файлы и ответ

У разных моделей стол разного размера, и это одно из главных отличий между ними. К середине 2026 года миллион токенов есть у топовых моделей всех трёх крупных разработчиков — у Claude, у Gemini, у GPT. Но это верхняя полка: у моделей попроще и подешевле окно меньше, а ещё пару лет назад стандартом были 128 тысяч — в восемь раз меньше сегодняшнего. Выбираешь модель под задачу — смотри её окно, а не общие разговоры про «современный ИИ».

И честная оговорка, которую не пишут в рекламе: заявленное окно и рабочее — не одно и то же. Модель формально принимает миллион токенов, но качество начинает проседать заметно раньше: в середине огромного текста она путается, теряет детали и хуже находит нужное. Разработчики сами это признают. Правило простое: чем ближе к пределу, тем меньше доверия ответу.

Что происходит, когда стол заполнен: начало разговора с него сталкивается. Модель не «забыла» его — для неё этого текста больше нет. Отсюда знакомое: в длинном диалоге ИИ вдруг перестаёт помнить, о чём вы договаривались вначале, и начинает противоречить себе.

Практический вывод: новая задача — новый чат. Длинную переписку, где всё перемешано, модель тянет хуже, чем короткий разговор по делу. А если файл не влез — не грузи его целиком, дай нужный кусок.

И ещё два места, где токены встретятся тебе живьём:

  • Цена — когда нейросеть подключают к своей программе (это называют API), платят именно за токены: отдельно за отправленные, отдельно за полученные. Строишь бота или автоматизацию — считаешь токены.
  • Лимиты тарифов — «сколько сообщений в час» на бесплатных тарифах растут из той же экономики токенов.

Насколько «большая» — большая?

Прочувствуй масштаб. Обучающая выборка флагманских LLM — триллионы токенов: если бы человек читал по книге в день, на этот объём ушли бы сотни тысяч лет. Именно поэтому модель «знает» и физику, и рецепты плова, и синтаксис двадцати языков программирования: она статистически прожевала опыт всего пишущего человечества. И поэтому же в ней есть всё худшее из интернета тоже — компании тратят огромные усилия на фильтрацию данных и дошлифовку поведения (то самое обучение с подкреплением на человеческих оценках из прошлого урока).

Генерация, не поиск

Критически важное следствие: LLM не ищет ответ в базе данных — она генерирует его, предсказывая вероятное продолжение. Поэтому она может написать сонет о твоём коте, которого никогда не существовало в интернете (творчество!). И поэтому же может уверенно написать неправду, если неправда «звучит вероятно» (об этом — весь следующий урок).

Под капотом (по желанию): два красивых факта

Дальше — необязательное углубление. На практику оно не влияет: можешь пропустить и идти к «Сделай сейчас». Но факты красивые — два новых слова, две идеи.

Эмерджентность. Самое загадочное свойство больших моделей: при росте масштаба у них появляются способности, которым их не учили специально. Модель тренировали предсказывать текст — а она внезапно умеет переводить, решать задачки на логику, писать код, объяснять шутки. Эти «внезапные» умения называют эмерджентными. Где предел этого эффекта — учёные до сих пор спорят, и это главная интрига ближайших лет: все три ингредиента (данные, мощность, архитектура) продолжают расти.

Температура. Задай модели один вопрос дважды — ответы будут разными. Это не сбой: при выборе следующего токена модель не всегда берёт самый вероятный — ей разрешают немного «рисковать» (настройка так и называется — температура). Чуть-чуть случайности делает тексты живыми, а не роботизированно-одинаковыми. Практический вывод: не понравился ответ — иногда достаточно просто перегенерировать. А «Столица Франции — Париж» останется стабильным: там вероятность 99% перевешивает любую случайность.

Сделай сейчас

Запусти этот промпт здесь же и, не меняя ни слова, нажми «Запустить» второй раз:

Продолжи фразу пятью разными способами:
Утро началось с того, что…

Ты своими глазами увидишь вероятностную природу генерации: одна модель, один и тот же запрос — и разные вероятные продолжения.

Практика · 3 задачи

Короткие вопросы по уроку — с разбором каждого ответа.

Пропустить урок →