
Что такое токены в нейросетях простыми словами — и почему по-русски дороже
Коротко: токен — это кусок текста, которым оперирует нейросеть. Не буква и не слово: частое короткое слово обычно занимает один токен, длинное и редкое режется на несколько. В английском один токен — это примерно четыре символа, в русском около двух. Отсюда практический вывод: одна и та же мысль на русском стоит примерно вдвое больше токенов, а значит дороже и медленнее. Ниже — как это увидеть своими глазами, чем входящие токены отличаются от исходящих и почему длинный диалог дорожает сам по себе.
Проще один раз увидеть
Возьмём фразу и разрежем её так, как это делает модель. Вертикальная черта — граница токена.
Кот спит на подоконнике.
→ Кот| спит| на| подо|конник|е|.
7 токенов
Видно правило. Частое короткое слово — «кот», «спит», «на» — это один токен. Длинное и редкое режется на части: «подо|конник|е». Знак препинания живёт отдельным токеном. Пробел обычно приклеивается к следующему слову.
Теперь та же мысль по-английски:
The cat sleeps on the windowsill.
→ The| cat| sleeps| on| the| windows|ill|.
8 токенов — но символов в полтора раза больше
Токенов почти столько же, а текста заметно больше. Это и есть разница в «плотности»: английский упакован эффективнее, потому что модели учились преимущественно на нём и словарь токенов затачивали под него.
Практическое правило
В английском 1 токен ≈ 4 символа, в русском ≈ 2 символа. Считаете бюджет или прикидываете, влезет ли документ, — закладывайте на русский двойной запас.
Это касается не только денег. От числа токенов зависит и то, поместится ли ваш текст в окно модели, и как быстро придёт ответ.
Токены считаются дважды: на входе и на выходе
Разговор с моделью — это две порции токенов, и считают их отдельно.
- Входящие — всё, что вы отправили: сам вопрос, вставленный текст, файл, картинка, история переписки.
- Исходящие — всё, что модель написала в ответ.
Разница не в терминах, а в деньгах: исходящие стоят в разы дороже. У Gemini 2.5 Flash-Lite на 30 июля 2026 года вход — $0,10 за миллион токенов, выход — $0,40. Вчетверо.
Посчитаем. Вопрос на 100 слов по-русски — около 300 токенов на вход, это $0,00003. Ответ на 500 слов — около 1500 токенов на выход, это $0,0006. Ответ дороже вопроса в двадцать раз, хотя писали вы его сами, а модель управилась за секунды.
Отсюда правило, которое экономит больше всего: укорачивать надо ответ, а не вопрос. Строчка «ответь одним абзацем» срезает счёт заметнее, чем сокращение вопроса вдвое. А «распиши подробно, со всеми примерами» — самая дорогая фраза, которую можно написать модели.
Почему длинный диалог дорожает с каждым сообщением
Модель не помнит предыдущие реплики. Чтобы она понимала, о чём речь, вся переписка отправляется заново — каждый раз, с нуля. Десятое сообщение тянет за собой девять предыдущих, и все они снова считаются входящими.
1-е сообщение: 300 токенов на вход.
5-е сообщение: 300 своих + 1 800 истории = 2 100.
10-е сообщение: 300 своих + 4 500 истории = 4 800.
Вы пишете одинаково короткие реплики, а вход растёт сам. Поэтому длинный разговор «обо всём» стоит дороже нового чата с тем же вопросом. И поэтому же модель со временем начинает терять начало беседы: старое перестаёт помещаться.
Контекстное окно: куда всё это складывается
Всё, чем модель располагает прямо сейчас, лежит на одном «столе» — это и называется контекстным окном. На нём одновременно системная инструкция, вся история диалога, загруженные файлы и место под ответ, который она пишет.
Размер стола меряют в токенах. К середине 2026 года у топовых моделей — около миллиона токенов: столько заявлено у Claude Sonnet 4.6 (в бете), у Gemini и у GPT-5.4. Ещё пару лет назад стандартом были 128 тысяч, то есть в восемь раз меньше.
Миллион токенов — это примерно 2500 страниц английского текста или около 1250 страниц русского. И это на всё вместе: историю, файлы и ответ.
Честная оговорка, которой нет в рекламе: заявленное окно и рабочее — не одно и то же. Модель формально принимает миллион токенов, но качество проседает заметно раньше: в середине огромного текста она путается и хуже находит нужное. Чем ближе к пределу, тем меньше доверия ответу.
Что делать с этим на практике
- Ограничивайте длину ответа явно. «Три предложения», «списком из пяти пунктов» — это прямая экономия.
- Новая задача — новый чат. И дешевле, и точнее: старый контекст перестаёт мешать.
- Не грузите файл целиком, если нужен кусок. Вырежьте нужное — модель ответит точнее, а не только дешевле.
- Длинные технические промпты пробуйте по-английски. Экономия токенов идёт бонусом к тому, что английскую формулировку модель понимает точнее.
Где увидеть свои токены
Если вы обращаетесь к модели через API, в ответе есть блок usageMetadata: там сама модель сообщает, сколько токенов ушло на вход и сколько на выход, с разбивкой по типам данных. Это самый честный способ проверить любые расчёты — включая наши.
Частые вопросы
Что такое токен в нейросети простыми словами?
Токен — это кусок текста, которым оперирует модель: не буква и не слово. Частое короткое слово обычно занимает один токен, длинное и редкое режется на несколько частей, знак препинания идёт отдельным токеном. Фраза «Кот спит на подоконнике» превращается в 7 токенов.
Сколько символов в одном токене?
В английском примерно четыре символа на токен, в русском около двух. Поэтому одна и та же мысль по-русски занимает в полтора-два раза больше токенов и стоит соответственно дороже.
Почему нейросеть по-русски работает дороже?
Модели учились преимущественно на английских текстах, и словарь токенов затачивали под английский. Русский текст дробится на более мелкие куски, поэтому на ту же мысль уходит примерно вдвое больше токенов. Оплата идёт за токены, отсюда и разница в цене.
Чем входящие токены отличаются от исходящих?
Входящие — всё, что вы отправили модели: вопрос, файлы, история переписки. Исходящие — то, что она написала в ответ. Считаются они отдельно, и выход дороже входа: у Gemini 2.5 Flash-Lite $0,40 против $0,10 за миллион на 30 июля 2026 года.
Почему длинный диалог с ИИ становится дороже?
Модель не помнит предыдущие реплики — вся переписка отправляется заново при каждом сообщении. Десятое сообщение тянет за собой девять предыдущих, и они снова считаются входящими токенами. Вы пишете так же коротко, а вход растёт сам.
Что такое контекстное окно и какое оно сейчас?
Это всё, чем модель располагает прямо сейчас: системная инструкция, история диалога, файлы и место под ответ. Измеряется в токенах. К середине 2026 года у топовых моделей около миллиона токенов — примерно 2500 страниц английского текста. Ещё пару лет назад стандартом были 128 тысяч.
Правда ли, что миллион токенов контекста работает как миллион?
Нет. Заявленное окно и рабочее — разные вещи. Модель формально принимает миллион токенов, но качество начинает проседать заметно раньше: в середине огромного текста она путается и хуже находит нужное. Чем ближе к пределу, тем осторожнее стоит относиться к ответу.
Как уменьшить расход токенов?
Явно ограничивать длину ответа — исходящие токены вчетверо дороже входящих. Начинать новый чат под новую задачу, потому что история отправляется заново каждый раз. Не грузить файл целиком, если нужен один раздел. Длинные технические промпты писать по-английски.