Нейрокурс
Таблица стоимости девяти операций нейросети: текстовый запрос $0,0003, разбор фотографии $0,001, сгенерированная картинка $0,04, восемь секунд видео на Veo $3,20

Сколько стоит один запрос к нейросети: мы замерили девять операций

9 мин чтения

Коротко: 30 июля 2026 года мы прогнали девять типов запросов через Google Vertex AI и записали токены прямо из ответов API. Главный вывод: читать для нейросети дёшево, создавать — дорого, и разрыв доходит до тысячи раз. Посмотреть десятиминутный ролик с YouTube стоит два цента. Снять восемь секунд видео — три доллара двадцать центов. Это одна и та же технология и один и тот же счёт, но операции разной природы, и планировать бюджет, не понимая разницы, невозможно.

Как мы считали

Не по калькуляторам на сайтах и не по обещаниям в блогах вендоров. Каждый запрос уходил в Vertex AI на сервисном аккаунте нашего проекта, а из ответа мы забирали блок usageMetadata — там модель сама сообщает, во сколько токенов ей обошлось то, что вы прислали, и то, что она написала.

Дальше — умножение на прайс Google от 30 июля 2026 года для семейства Gemini 2.5 Flash-Lite: $0,10 за миллион входящих токенов (текст, картинки, видео), $0,30 за миллион входящих аудио и $0,40 за миллион исходящих. Цены генерации видео — из прайса Veo 3.1: $0,40 за секунду в стандартном режиме.

Метод важен, потому что позволяет вам повторить: те же цифры лежат в ответе любого вашего запроса, если посмотреть на usageMetadata.

Таблица: что сколько стоит

ОперацияЧто происходитЦена за раз
Вопрос текстом~300 токенов внутрь, ~500 наружу$0,0003
Разбор фотографиикартинка + короткий ответ$0,001
Расшифровка голосового, 30 секаудио дороже текста втрое$0,0008
Озвучка текста, 1 абзацсинтез речи$0,0006
Разбор ролика 3 мин51 тыс. токенов$0,006
Разбор ролика 10 мин171 тыс. токенов$0,02
Сгенерированная картинка1290 исходящих токенов$0,04
Видео 8 сек, быстрый режимпосекундная тарификация$0,64
Видео 8 сек, обычный режимпосекундная тарификация$3,20

Главное открытие: посмотреть дешевле, чем сделать

Сравните две строки таблицы. Разобрать чужой десятиминутный ролик — два цента. Сгенерировать восемь секунд своего — три доллара двадцать. Разница в 160 раз, при том что во втором случае вы получаете в семьдесят пять раз меньше секунд.

Причина в том, как устроена тарификация. Всё, что вы отправляете модели, — это входящие токены, самое дешёвое в прайсе. Всё, что она производит, — исходящие, и стоят они в разы дороже. У Flash-Lite вход $0,10 за миллион, выход $0,40 — вчетверо. А генерация картинок и видео вообще считается отдельно и по другим ставкам.

Отсюда правило, которое экономит больше всего денег: укорачивать надо ответ, а не вопрос. Строчка «ответь одним абзацем» срезает счёт заметнее, чем сокращение вопроса вдвое. Самая дорогая фраза, которую можно написать модели, — «распиши подробно, со всеми примерами».

Сколько видео стоит по секундам

Мы замерили это отдельно, обрезав один ролик до разной длины. Модель считает видео так: 258 токенов на секунду видеоряда и 25 токенов на секунду звука. Зависимость строго линейная — пять секунд дали 1290 токенов, десять секунд ровно 2580.

ДлинаТокеновЦена разбора
5 секунд1 415$0,0002
1 минута17 000$0,002
5 минут85 000$0,010
10 минут171 000$0,020

Практический смысл: разбор видео — не роскошь. Если вам нужно вытащить суть из часовой лекции, это обойдётся примерно в двенадцать центов. Дороже будет ваше время на постановку задачи.

Почему считать всё-таки придётся

Отдельный запрос стоит доли цента, и от этого возникает ощущение, что считать нечего. Ощущение обманчивое по двум причинам.

Первая: диалог дорожает с каждым сообщением. Модель не помнит предыдущие реплики — чтобы она понимала контекст, вся переписка отправляется заново при каждом обращении. Десятое сообщение тянет за собой девять предыдущих, и все они снова считаются входящими. Вы пишете одинаково короткие реплики, а счёт растёт сам.

Вторая: русский текст дороже английского примерно вдвое. Модель считает не буквы и не слова, а токены — куски текста. Английский разбивается на токены крупнее: там один токен это примерно четыре символа, в русском — около двух. Одна и та же мысль на русском обходится в полтора-два раза дороже.

Что с этим делать на практике

  • Ограничивайте длину ответа явно. «Три предложения», «одним абзацем», «списком из пяти пунктов» — это прямая экономия, а не придирка к стилю.
  • Начинайте новый чат под новую задачу. Длинная переписка «обо всём» стоит дороже свежего чата с тем же вопросом — и работает точнее, потому что старый контекст перестаёт мешать.
  • Не генерируйте то, что можно найти. Прочитать существующий ролик или документ почти всегда дешевле, чем создать свой.
  • Для длинных технических промптов пробуйте английский. Дело не только в цене: модели учились преимущественно на английских текстах и понимают английскую формулировку точнее.

Оговорки, без которых цифры врут

Мы замеряли на одной модели — Gemini 2.5 Flash-Lite — и на одном облаке. У более мощных моделей цены выше в разы, у конкурентов — свои прайсы. Порядок величин и, главное, соотношение между операциями сохраняются везде: вход дешевле выхода, чтение дешевле создания.

Второе: тарифы меняются. Наши цифры датированы 30 июля 2026 года. Проверять цену стоит на странице прайса вендора, а не по статьям — включая эту.

🧠Разобраться глубже — в курсеНейросети для начинающих

Частые вопросы

Сколько стоит один запрос к ChatGPT или Gemini для обычного пользователя?

Если вы пользуетесь чатом через сайт по подписке — нисколько сверх подписки, лимиты там считаются в запросах, а не в деньгах. Цифры из этой статьи относятся к обращению через API, когда нейросеть подключают к своей программе: там платят именно за токены. Порядок такой: текстовый вопрос — $0,0003, разбор фотографии — $0,001, сгенерированная картинка — $0,04.

Почему сгенерировать картинку дороже, чем прочитать десять фотографий?

Потому что это операции разной природы. Прочитать картинку — значит отправить её на вход, а входящие токены самые дешёвые. Создать картинку — значит произвести исходящие данные, и они тарифицируются отдельно и заметно дороже. По нашим замерам одна сгенерированная картинка стоит $0,04, а разбор фотографии — $0,001, то есть в сорок раз дешевле.

Сколько стоит разобрать видео с YouTube через нейросеть?

По замерам от 30 июля 2026 года на Gemini 2.5 Flash-Lite: 258 токенов на секунду видеоряда плюс 25 токенов на секунду звука. Десятиминутный ролик — около 171 тысячи токенов, то есть примерно $0,02. Час видео обойдётся примерно в двенадцать центов.

Правда ли, что генерация видео стоит доллары за секунды?

Да. Veo 3.1 тарифицируется посекундно: $0,40 за секунду в стандартном режиме и от $0,05 в облегчённом. Восьмисекундный клип обходится в $3,20 на стандартном режиме — это дороже, чем разобрать полтораста часов чужого видео.

Как уменьшить расходы на нейросеть без потери качества?

Три приёма дают основную экономию. Первый: явно ограничивать длину ответа, потому что исходящие токены дороже входящих вчетверо. Второй: начинать новый чат под новую задачу — вся история диалога отправляется заново при каждом сообщении. Третий: не генерировать то, что можно найти и прочитать.

Почему русский текст обходится дороже английского?

Модель считает не буквы и не слова, а токены — куски текста. Английский разбивается на более крупные куски: примерно четыре символа на токен против двух в русском. Одна и та же мысль по-русски занимает в полтора-два раза больше токенов и, соответственно, стоит дороже.

Где посмотреть, сколько токенов съел мой собственный запрос?

В ответе API есть блок usageMetadata — там модель сама сообщает количество входящих и исходящих токенов, причём с разбивкой по типам данных: текст, картинка, видео, аудио. Именно из него взяты все цифры этой статьи, и вы можете повторить замер на своих запросах.