
Сколько стоит один запрос к нейросети: мы замерили девять операций
Коротко: 30 июля 2026 года мы прогнали девять типов запросов через Google Vertex AI и записали токены прямо из ответов API. Главный вывод: читать для нейросети дёшево, создавать — дорого, и разрыв доходит до тысячи раз. Посмотреть десятиминутный ролик с YouTube стоит два цента. Снять восемь секунд видео — три доллара двадцать центов. Это одна и та же технология и один и тот же счёт, но операции разной природы, и планировать бюджет, не понимая разницы, невозможно.
Как мы считали
Не по калькуляторам на сайтах и не по обещаниям в блогах вендоров. Каждый запрос уходил в Vertex AI на сервисном аккаунте нашего проекта, а из ответа мы забирали блок usageMetadata — там модель сама сообщает, во сколько токенов ей обошлось то, что вы прислали, и то, что она написала.
Дальше — умножение на прайс Google от 30 июля 2026 года для семейства Gemini 2.5 Flash-Lite: $0,10 за миллион входящих токенов (текст, картинки, видео), $0,30 за миллион входящих аудио и $0,40 за миллион исходящих. Цены генерации видео — из прайса Veo 3.1: $0,40 за секунду в стандартном режиме.
Метод важен, потому что позволяет вам повторить: те же цифры лежат в ответе любого вашего запроса, если посмотреть на usageMetadata.
Таблица: что сколько стоит
| Операция | Что происходит | Цена за раз |
|---|---|---|
| Вопрос текстом | ~300 токенов внутрь, ~500 наружу | $0,0003 |
| Разбор фотографии | картинка + короткий ответ | $0,001 |
| Расшифровка голосового, 30 сек | аудио дороже текста втрое | $0,0008 |
| Озвучка текста, 1 абзац | синтез речи | $0,0006 |
| Разбор ролика 3 мин | 51 тыс. токенов | $0,006 |
| Разбор ролика 10 мин | 171 тыс. токенов | $0,02 |
| Сгенерированная картинка | 1290 исходящих токенов | $0,04 |
| Видео 8 сек, быстрый режим | посекундная тарификация | $0,64 |
| Видео 8 сек, обычный режим | посекундная тарификация | $3,20 |
Главное открытие: посмотреть дешевле, чем сделать
Сравните две строки таблицы. Разобрать чужой десятиминутный ролик — два цента. Сгенерировать восемь секунд своего — три доллара двадцать. Разница в 160 раз, при том что во втором случае вы получаете в семьдесят пять раз меньше секунд.
Причина в том, как устроена тарификация. Всё, что вы отправляете модели, — это входящие токены, самое дешёвое в прайсе. Всё, что она производит, — исходящие, и стоят они в разы дороже. У Flash-Lite вход $0,10 за миллион, выход $0,40 — вчетверо. А генерация картинок и видео вообще считается отдельно и по другим ставкам.
Отсюда правило, которое экономит больше всего денег: укорачивать надо ответ, а не вопрос. Строчка «ответь одним абзацем» срезает счёт заметнее, чем сокращение вопроса вдвое. Самая дорогая фраза, которую можно написать модели, — «распиши подробно, со всеми примерами».
Сколько видео стоит по секундам
Мы замерили это отдельно, обрезав один ролик до разной длины. Модель считает видео так: 258 токенов на секунду видеоряда и 25 токенов на секунду звука. Зависимость строго линейная — пять секунд дали 1290 токенов, десять секунд ровно 2580.
| Длина | Токенов | Цена разбора |
|---|---|---|
| 5 секунд | 1 415 | $0,0002 |
| 1 минута | 17 000 | $0,002 |
| 5 минут | 85 000 | $0,010 |
| 10 минут | 171 000 | $0,020 |
Практический смысл: разбор видео — не роскошь. Если вам нужно вытащить суть из часовой лекции, это обойдётся примерно в двенадцать центов. Дороже будет ваше время на постановку задачи.
Почему считать всё-таки придётся
Отдельный запрос стоит доли цента, и от этого возникает ощущение, что считать нечего. Ощущение обманчивое по двум причинам.
Первая: диалог дорожает с каждым сообщением. Модель не помнит предыдущие реплики — чтобы она понимала контекст, вся переписка отправляется заново при каждом обращении. Десятое сообщение тянет за собой девять предыдущих, и все они снова считаются входящими. Вы пишете одинаково короткие реплики, а счёт растёт сам.
Вторая: русский текст дороже английского примерно вдвое. Модель считает не буквы и не слова, а токены — куски текста. Английский разбивается на токены крупнее: там один токен это примерно четыре символа, в русском — около двух. Одна и та же мысль на русском обходится в полтора-два раза дороже.
Что с этим делать на практике
- Ограничивайте длину ответа явно. «Три предложения», «одним абзацем», «списком из пяти пунктов» — это прямая экономия, а не придирка к стилю.
- Начинайте новый чат под новую задачу. Длинная переписка «обо всём» стоит дороже свежего чата с тем же вопросом — и работает точнее, потому что старый контекст перестаёт мешать.
- Не генерируйте то, что можно найти. Прочитать существующий ролик или документ почти всегда дешевле, чем создать свой.
- Для длинных технических промптов пробуйте английский. Дело не только в цене: модели учились преимущественно на английских текстах и понимают английскую формулировку точнее.
Оговорки, без которых цифры врут
Мы замеряли на одной модели — Gemini 2.5 Flash-Lite — и на одном облаке. У более мощных моделей цены выше в разы, у конкурентов — свои прайсы. Порядок величин и, главное, соотношение между операциями сохраняются везде: вход дешевле выхода, чтение дешевле создания.
Второе: тарифы меняются. Наши цифры датированы 30 июля 2026 года. Проверять цену стоит на странице прайса вендора, а не по статьям — включая эту.
Частые вопросы
Сколько стоит один запрос к ChatGPT или Gemini для обычного пользователя?
Если вы пользуетесь чатом через сайт по подписке — нисколько сверх подписки, лимиты там считаются в запросах, а не в деньгах. Цифры из этой статьи относятся к обращению через API, когда нейросеть подключают к своей программе: там платят именно за токены. Порядок такой: текстовый вопрос — $0,0003, разбор фотографии — $0,001, сгенерированная картинка — $0,04.
Почему сгенерировать картинку дороже, чем прочитать десять фотографий?
Потому что это операции разной природы. Прочитать картинку — значит отправить её на вход, а входящие токены самые дешёвые. Создать картинку — значит произвести исходящие данные, и они тарифицируются отдельно и заметно дороже. По нашим замерам одна сгенерированная картинка стоит $0,04, а разбор фотографии — $0,001, то есть в сорок раз дешевле.
Сколько стоит разобрать видео с YouTube через нейросеть?
По замерам от 30 июля 2026 года на Gemini 2.5 Flash-Lite: 258 токенов на секунду видеоряда плюс 25 токенов на секунду звука. Десятиминутный ролик — около 171 тысячи токенов, то есть примерно $0,02. Час видео обойдётся примерно в двенадцать центов.
Правда ли, что генерация видео стоит доллары за секунды?
Да. Veo 3.1 тарифицируется посекундно: $0,40 за секунду в стандартном режиме и от $0,05 в облегчённом. Восьмисекундный клип обходится в $3,20 на стандартном режиме — это дороже, чем разобрать полтораста часов чужого видео.
Как уменьшить расходы на нейросеть без потери качества?
Три приёма дают основную экономию. Первый: явно ограничивать длину ответа, потому что исходящие токены дороже входящих вчетверо. Второй: начинать новый чат под новую задачу — вся история диалога отправляется заново при каждом сообщении. Третий: не генерировать то, что можно найти и прочитать.
Почему русский текст обходится дороже английского?
Модель считает не буквы и не слова, а токены — куски текста. Английский разбивается на более крупные куски: примерно четыре символа на токен против двух в русском. Одна и та же мысль по-русски занимает в полтора-два раза больше токенов и, соответственно, стоит дороже.
Где посмотреть, сколько токенов съел мой собственный запрос?
В ответе API есть блок usageMetadata — там модель сама сообщает количество входящих и исходящих токенов, причём с разбивкой по типам данных: текст, картинка, видео, аудио. Именно из него взяты все цифры этой статьи, и вы можете повторить замер на своих запросах.