Neurocourse
Tabela cen dziewięciu operacji AI: zapytanie tekstowe za 0,0003 USD, odczyt zdjęcia za 0,001 USD, wygenerowany obraz za 0,04 USD i osiem sekund wideo Veo za 3,20 USD

Ile kosztuje jedno zapytanie AI: zmierzyliśmy dziewięć operacji

9 min read

W skrócie: 30 lipca 2026 r. przepuściliśmy dziewięć typów zapytań przez Google Vertex AI i zarejestrowaliśmy liczbę tokenów bezpośrednio z odpowiedzi API. Główny wniosek: czytanie jest tanie dla AI, tworzenie jest drogie, a różnica sięga tysiąckrotnie. Oglądanie dziesięciominutowego wideo na YouTube kosztuje dwa centy. Generowanie ośmiu sekund wideo kosztuje trzy dolary dwadzieścia. Ta sama technologia, ten sam rachunek, ale operacje o zupełnie innej naturze — a ty nie zaplanujesz budżetu, nie rozumiejąc tej różnicy.

Jak to zmierzyliśmy

Nie z kalkulatorów na stronach marketingowych ani z obietnic na blogach dostawców. Każde zapytanie trafiło do Vertex AI na koncie usługowym naszego projektu, a z każdej odpowiedzi pobraliśmy blok usageMetadata — gdzie sam model raportuje, ile tokenów kosztował twój wkład i ile jego odpowiedź.

Następnie pomnożyliśmy to przez ceny opublikowane przez Google na dzień 30 lipca 2026 r. dla rodziny Gemini 2.5 Flash-Lite: 0,10 USD za milion tokenów wejściowych (tekst, obrazy, wideo), 0,30 USD za milion tokenów wejściowych audio i 0,40 USD za milion tokenów wyjściowych. Ceny generowania wideo pochodzą z cennika Veo 3.1: 0,40 USD za sekundę w trybie standardowym.

Metoda ma znaczenie, ponieważ pozwala ci ją powtórzyć: te same liczby znajdują się w odpowiedzi na każde zapytanie, które wykonasz, jeśli spojrzysz na usageMetadata.

Tabela: co ile kosztuje

OperacjaCo się dziejeKoszt za uruchomienie
Zapytanie tekstowe~300 tokenów wejścia, ~500 wyjścia$0.0003
Odczyt zdjęciaobraz plus krótka odpowiedź$0.001
Transkrypcja 30 s mowyaudio kosztuje trzy razy więcej niż tekst$0.0008
Czytanie akapitu na głossynteza mowy$0.0006
Oglądanie 3-minutowego wideo51 tys. tokenów$0.006
Oglądanie 10-minutowego wideo171 tys. tokenów$0.02
Generowanie jednego obrazu1290 tokenów wyjściowych$0.04
8 s wideo, tryb szybkirozliczane za sekundę$0.64
8 s wideo, tryb standardowyrozliczane za sekundę$3.20

Wniosek: oglądanie jest tańsze niż tworzenie

Porównaj dwa wiersze. Analiza czyjegoś dziesięciominutowego wideo: dwa centy. Generowanie ośmiu sekund własnego wideo: trzy dolary dwadzieścia. To 160 razy więcej za siedemdziesiąt pięć razy mniej sekund.

Powodem jest sposób rozliczania. Wszystko, co wysyłasz do modelu, to input tokens — najtańsza rzecz w cenniku. Wszystko, co produkuje, to output, a output kosztuje kilka razy więcej. W przypadku Flash-Lite, input to 0,10 USD za milion, a output to 0,40 USD — cztery razy więcej. Generowanie obrazów i wideo jest ponownie rozliczane oddzielnie, według zupełnie innych stawek.

Stąd zasada, która pozwala zaoszczędzić najwięcej pieniędzy: skracaj odpowiedź, nie pytanie. Wskazówka „odpowiedz w jednym akapicie” obniży twój rachunek bardziej niż skrócenie pytania o połowę. Najdroższe zdanie, jakie możesz napisać do modelu, to „wyjaśnij szczegółowo, ze wszystkimi przykładami”.

Wideo, sekunda po sekundzie

Zmierzyliśmy to oddzielnie, przycinając jeden klip do różnych długości. Model liczy wideo jako 258 tokenów na sekundę materiału filmowego i 25 tokenów na sekundę audio. Zależność jest ściśle liniowa — pięć sekund dało 1290 tokenów, dziesięć sekund dało dokładnie 2580.

DługośćTokenyKoszt analizy
5 sekund1415$0.0002
1 minuta17000$0.002
5 minut85000$0.010
10 minut171000$0.020

Co to oznacza w praktyce: analiza wideo nie jest luksusem. Wydobycie esencji z godzinnego wykładu kosztuje około dwunastu centów. Twój własny czas poświęcony na sformułowanie zadania będzie kosztował więcej.

Dlaczego nadal musisz liczyć

Pojedyncze zapytanie kosztuje ułamek centa, co stwarza wrażenie, że nie ma czego liczyć. To wrażenie jest błędne z dwóch powodów.

Po pierwsze: rozmowa staje się droższa z każdą wiadomością. Model nie pamięta poprzednich tur — aby śledził kontekst, cała wymiana jest wysyłana ponownie z każdym zapytaniem. Twoja dziesiąta wiadomość ciągnie za sobą dziewięć poprzednich, a wszystkie z nich ponownie liczą się jako input. Ty piszesz równie krótkie odpowiedzi, podczas gdy rachunek rośnie sam.

Po drugie: niektóre języki kosztują mniej więcej dwa razy więcej niż angielski. Model liczy ani liter, ani słów, ale tokeny — fragmenty tekstu. Angielski dzieli się na większe fragmenty: jeden token to tam mniej więcej cztery znaki, podczas gdy w wielu innych językach jest to bliżej dwóch. Ta sama myśl kosztuje półtora do dwóch razy więcej.

Co z tym zrobić

  • Wyraźnie ograniczaj długość odpowiedzi. „Trzy zdania”, „jeden akapit”, „lista pięciu” — to bezpośrednie oszczędności, a nie stylistyczne czepialstwo.
  • Rozpocznij nowy czat dla nowego zadania. Długi wątek „wszystko w jednym” kosztuje więcej niż świeży czat z tym samym pytaniem — i działa lepiej, bo przestarzały kontekst przestaje przeszkadzać.
  • Nie generuj tego, co możesz znaleźć. Czytanie istniejącego klipu lub dokumentu jest prawie zawsze tańsze niż tworzenie własnego.
  • W przypadku długich promptów technicznych spróbuj angielskiego. Nie chodzi tylko o cenę: modele uczyły się głównie na tekstach angielskich i precyzyjniej wykonują angielskie briefy.

Zastrzeżenia, bez których liczby kłamią

Zmierzyliśmy jeden model — Gemini 2.5 Flash-Lite — na jednej chmurze. Potężniejsze modele kosztują kilka razy więcej; konkurenci mają własne cenniki. To, co wszędzie się sprawdza, to rząd wielkości i, co ważniejsze, stosunek między operacjami: input jest tańszy niż output, czytanie jest tańsze niż tworzenie.

Po drugie: taryfy się zmieniają. Nasze dane pochodzą z 30 lipca 2026 r. Sprawdź cenę na stronie cennika dostawcy, a nie w artykułach — w tym w tym.

🧠Go deeper — in the courseSieci neuronowe dla początkujących

FAQ

Ile kosztuje zapytanie ChatGPT lub Gemini?

Na subskrypcji płacisz za liczbę zapytań. Dane z artykułu dotyczą dostępu API, gdzie płacisz za token: tekst 0,0003 USD, zdjęcie 0,001 USD, obraz 0,04 USD.

Dlaczego generowanie obrazu kosztuje więcej niż odczyt zdjęć?

To operacje różnego rodzaju. Odczyt obrazu to input (tanie tokeny). Tworzenie obrazu to output (droższe). Obraz 0,04 USD, zdjęcie 0,001 USD — 40 razy mniej.

Ile kosztuje analiza wideo YouTube przez AI?

Zmierzono (Gemini 2.5 Flash-Lite): 258 tokenów/s wideo + 25 tokenów/s audio. 10-minutowy klip to ~0,02 USD. Godzina wideo ~12 centów.

Czy generowanie wideo kosztuje dolary za sekundę?

Tak. Veo 3.1 rozliczane jest za sekundę: 0,40 USD/s (standard) i od 0,05 USD (lite). 8-sekundowy klip to 3,20 USD — więcej niż 150 godzin analizy.

Jak obniżyć koszty AI bez utraty jakości?

Trzy nawyki pomogą. 1. Ograniczaj długość odpowiedzi (output tokens 4x droższe). 2. Nowy czat dla zadania (historia wysyłana). 3. Nie generuj, co możesz znaleźć.

Dlaczego tekst w niektórych językach kosztuje więcej niż po angielsku?

Model liczy nie litery ani słowa, ale tokeny — fragmenty tekstu. Angielski dzieli się na większe fragmenty: około czterech znaków na token, w porównaniu do około dwóch w wielu innych językach. Ta sama myśl zajmuje półtora do dwóch razy więcej tokenów i kosztuje proporcjonalnie więcej.

Gdzie możesz zobaczyć, ile tokenów zużyło twoje zapytanie?

Odpowiedź API zawiera blok usageMetadata, gdzie model raportuje liczbę tokenów wejściowych i wyjściowych, podzielonych według modalności: text, image, video, audio. Każda liczba w tym artykule pochodzi stamtąd, a ty możesz powtórzyć pomiar na swoich własnych zapytaniach.