
Czym są tokeny w prostych słowach — i dlaczego niektóre języki kosztują dwa razy więcej
W skrócie: token to fragment tekstu, na którym operuje sieć neuronowa. Ani litera, ani słowo: krótkie, często używane słowo to zazwyczaj jeden token, długie lub rzadkie jest dzielone na kilka. W języku angielskim token to mniej więcej cztery znaki; w wielu innych językach bliżej dwóch. Praktyczna konsekwencja: ta sama myśl poza angielskim zajmuje około dwa razy więcej tokenów, więc kosztuje więcej i działa wolniej. Poniżej: jak samemu to sprawdzić, czym różnią się tokeny wejściowe od wyjściowych i dlaczego długa rozmowa staje się droższa sama z siebie.
Łatwiej zobaczyć raz
Weź zdanie i podziel je tak, jak robi to model. Pionowa kreska to granica tokenu.
The cat sleeps on the windowsill.
→ The| cat| sleeps| on| the| windows|ill|.
8 tokenów
Zasada jest widoczna. Krótkie, często używane słowo — „the”, „cat”, „on” — to pojedynczy token. Długie lub rzadkie jest dzielone: „windows|ill”. Interpunkcja żyje jako osobny token. Spacja zazwyczaj przylega do słowa, które po niej następuje.
Teraz ta sama myśl po rosyjsku:
Кот спит на подоконнике.
→ Кот| спит| на| подо|конник|е|.
7 tokenów — z o połowę mniejszą liczbą znaków
Prawie taka sama liczba tokenów dla zauważalnie mniejszej ilości tekstu. To jest luka w gęstości: angielski jest pakowany bardziej efektywnie, ponieważ modele były trenowane głównie na nim, a słownictwo tokenów zostało do niego dostosowane.
Zasada kciuka
W języku angielskim 1 token ≈ 4 znaki; w wielu innych językach ≈ 2 znaki. Budżetując lub sprawdzając, czy dokument się zmieści — podwój swoje oszacowanie poza angielskim.
Nie chodzi tylko o pieniądze. Liczba tokenów decyduje o tym, czy twój tekst w ogóle zmieści się w oknie modelu i jak szybko nadejdzie odpowiedź.
Tokeny liczone są podwójnie: wejście i wyjście
Rozmowa z modelem to dwie porcje tokenów, rozliczane oddzielnie.
- Wejście — wszystko, co wysyłasz: pytanie, wklejony tekst, plik, obraz, historia rozmowy.
- Wyjście — wszystko, co model odpisuje.
Różnica to nie terminologia, ale pieniądze: wyjście kosztuje kilka razy więcej. Z Gemini 2.5 Flash-Lite na dzień 30 lipca 2026, wejście to 0,10 USD za milion tokenów, a wyjście to 0,40 USD. Cztery razy więcej.
Policzmy. Pytanie na 100 słów to około 300 tokenów wejściowych — 0,00003 USD. Odpowiedź na 500 słów to około 1500 tokenów wyjściowych — 0,0006 USD. Odpowiedź kosztuje dwadzieścia razy więcej niż pytanie, mimo że swoje napisałeś sam, a model wygenerował swoją w kilka sekund.
Stąd zasada, która oszczędza najwięcej: skróć odpowiedź, nie pytanie. Zdanie „odpowiedz w jednym akapicie” obniża rachunek bardziej niż zmniejszenie twojego pytania o połowę. A „wyjaśnij szczegółowo, ze wszystkimi przykładami” to najdroższe zdanie, jakie możesz napisać do modelu.
Dlaczego długa rozmowa staje się droższa z każdą wiadomością
Model nie pamięta wcześniejszych tur. Aby mógł śledzić wątek, cała wymiana jest wysyłana ponownie — za każdym razem, od zera. Twoja dziesiąta wiadomość ciągnie za sobą dziewięć poprzednich, a wszystkie z nich ponownie liczą się jako wejście.
Wiadomość 1: 300 tokenów wejściowych.
Wiadomość 5: 300 twoich własnych + 1800 historii = 2100.
Wiadomość 10: 300 twoich własnych + 4500 historii = 4800.
Ty nadal piszesz równie krótkie odpowiedzi, podczas gdy wejście rośnie samo z siebie. Dlatego długi wątek „wszystko w jednym” kosztuje więcej niż świeży czat z tym samym pytaniem — i dlatego model w końcu zaczyna gubić początek rozmowy: stary tekst już się nie mieści.
Okno kontekstowe: gdzie to wszystko się gromadzi
Wszystko, co model ma obecnie dostępne, leży na jednym stole — to jest okno kontekstowe. Na nim jednocześnie: instrukcja systemowa, cała historia rozmowy, wszelkie przesłane pliki i miejsce na odpowiedź, którą pisze.
Rozmiar tego stołu mierzy się w tokenach. Do połowy 2026 roku najlepsze modele mają około miliona: to właśnie reklamują Claude Sonnet 4.6 (w wersji beta), Gemini i GPT-5.4. Kilka lat wcześniej standard wynosił 128 tysięcy — osiem razy mniej.
Milion tokenów to mniej więcej 2500 stron tekstu angielskiego lub około 1250 stron w gęstszym języku. I to wszystko razem: historia, pliki i odpowiedź.
Uczciwe zastrzeżenie, którego nie znajdziesz w marketingu: reklamowane okno i to działające to dwie różne rzeczy. Model formalnie akceptuje milion tokenów, ale jakość zauważalnie spada wcześniej — w środku ogromnego tekstu gubi się i mniej wiarygodnie znajduje informacje. Im bliżej limitu, tym mniej powinieneś ufać odpowiedzi.
Co z tym wszystkim zrobić
- Wyraźnie ogranicz długość odpowiedzi. „Trzy zdania”, „lista pięciu” — bezpośrednie oszczędności.
- Nowe zadanie, nowy czat. Taniej i dokładniej: nieaktualny kontekst przestaje przeszkadzać.
- Nie przesyłaj całego pliku, gdy potrzebujesz jednej sekcji. Wytnij część, która ma znaczenie — odpowiedź będzie lepsza, nie tylko tańsza.
- Spróbuj długich, technicznych promptów po angielsku. Oszczędność tokenów to bonus do faktu, że modele precyzyjniej podążają za angielską instrukcją.
Gdzie sprawdzić swoje liczniki tokenów
Jeśli łączysz się z modelem przez API, odpowiedź zawiera blok usageMetadata: sam model raportuje, ile tokenów weszło, a ile wyszło, z podziałem na modalności. To najbardziej uczciwy sposób na sprawdzenie wszelkich obliczeń — w tym naszych.
FAQ
Czym jest token w sieci neuronowej, w prostych słowach?
Token to fragment tekstu, z którym pracuje model — ani litera, ani słowo. Krótkie, często używane słowo to zazwyczaj jeden token, długie lub rzadkie jest dzielone na kilka, a interpunkcja otrzymuje własny token. Zdanie «The cat sleeps on the windowsill» staje się 8 tokenami.
Ile znaków ma jeden token?
Mniej więcej cztery znaki na token w języku angielskim i bliżej dwóch w wielu innych językach. Ta sama myśl zajmuje zatem od półtora do dwóch razy więcej tokenów poza angielskim i kosztuje proporcjonalnie więcej.
Dlaczego AI kosztuje więcej w językach innych niż angielski?
Modele były trenowane głównie na tekstach angielskich, a słownictwo tokenów zostało dostosowane do angielskiego. Inne języki dzielą się na mniejsze fragmenty, więc ta sama myśl zajmuje około dwa razy więcej tokenów. Rozliczenie jest za token, stąd różnica w cenie.
Jaka jest różnica między tokenami wejściowymi a wyjściowymi?
Wejście to wszystko, co wysyłasz do modelu: twoje pytanie, pliki, historia rozmowy. Wyjście to to, co model odpisuje. Są rozliczane oddzielnie, a wyjście kosztuje więcej: z Gemini 2.5 Flash-Lite to 0,40 USD wobec 0,10 USD za milion na dzień 30 lipca 2026.
Dlaczego długa rozmowa z AI staje się droższa?
Model nie pamięta wcześniejszych tur — cała wymiana jest ponownie wysyłana z każdą wiadomością. Twoja dziesiąta wiadomość ciągnie za sobą dziewięć poprzednich, a one ponownie liczą się jako tokeny wejściowe. Ty piszesz równie zwięźle, podczas gdy wejście rośnie samo z siebie.
Czym jest okno kontekstowe i jak duże jest teraz?
To wszystko, co model ma obecnie dostępne: instrukcja systemowa, historia rozmowy, przesłane pliki i miejsce na odpowiedź. Mierzy się je w tokenach. Do połowy 2026 roku najlepsze modele mają około miliona — mniej więcej 2500 stron tekstu angielskiego. Kilka lat wcześniej standard wynosił 128 tysięcy.
Czy okno kontekstowe na milion tokenów naprawdę działa jak milion?
Nie. Reklamowane okno i to działające to dwie różne rzeczy. Model formalnie akceptuje milion tokenów, ale jakość zauważalnie spada wcześniej: w środku ogromnego tekstu gubi się i mniej wiarygodnie znajduje informacje. Im bliżej limitu, tym ostrożniej powinieneś traktować odpowiedź.
Jak zmniejszyć zużycie tokenów?
Wyraźnie ogranicz długość odpowiedzi — tokeny wyjściowe kosztują cztery razy więcej niż wejściowe. Rozpocznij nowy czat dla nowego zadania, ponieważ historia jest wysyłana ponownie za każdym razem. Nie przesyłaj całego pliku, gdy wystarczy jedna sekcja. Pisz długie, techniczne prompty po angielsku.