Neurocourse
A frase «The cat sleeps on the windowsill» dividida em oito tokens por barras verticais, ao lado de sua versão em russo dividida em sete

O que são tokens? Por que algumas línguas custam o dobro

8 min read

A versão curta: um token é um pedaço de texto que uma rede neural opera. Não é uma letra nem uma palavra: uma palavra curta comum geralmente leva um token, uma longa e rara é dividida em várias. Em inglês, um token tem aproximadamente quatro caracteres; em muitas outras línguas, está mais perto de dois. A consequência prática: a mesma ideia fora do inglês leva cerca de duas vezes mais tokens, então custa mais e é mais lenta. Abaixo: como ver isso por você mesmo, como os tokens de entrada e saída são contados separadamente e por que uma conversa longa fica mais cara a cada mensagem.

Mais fácil de ver uma vez

Pegue uma frase e corte-a como um modelo faria. A barra vertical é um limite de token.

The cat sleeps on the windowsill.
→ The| cat| sleeps| on| the| windows|ill|.
8 tokens

A regra é visível. Uma palavra curta comum — "the", "cat", "on" — é um único token. Uma longa ou rara é dividida: "windows|ill". A pontuação vive como seu próprio token. Um espaço geralmente se "cola" à palavra que o segue.

Agora a mesma ideia em russo:

Кот спит на подоконнике.
→ Кот| спит| на| подо|конник|е|.
7 tokens — com metade dos caracteres

Quase a mesma contagem de tokens para visivelmente menos texto. Essa é a lacuna de densidade: o inglês é "empacotado" de forma mais eficiente, porque os modelos foram treinados principalmente nele e o vocabulário de tokens foi ajustado para ele.

A regra geral

Em inglês 1 token ≈ 4 caracteres; em muitas outras línguas ≈ 2 caracteres. Para orçar ou calcular se um documento caberá — dobre sua estimativa fora do inglês.

Isso não é apenas sobre dinheiro. A contagem de tokens decide se seu texto cabe na janela do modelo e a rapidez com que a resposta chega.

Tokens são contados duas vezes: na entrada e na saída

Uma conversa com um modelo são duas porções de tokens, cobradas separadamente.

  • Entrada (Input) — tudo o que você envia: a pergunta, texto colado, um arquivo, uma imagem, o histórico da conversa.
  • Saída (Output) — tudo o que o modelo escreve de volta.

A diferença não é terminologia, mas dinheiro: a saída custa várias vezes mais. Com o Gemini 2.5 Flash-Lite em 30 de julho de 2026, a entrada custa $0.10 por milhão de tokens e a saída $0.40. Quatro vezes mais.

Vamos contar. Uma pergunta de 100 palavras são cerca de 300 tokens de entrada — $0.00003. Uma resposta de 500 palavras são cerca de 1.500 tokens de saída — $0.0006. A resposta custa vinte vezes mais que a pergunta, mesmo que você tenha escrito a sua e o modelo tenha produzido a dele em segundos.

Daí a regra que mais economiza: encurte a resposta, não a pergunta. Uma linha dizendo "responda em um parágrafo" reduz mais a conta do que cortar sua pergunta pela metade. E "explique em detalhes, com todos os exemplos" é a frase mais cara que você pode escrever para um modelo.

Por que uma conversa longa fica mais cara a cada mensagem

O modelo não se lembra das interações anteriores. Para que ele siga o "fio da meada", toda a troca é enviada novamente — a cada vez, do zero. Sua décima mensagem arrasta as nove anteriores junto, e todas elas contam como entrada novamente.

Mensagem 1: 300 tokens de entrada.
Mensagem 5: 300 seus + 1.800 do histórico = 2.100.
Mensagem 10: 300 seus + 4.500 do histórico = 4.800.

Você continua escrevendo respostas igualmente curtas enquanto a entrada cresce sozinha. É por isso que um "fio" longo e tudo-em-um custa mais do que um novo chat com a mesma pergunta — e por que o modelo eventualmente começa a perder o início da conversa: o texto antigo não cabe mais.

A janela de contexto: onde tudo se acumula

Tudo o que o modelo tem disponível no momento está em uma "mesa" — essa é a janela de contexto. Nela, ao mesmo tempo: a instrução do sistema, todo o histórico da conversa, quaisquer arquivos enviados e espaço para a resposta que está sendo escrita.

O tamanho dessa "mesa" é medido em tokens. Em meados de 2026, os principais modelos estão em torno de um milhão: é o que o Claude Sonnet 4.6 (em beta), Gemini e GPT-5.4 anunciam. Alguns anos antes, o padrão era de 128 mil — oito vezes menos.

Um milhão de tokens são aproximadamente 2.500 páginas de texto em inglês, ou cerca de 1.250 páginas em uma língua mais densa. E isso é para tudo junto: histórico, arquivos e a resposta.

Um aviso honesto que você não encontrará no marketing: a janela anunciada e a janela de trabalho são coisas diferentes. O modelo aceita formalmente um milhão de tokens, mas a qualidade cai visivelmente antes — no meio de um texto enorme, ele fica confuso e encontra as coisas com menos confiabilidade. Quanto mais perto do limite, menos você deve confiar na resposta.

O que fazer com tudo isso

  • Limite explicitamente o comprimento da resposta. "Três frases", "uma lista de cinco" — economia direta.
  • Nova tarefa, novo chat. Mais barato e mais preciso: o contexto "antigo" para de interferir.
  • Não envie um arquivo inteiro quando precisar de uma seção. Recorte a parte que importa — a resposta fica melhor, não apenas mais barata.
  • Experimente prompts técnicos longos em inglês. A economia de tokens vem como um bônus ao fato de que os modelos seguem um "briefing" em inglês com mais precisão.

Onde ver suas próprias contagens de tokens

Se você acessa o modelo via API, a resposta contém um bloco usageMetadata: o próprio modelo informa quantos tokens entraram e quantos saíram, detalhados por modalidade. Essa é a maneira mais honesta de verificar qualquer cálculo — incluindo os nossos.

🧠Go deeper — in the courseRedes neurais para iniciantes

FAQ

O que é um token em uma rede neural, em linguagem simples?

Um token é um pedaço de texto com o qual o modelo trabalha — não é uma letra nem uma palavra. Uma palavra curta comum geralmente leva um token, uma longa ou rara é dividida em várias, e a pontuação ganha seu próprio token. A frase «The cat sleeps on the windowsill» se torna 8 tokens.

Quantos caracteres tem um token?

Aproximadamente quatro caracteres por token em inglês, e perto de dois em muitas outras línguas. A mesma ideia, portanto, leva de uma vez e meia a duas vezes mais tokens fora do inglês, e custa proporcionalmente mais.

Por que uma IA custa mais em outras línguas que não o inglês?

Os modelos foram treinados principalmente em textos em inglês, e o vocabulário de tokens foi ajustado para o inglês. Outras línguas são divididas em "pedaços" menores, então a mesma ideia leva cerca de duas vezes mais tokens. A cobrança é por token, daí a diferença de preço.

Qual a diferença entre tokens de entrada e saída?

Entrada é tudo o que você envia ao modelo: sua pergunta, arquivos, o histórico da conversa. Saída é o que ele escreve de volta. Eles são cobrados separadamente e a saída custa mais: com o Gemini 2.5 Flash-Lite, é $0.40 contra $0.10 por milhão em 30 de julho de 2026.

Por que uma conversa longa com a IA fica mais cara?

O modelo não se lembra das interações anteriores — toda a troca é reenviada a cada mensagem. Sua décima mensagem arrasta as nove anteriores junto, e elas contam como tokens de entrada novamente. Você escreve tão brevemente quanto antes, mas a entrada cresce sozinha.

O que é uma janela de contexto e qual o tamanho dela agora?

É tudo o que o modelo tem disponível no momento: a instrução do sistema, o histórico da conversa, arquivos enviados e espaço para a resposta. É medida em tokens. Em meados de 2026, os principais modelos estão em torno de um milhão — aproximadamente 2.500 páginas de texto em inglês. Alguns anos antes, o padrão era de 128 mil.

Uma janela de contexto de um milhão de tokens funciona realmente como um milhão?

Não. A janela anunciada e a de trabalho são diferentes. O modelo aceita formalmente um milhão de tokens, mas a qualidade cai visivelmente antes: no meio de um texto enorme, ele fica confuso e recupera informações com menos confiabilidade. Quanto mais perto do limite, mais cuidado você deve ter com a resposta.

Como posso reduzir o uso de tokens?

Limite explicitamente o comprimento da resposta — tokens de saída custam quatro vezes mais que os de entrada. Comece um novo chat para uma nova tarefa, pois o histórico é reenviado a cada vez. Não envie um arquivo inteiro quando uma seção for suficiente. Escreva prompts técnicos longos em inglês.