Neurocourse
Tabela de preços de nove operações de IA: um pedido de texto por $0,0003, leitura de foto por $0,001, imagem gerada por $0,04 e oito segundos de vídeo Veo por $3,20

Quanto custa um pedido de IA: medimos nove operações

9 min read

A versão resumida: em 30 de julho de 2026, executamos nove tipos de solicitações no Google Vertex AI e registramos as contagens de tokens diretamente das respostas da API. A principal descoberta: ler é barato para uma IA, criar é caro, e a diferença chega a mil vezes. Assistir a um vídeo do YouTube de dez minutos custa dois centavos. Gerar oito segundos de vídeo custa três dólares e vinte centavos. Mesma tecnologia, mesma conta, mas operações de natureza completamente diferente — e você não pode planejar um orçamento sem entender essa diferença.

Como medimos

Não de calculadoras em páginas de marketing nem de promessas em blogs de fornecedores. Cada solicitação foi para o Vertex AI na conta de serviço do nosso projeto, e de cada resposta pegamos o bloco usageMetadata — onde o próprio modelo informa quantos tokens seu input custou e quantos sua resposta custou.

Em seguida, multiplicamos pelos preços publicados pelo Google em 30 de julho de 2026 para a família Gemini 2.5 Flash-Lite: $0,10 por milhão de tokens de entrada (texto, imagens, vídeo), $0,30 por milhão de tokens de entrada de áudio e $0,40 por milhão de tokens de saída. Os preços de geração de vídeo vêm da lista do Veo 3.1: $0,40 por segundo no modo padrão.

O método importa porque permite que você o repita: os mesmos números estão na resposta de qualquer solicitação que você fizer, se você olhar em usageMetadata.

A tabela: o que custa o quê

OperaçãoO que aconteceCusto por execução
Uma pergunta de texto~300 tokens de entrada, ~500 de saída$0,0003
Ler uma fotoimagem mais uma resposta curta$0,001
Transcrever 30s de falaáudio custa três vezes o texto$0,0008
Ler um parágrafo em voz altasíntese de fala$0,0006
Assistir a um vídeo de 3 minutos51k tokens$0,006
Assistir a um vídeo de 10 minutos171k tokens$0,02
Gerar uma imagem1.290 tokens de saída$0,04
8s de vídeo, modo rápidocobrado por segundo$0,64
8s de vídeo, modo padrãocobrado por segundo$3,20

A descoberta: assistir é mais barato que criar

Compare duas linhas. Analisar um vídeo de dez minutos de outra pessoa: dois centavos. Gerar oito segundos do seu próprio: três dólares e vinte centavos. Isso é 160 vezes mais por setenta e cinco vezes menos segundos.

A razão é como a cobrança funciona. Tudo o que você envia ao modelo são tokens de entrada — a coisa mais barata na lista de preços. Tudo o que ele produz é saída, e a saída custa várias vezes mais. Com o Flash-Lite, a entrada é $0,10 por milhão e a saída é $0,40 — quatro vezes mais. A geração de imagens e vídeos é cobrada separadamente novamente, em taxas completamente diferentes.

Daí a regra que economiza mais dinheiro: encurte a resposta, não a pergunta. Uma linha dizendo "responda em um parágrafo" reduz sua conta mais do que reduzir sua pergunta pela metade. A frase mais cara que você pode escrever para um modelo é "explique em detalhes, com todos os exemplos".

Vídeo, segundo a segundo

Medimos isso separadamente, cortando um clipe em diferentes durações. O modelo conta o vídeo como 258 tokens por segundo de filmagem e 25 tokens por segundo de áudio. A relação é estritamente linear — cinco segundos resultaram em 1.290 tokens, dez segundos resultaram em exatamente 2.580.

DuraçãoTokensCusto para analisar
5 segundos1.415$0,0002
1 minuto17.000$0,002
5 minutos85.000$0,010
10 minutos171.000$0,020

O que isso significa na prática: analisar vídeo não é um luxo. Extrair o conteúdo de uma palestra de uma hora custa cerca de doze centavos. Seu próprio tempo para formular a tarefa custará mais.

Por que você ainda precisa fazer as contas

Uma única solicitação custa uma fração de centavo, o que cria a impressão de que não há nada a ser contado. Essa impressão está errada por duas razões.

Primeiro: uma conversa fica mais cara a cada mensagem. O modelo não se lembra das interações anteriores — para que ele siga o contexto, toda a troca é enviada novamente a cada solicitação. Sua décima mensagem arrasta as nove anteriores, e todas elas contam como entrada novamente. Você continua escrevendo respostas igualmente curtas enquanto a conta aumenta sozinha.

Segundo: algumas línguas custam aproximadamente o dobro do inglês. O modelo não conta letras nem palavras, mas tokens — pedaços de texto. O inglês se divide em pedaços maiores: um token é aproximadamente quatro caracteres, enquanto em muitas outras línguas está mais próximo de dois. O mesmo pensamento custa uma vez e meia a duas vezes mais.

O que fazer a respeito

  • Limite explicitamente o tamanho da resposta. "Três frases", "um parágrafo", "uma lista de cinco" — isso é economia direta, não preciosismo estilístico.
  • Comece um novo chat para uma nova tarefa. Uma conversa longa e tudo-em-um custa mais do que um chat novo com a mesma pergunta — e funciona melhor, porque o contexto obsoleto para de atrapalhar.
  • Não gere o que você pode encontrar. Ler um clipe ou documento existente é quase sempre mais barato do que criar o seu próprio.
  • Para prompts técnicos longos, tente o inglês. Não é apenas uma questão de preço: os modelos aprenderam principalmente com textos em inglês e seguem um briefing em inglês com mais precisão.

As ressalvas, sem as quais os números mentem

Medimos um modelo — Gemini 2.5 Flash-Lite — em uma nuvem. Modelos mais poderosos custam várias vezes mais; concorrentes têm suas próprias listas de preços. O que se mantém em todo lugar é a ordem de magnitude e, mais importante, a proporção entre as operações: entrada é mais barata que saída, ler é mais barato que criar.

Segundo: as tarifas mudam. Nossos números são de 30 de julho de 2026. Verifique o preço na página de preços do próprio fornecedor, e não em artigos — incluindo este.

🧠Go deeper — in the courseRedes neurais para iniciantes →

FAQ

Quanto custa um pedido de ChatGPT ou Gemini para um usuário comum?

Se você usa uma interface de chat por assinatura, nada além da assinatura — os limites são contados em pedidos, não em dinheiro. Os valores neste artigo se aplicam ao acesso via API, onde uma IA é integrada ao seu próprio software e você paga por token: $0,0003 por uma pergunta de texto, $0,001 para ler uma foto, $0,04 por uma imagem gerada.

Por que gerar uma imagem custa mais que ler dez fotos?

Porque são operações de tipos diferentes. Ler uma imagem significa enviá-la como entrada, e tokens de entrada são a coisa mais barata da lista. Criar uma imagem significa produzir saída, que é cobrada separadamente e muito mais cara. Em nossas medições, uma imagem gerada custa $0,04, enquanto ler uma foto custa $0,001 — quarenta vezes menos.

Quanto custa para uma IA analisar um vídeo do YouTube?

Medido em 30 de julho de 2026 com Gemini 2.5 Flash-Lite: 258 tokens por segundo de filmagem mais 25 tokens por segundo de áudio. Um clipe de dez minutos chega a cerca de 171.000 tokens, aproximadamente $0,02. Uma hora de vídeo custa cerca de doze centavos.

É verdade que a geração de vídeo custa dólares por segundo?

Sim. O Veo 3.1 é cobrado por segundo: $0,40 por segundo no modo padrão e a partir de $0,05 no nível lite. Um clipe de oito segundos custa $3,20 no modo padrão — mais do que analisar cento e cinquenta horas do vídeo de outra pessoa.

Como cortar custos de IA sem perder qualidade?

Três hábitos fazem a maior parte do trabalho. Primeiro, limite explicitamente o tamanho da resposta, pois tokens de saída custam quatro vezes mais que os de entrada. Segundo, comece um novo chat para uma nova tarefa — todo o histórico é reenviado a cada mensagem. Terceiro, não gere o que você pode encontrar e ler.

Por que o texto em algumas línguas custa mais que em inglês?

O modelo não conta letras nem palavras, mas tokens — pedaços de texto. O inglês se divide em blocos maiores: cerca de quatro caracteres por token, contra aproximadamente dois em muitas outras línguas. A mesma ideia demanda de uma vez e meia a duas vezes mais tokens, e custa proporcionalmente mais.

Onde posso ver quantos tokens minha requisição usou?

A resposta da API contém um bloco `usageMetadata` onde o modelo informa as contagens de tokens de entrada e saída, detalhadas por modalidade: texto, imagem, vídeo, áudio. Todos os dados neste artigo vieram de lá, e você pode repetir a medição em suas próprias requisições.