Neurocourse
Tabla de precios de 9 operaciones de IA: una petición de texto por $0.0003, leer una foto por $0.001, una imagen generada por $0.04 y ocho segundos de vídeo Veo por $3.20.

¿Cuánto cuesta una petición de IA? Medimos 9 operaciones.

9 min read

En resumen: el 30 de julio de 2026, probamos nueve tipos de peticiones en Google Vertex AI y registramos los tokens directamente de las respuestas de la API. El hallazgo principal: leer es barato para una IA, crear es caro, y la diferencia es mil veces mayor. Ver un vídeo de YouTube de diez minutos cuesta dos céntimos. Generar ocho segundos de vídeo cuesta tres dólares con veinte. La misma tecnología, la misma factura, pero operaciones de naturaleza completamente distinta; y no puedes planificar un presupuesto sin entender esa diferencia.

«Cómo lo medimos»

No de calculadoras en páginas de marketing ni de promesas en blogs de proveedores. Cada petición fue a Vertex AI en la cuenta de servicio de nuestro proyecto, y de cada respuesta tomamos el bloque usageMetadata, donde el propio modelo informa de cuántos tokens costó tu entrada y cuántos su respuesta.

Luego multiplicamos por los precios publicados por Google a 30 de julio de 2026 para la familia Gemini 2.5 Flash-Lite: $0.10 por millón de tokens de entrada (texto, imágenes, vídeo), $0.30 por millón de tokens de entrada de audio y $0.40 por millón de tokens de salida. Los precios de generación de vídeo provienen de la lista de Veo 3.1: $0.40 por segundo en modo estándar.

El método importa porque te permite repetirlo: los mismos números aparecen en la respuesta a cualquier petición que hagas, si miras en usageMetadata.

«La tabla: qué cuesta qué»

OperaciónQué ocurreCoste por ejecución
Una pregunta de texto~300 tokens de entrada, ~500 de salida$0.0003
Leer una fotoimagen más una respuesta corta$0.001
Transcribir 30 s de vozel audio cuesta el triple que el texto$0.0008
Leer un párrafo en voz altasíntesis de voz$0.0006
Ver un vídeo de 3 minutos51k tokens$0.006
Ver un vídeo de 10 minutos171k tokens$0.02
Generar una imagen1.290 tokens de salida$0.04
8 s de vídeo, modo rápidose factura por segundo$0.64
8 s de vídeo, modo estándarse factura por segundo$3.20

«El hallazgo: ver es más barato que crear»

Compara dos filas. Analizar un vídeo de diez minutos de otra persona: dos céntimos. Generar ocho segundos de tu propio vídeo: tres dólares con veinte. Eso es 160 veces más por setenta y cinco veces menos segundos.

La razón es cómo funciona la facturación. Todo lo que envías al modelo son tokens de entrada, lo más barato de la lista de precios. Todo lo que produce es salida, y la salida cuesta varias veces más. Con Flash-Lite, la entrada es $0.10 por millón y la salida es $0.40, cuatro veces más. La generación de imágenes y vídeo se factura de nuevo por separado, con tarifas completamente distintas.

De ahí la regla que más dinero ahorra: acorta la respuesta, no la pregunta. Una frase que diga «responde en un párrafo» reduce tu factura más que reducir tu pregunta a la mitad. La frase más cara que puedes escribir a un modelo es «explica en detalle, con todos los ejemplos».

«Vídeo, segundo a segundo»

Lo medimos por separado recortando un clip a diferentes longitudes. El modelo cuenta el vídeo como 258 tokens por segundo de metraje y 25 tokens por segundo de audio. La relación es estrictamente lineal: cinco segundos dieron 1.290 tokens, diez segundos dieron exactamente 2.580.

DuraciónTokensCoste de análisis
5 segundos1.415$0.0002
1 minuto17.000$0.002
5 minutos85.000$0.010
10 minutos171.000$0.020

Lo que esto significa en la práctica: analizar vídeo no es un lujo. Extraer la esencia de una conferencia de una hora cuesta unos doce céntimos. Tu propio tiempo en definir la tarea costará más.

«Por qué sigues teniendo que hacer números»

Una sola petición cuesta una fracción de céntimo, lo que crea la impresión de que no hay nada que contar. Esa impresión es errónea por dos razones.

Primero: una conversación se encarece con cada mensaje. El modelo no recuerda las interacciones anteriores; para que siga el contexto, todo el intercambio se envía de nuevo con cada petición. Tu décimo mensaje arrastra los nueve anteriores, y todos ellos cuentan como entrada de nuevo. Tú sigues escribiendo respuestas igual de cortas mientras la factura sube sola.

Segundo: algunos idiomas cuestan aproximadamente el doble que el inglés. El modelo no cuenta letras ni palabras, sino tokens, fragmentos de texto. El inglés se divide en fragmentos más grandes: un token son aproximadamente cuatro caracteres, mientras que en muchos otros idiomas se acerca más a dos. La misma idea cuesta entre una vez y media y dos veces más.

«Qué hacer al respecto»

  • Limita explícitamente la longitud de la respuesta. «Tres frases», «un párrafo», «una lista de cinco»: eso es un ahorro directo, no una manía estilística.
  • Inicia un nuevo chat para una nueva tarea. Un hilo largo que lo contenga todo cuesta más que un chat nuevo con la misma pregunta, y funciona mejor, porque el contexto obsoleto deja de estorbar.
  • No generes lo que puedas encontrar. Leer un clip o documento existente es casi siempre más barato que crear el tuyo propio.
  • Para prompts técnicos largos, prueba el inglés. No es solo cuestión de precio: los modelos aprendieron principalmente de textos en inglés y siguen una instrucción en inglés con más precisión.

«Las advertencias, sin las cuales los números mienten»

Medimos un modelo —Gemini 2.5 Flash-Lite— en una nube. Los modelos más potentes cuestan varias veces más; los competidores tienen sus propias listas de precios. Lo que se mantiene en todas partes es el orden de magnitud y, lo que es más importante, la relación entre operaciones: la entrada es más barata que la salida, leer es más barato que crear.

Segundo: las tarifas cambian. Nuestras cifras están fechadas a 30 de julio de 2026. Consulta el precio en la página de precios del propio proveedor en lugar de en artículos —incluido este—.

🧠Go deeper — in the courseRedes neuronales para principiantes

FAQ

¿Cuánto cuesta una sola petición de ChatGPT o Gemini a un usuario normal?

Si usas una interfaz de chat con una suscripción, nada más allá de la suscripción; los límites se cuentan en peticiones, no en dinero. Las cifras de este artículo se aplican al acceso a la API, donde una IA está conectada a tu propio software y pagas por token: $0.0003 por una pregunta de texto, $0.001 por leer una foto, $0.04 por una imagen generada.

¿Por qué generar una imagen cuesta más que leer diez fotos?

Porque son operaciones de distinto tipo. Leer una imagen significa enviarla como entrada, y los tokens de entrada son lo más barato de la lista. Crear una imagen significa producir una salida, que se factura por separado y es mucho más cara. En nuestras mediciones, una imagen generada cuesta $0.04, mientras que leer una foto cuesta $0.001, cuarenta veces menos.

¿Cuánto cuesta que una IA analice un vídeo de YouTube?

Medido el 30 de julio de 2026 con Gemini 2.5 Flash-Lite: 258 tokens por segundo de metraje más 25 tokens por segundo de audio. Un clip de diez minutos suma unos 171.000 tokens, aproximadamente $0.02. Una hora de vídeo cuesta unos doce céntimos.

¿Es cierto que la generación de vídeo cuesta dólares por segundo?

Sí. Veo 3.1 se factura por segundo: $0.40 por segundo en modo estándar y desde $0.05 en el nivel lite. Un clip de ocho segundos cuesta $3.20 en modo estándar, más que analizar ciento cincuenta horas de vídeo de otra persona.

¿Cómo reduzco los costes de IA sin perder calidad?

Tres hábitos hacen la mayor parte del trabajo. Primero, limita explícitamente la longitud de la respuesta, porque los tokens de salida cuestan cuatro veces más que los de entrada. Segundo, inicia un nuevo chat para una nueva tarea; todo el historial se reenvía con cada mensaje. Tercero, no generes lo que puedas encontrar y leer en su lugar.

¿Por qué el texto en algunos idiomas cuesta más que en inglés?

El modelo no cuenta ni letras ni palabras, sino tokens — fragmentos de texto. El inglés se divide en fragmentos más grandes: aproximadamente cuatro caracteres por token, frente a unos dos en muchos otros idiomas. La misma idea requiere entre una y media y dos veces más tokens, y cuesta proporcionalmente más.

¿Dónde puedo consultar cuántos tokens ha usado mi petición?

La respuesta de la API contiene un bloque usageMetadata donde el modelo informa del recuento de tokens de entrada y salida, desglosado por modalidad: texto, imagen, vídeo, audio. Cada cifra de este artículo proviene de ahí, y tú puedes repetir la medición con tus propias peticiones.