Neurocourse
La frase «El gato duerme en el alféizar de la ventana» dividida en ocho tokens por barras verticales, junto a su equivalente en ruso, dividido en siete

Qué es un token en lenguaje sencillo y por qué algunos idiomas cuestan el doble

8 min read

En resumen: un token es un fragmento de texto con el que opera una red neuronal. Ni una letra ni una palabra: una palabra corta común suele ocupar un token; una larga o rara se divide en varios. En inglés, un token equivale a unas cuatro letras; en muchos otros idiomas, a unas dos. La consecuencia práctica: la misma idea fuera del inglés requiere el doble de tokens, por lo que cuesta más y es más lenta. A continuación: cómo comprobarlo tú mismo, en qué se diferencian los tokens de entrada y salida, y por qué una conversación larga se encarece por sí sola.

Más fácil de ver con un ejemplo

Toma una frase y córtala como lo haría un modelo. La barra vertical marca el límite de un token.

The cat sleeps on the windowsill.
→ The| cat| sleeps| on| the| windows|ill|.
8 tokens

La regla es clara. Una palabra corta común — «the», «cat», «on» — es un solo token. Una larga o rara se divide: «windows|ill». La puntuación es un token aparte. Un espacio suele ir unido a la palabra que le sigue.

Ahora la misma idea en ruso:

Кот спит на подоконнике.
→ Кот| спит| на| подо|конник|е|.
7 tokens — con la mitad de caracteres

Casi el mismo número de tokens para un texto notablemente más corto. Esa es la brecha de densidad: el inglés se empaqueta de forma más eficiente porque los modelos se entrenaron principalmente con él y el vocabulario de tokens se ajustó para este idioma.

La regla general

En inglés, 1 token ≈ 4 caracteres; en muchos otros idiomas, ≈ 2 caracteres. Para presupuestar o calcular si un documento encajará, duplica tu estimación fuera del inglés.

Esto no es solo cuestión de dinero. El recuento de tokens decide si tu texto cabe en la ventana del modelo y la rapidez con la que llega la respuesta.

Los tokens se cuentan dos veces: entrada y salida

Una conversación con un modelo consta de dos porciones de tokens, facturadas por separado.

  • Entrada — todo lo que envías: la pregunta, texto pegado, un archivo, una imagen, el historial de la conversación.
  • Salida — todo lo que el modelo te devuelve.

La diferencia no es terminológica, sino económica: la salida cuesta varias veces más. Con Gemini 2.5 Flash-Lite a 30 de julio de 2026, la entrada cuesta 0,10 $ por millón de tokens y la salida 0,40 $. Cuatro veces más.

Hagamos cuentas. Una pregunta de 100 palabras son unos 300 tokens de entrada — 0,00003 $. Una respuesta de 500 palabras son unos 1.500 tokens de salida — 0,0006 $. La respuesta cuesta veinte veces más que la pregunta, aunque tú escribiste la tuya y el modelo produjo la suya en segundos.

De ahí la regla que más ahorra: acorta la respuesta, no la pregunta. Una frase como «responde en un párrafo» reduce la factura más que si reduces tu pregunta a la mitad. Y «explica en detalle, con todos los ejemplos» es la frase más cara que puedes escribirle a un modelo.

Por qué una conversación larga se encarece con cada mensaje

El modelo no recuerda las interacciones anteriores. Para que siga el hilo, todo el intercambio se envía de nuevo, cada vez, desde cero. Tu décimo mensaje arrastra los nueve anteriores, y todos ellos vuelven a contar como entrada.

Mensaje 1: 300 tokens de entrada.
Mensaje 5: 300 tuyos + 1.800 de historial = 2.100.
Mensaje 10: 300 tuyos + 4.500 de historial = 4.800.

Tú sigues escribiendo respuestas igual de cortas mientras la entrada crece por sí misma. Por eso, un hilo largo con todo junto cuesta más que un chat nuevo con la misma pregunta, y por qué el modelo acaba perdiendo el principio de la conversación: el texto antiguo ya no cabe.

La ventana de contexto: donde se acumula todo

Todo lo que el modelo tiene disponible ahora mismo está en una «mesa»: esa es la ventana de contexto. En ella, al mismo tiempo: la instrucción del sistema, todo el historial de la conversación, cualquier archivo subido y espacio para la respuesta que está escribiendo.

El tamaño de esa «mesa» se mide en tokens. A mediados de 2026, los modelos principales rondan el millón: es lo que anuncian Claude Sonnet 4.6 (en beta), Gemini y GPT-5.4. Un par de años antes, el estándar era de 128 mil — ocho veces menos.

Un millón de tokens equivale aproximadamente a 2.500 páginas de texto en inglés, o a unas 1.250 páginas en un idioma más denso. Y eso es para todo junto: historial, archivos y la respuesta.

Una advertencia honesta que no encontrarás en el marketing: la ventana anunciada y la ventana real son cosas diferentes. El modelo acepta formalmente un millón de tokens, pero la calidad decae notablemente antes: en medio de un texto enorme se confunde y encuentra las cosas con menos fiabilidad. Cuanto más te acerques al límite, menos deberías fiarte de la respuesta.

Qué hacer con todo esto

  • Limita explícitamente la longitud de la respuesta. «Tres frases», «una lista de cinco» — ahorro directo.
  • Tarea nueva, chat nuevo. Más barato y preciso: el contexto obsoleto deja de interferir.
  • No subas un archivo entero si solo necesitas una sección. Recorta la parte importante: la respuesta será mejor, no solo más barata.
  • Prueba prompts técnicos largos en inglés. El ahorro de tokens es un extra al hecho de que los modelos siguen las instrucciones en inglés con más precisión.

Dónde ver tu propio recuento de tokens

Si accedes al modelo a través de una API, la respuesta incluye un bloque usageMetadata: el propio modelo informa de cuántos tokens entraron y cuántos salieron, desglosados por modalidad. Esa es la forma más honesta de comprobar cualquier cálculo, incluido el nuestro.

🧠Go deeper — in the courseRedes neuronales para principiantes

FAQ

¿Qué es un token en una red neuronal, en lenguaje sencillo?

Un token es un fragmento de texto para el modelo, ni letra ni palabra. Las palabras cortas son un token; las largas se dividen. La puntuación también. Así, una frase se convierte en varios tokens.

¿Cuántos caracteres tiene un token?

En inglés, un token son unos 4 caracteres; en otros idiomas, cerca de 2. Por eso, la misma idea requiere 1,5-2 veces más tokens fuera del inglés, y cuesta más.

¿Por qué una IA cuesta más en idiomas que no son inglés?

Los modelos se entrenaron con inglés, optimizando su vocabulario de tokens. Otros idiomas se dividen en fragmentos más pequeños, por lo que la misma idea requiere el doble de tokens. La facturación es por token, de ahí el coste extra.

¿Cuál es la diferencia entre tokens de entrada y salida?

La entrada es todo lo que envías al modelo: tu pregunta, archivos, el historial de la conversación. La salida es lo que te devuelve. Se facturan por separado y la salida cuesta más: con Gemini 2.5 Flash-Lite son 0,40 $ frente a 0,10 $ por millón a 30 de julio de 2026.

¿Por qué una conversación larga con IA se encarece?

El modelo no recuerda interacciones anteriores: todo el intercambio se reenvía con cada mensaje. Tu décimo mensaje arrastra los nueve anteriores, que vuelven a contar como tokens de entrada. Tú escribes igual de breve, pero la entrada crece sola.

¿Qué es una ventana de contexto y qué tamaño tiene ahora?

Es todo lo que el modelo tiene disponible ahora: la instrucción del sistema, el historial de conversación, los archivos subidos y espacio para la respuesta. Se mide en tokens. A mediados de 2026, los modelos top rondan el millón, unas 2.500 páginas en inglés. Hace un par de años, el estándar era de 128 mil.

¿Una ventana de contexto de un millón de tokens funciona realmente como un millón?

No. La ventana anunciada y la real son distintas. El modelo acepta un millón de tokens, pero la calidad decae antes: en textos enormes se confunde y recupera información con menos fiabilidad. Cuanto más cerca del límite, menos debes fiarte de la respuesta.

¿Cómo puedo reducir el uso de tokens?

Limita la longitud de la respuesta explícitamente (los tokens de salida cuestan cuatro veces más). Inicia un chat nuevo para cada tarea, ya que el historial se reenvía siempre. No subas un archivo entero si solo necesitas una sección. Prueba prompts técnicos largos en inglés.