LLM y tokens: cómo una máquina escribe texto
LLM (ChatGPT, Claude, Gemini) predicen el siguiente token. Descubre cómo artículos y código surgen, qué son tokens y ventanas de contexto.
Es hora de echar un vistazo a los protagonistas de esta era: los grandes modelos de lenguaje.
LLM: qué significa cada letra
Large Language Model. «Language» (lenguaje): aprendió de texto (libros, artículos, webs, código; literalmente, una gran parte de internet). «Large» (grande): cientos de miles de millones de los pesos de la lección anterior. ChatGPT, Claude, Gemini y DeepSeek son todos LLM de diferentes empresas, construidos sobre el mismo principio (ese mismo transformador de 2017).
El truco principal: adivinar el siguiente fragmento
Todo lo que hace un LLM es predecir el siguiente token. Tú escribes: «La capital de Francia es ». El modelo revisa su vocabulario y puntúa las posibles continuaciones: «París» — 99 %, «Lyon» — 0,3 %, «plátano» — 0,0001 %. Elige uno probable, lo añade al texto y predice el siguiente fragmento. Una y otra vez, palabra por palabra, y así nace una respuesta completa.
Espera un momento. Si el modelo solo está «adivinando la siguiente palabra», ¿cómo escribe ensayos coherentes y código funcional?
La respuesta es elegante: para predecir bien la siguiente palabra en cualquier texto que la humanidad haya escrito, el modelo tuvo que aprender gramática, hechos, cadenas de razonamiento, estilos y la estructura del código. Predecir una palabra resultó ser una tarea que ocultaba una «comprensión» del lenguaje. Ese es el gran descubrimiento de la era de los LLM, y la gran fuente de argumentos sobre si un modelo realmente «entiende» algo.
Tokens: la moneda del mundo LLM
Los fragmentos con los que trabaja un modelo se llaman tokens. Un token no siempre es una palabra: una palabra corta es un token, una larga se divide en piezas, un signo de puntuación es un token por sí mismo. De media, 1 token ≈ 3-4 caracteres, pero esa regla solo se aplica al inglés. Es importante saber que en otros idiomas, especialmente los que no usan el alfabeto latino, los tokens son más «caros» (a menudo solo 1-2 caracteres cada uno).
Así que el mismo texto, con el mismo significado, consume notablemente más tokens fuera del inglés y alcanza los límites y la ventana de contexto antes. Conclusión práctica: si trabajas en otro idioma y cuentas el coste o el volumen, deja un margen.
Los tokens no son una abstracción, aparecen en la práctica:
- La ventana de contexto — cuántos tokens el modelo retiene en su «cabeza» a la vez: tu pregunta, sus respuestas, los archivos que subiste. Lo que no cabe, el modelo lo «olvida». Por eso las conversaciones largas pierden el principio.
- Precio — cuando conectas un modelo a tu propio software (eso se llama una API), pagas por token. Crear un bot o una automatización significa contar tokens.
- Límites del plan — los límites de «mensajes por hora» en los planes gratuitos también se derivan de la economía de los tokens.
¿Cuán «grande» es grande?
Hazte una idea de la escala. El conjunto de entrenamiento de un LLM insignia asciende a billones de tokens: una persona que leyera un libro al día necesitaría cientos de miles de años para leer tanto. Por eso el modelo «sabe» de física, recetas de cocina y la sintaxis de veinte lenguajes de programación: ha procesado estadísticamente la experiencia escrita de toda la humanidad. Y por eso lo peor de internet también está ahí: las empresas dedican un enorme esfuerzo a filtrar los datos y pulir el comportamiento (ese aprendizaje por refuerzo a partir de valoraciones humanas de la lección anterior).
Generación, no búsqueda
Una consecuencia clave: un LLM no busca la respuesta en una base de datos, la genera prediciendo una continuación probable. Por eso puede escribir un soneto sobre tu gato, que nunca existió en internet (¡creatividad!). Y, del mismo modo, por qué puede escribir con confianza algo falso, si la falsedad «suena probable» (de eso trata toda la próxima lección).
Bajo el capó (opcional): dos datos interesantes
Lo que sigue es una profundización opcional. No cambiará nada en la práctica: salta a «Haz esto ahora» si quieres. Pero los datos son interesantes: dos palabras nuevas, dos ideas.
Emergencia. La propiedad más misteriosa de los modelos grandes: a medida que crecen, aparecen habilidades que nadie les enseñó. El modelo fue entrenado para predecir texto, y de repente puede traducir, resolver puzles de lógica, escribir código, explicar chistes. Estas habilidades «de la nada» se llaman emergentes. Dónde se detiene el efecto, los científicos aún discuten, y esa es la gran pregunta abierta de los próximos años: los tres ingredientes (datos, potencia, arquitectura) siguen creciendo.
Temperatura. Hazle la misma pregunta a un modelo dos veces y las respuestas serán diferentes. Eso no es un fallo: al elegir el siguiente token, el modelo no siempre toma el más probable; se le permite «asumir un pequeño riesgo» (la configuración se llama literalmente temperatura). Una pizca de aleatoriedad mantiene el texto vivo en lugar de robóticamente idéntico. Conclusión práctica: si no te gusta una respuesta, a veces basta con regenerarla. Y «La capital de Francia es París» se mantiene inamovible: una probabilidad del 99 % supera cualquier aleatoriedad.
Haz esto ahora
Ejecuta este prompt aquí mismo, luego pulsa Ejecutar una segunda vez sin cambiar una palabra:
Continue this sentence five different ways: The morning started with…
Verás con tus propios ojos la naturaleza probabilística de la generación: un modelo, una solicitud idéntica, y diferentes continuaciones probables.
Short questions on the lesson — with an explanation for every answer.
Skip this lesson →