Por qué los modelos siguen mejorando: qué cambia realmente entre versiones
Qué mejora realmente en los modelos más recientes — conocimiento, razonamiento, fiabilidad, capacidad — y por qué el «la IA no puede hacer esto» del año pasado ya está obsoleto.
En verano de 2023, los modelos tenían un problema recurrente en el que tropezaban: «cuántas letras «r» hay en la palabra «rábano»». Respondían con seguridad y de forma incorrecta. Si preguntabas cuánto es 17 × 24, obtenías un número bonito, pero equivocado. Si pedías que citaran un artículo, te daban el título plausible de un trabajo inexistente.
Hoy en día, un modelo normal resuelve esas mismas preguntas sin problemas. No porque alguien haya introducido las respuestas en una tabla, sino porque en tres años han cambiado varias generaciones. Analicemos qué cambia exactamente de una versión a otra: es la única forma de no basar tus planes en las limitaciones de ayer.
Qué mejora realmente
«El modelo se ha vuelto más inteligente» no dice nada. Las mejoras se producen en cuatro líneas distintas y no están relacionadas entre sí: un modelo puede calcular perfectamente y, aun así, seguir inventando enlaces.
- Conocimientos. Datos de entrenamiento más recientes y amplios. Aquí el progreso es el más aburrido: la cuestión es solo qué se incluyó en el conjunto de datos de entrenamiento.
- Razonamiento. Capacidad de mantener varios pasos seguidos sin perder el hilo. Aquí se produjo el mayor salto: se enseñó a los modelos a «pensar» primero para sí mismos y luego a responder. Antes la respuesta se soltaba de inmediato, como un alumno que empieza a hablar sin escuchar la pregunta hasta el final.
- Fiabilidad. Con qué frecuencia el modelo miente con seguridad. Ahora es notablemente menos frecuente, y lo principal es que a menudo reconoce que no sabe algo, en lugar de inventar algo plausible. Pero el problema no está resuelto: todavía se encuentran enlaces y detalles inventados, y sigue siendo necesario verificar.
- Capacidad y sentidos. La ventana de contexto ha crecido de 128 mil tokens a un millón, se han añadido imágenes, sonido, vídeo. Ya vimos la ventana de contexto en la lección anterior.
Por qué mejoran, en general
Hay tres palancas, y las tres siguen funcionando.
- Más cálculos para el entrenamiento. Cada nueva generación se entrena durante más tiempo y con más tarjetas gráficas. El camino más directo: los mismos principios, más recursos.
- Mejores datos, no solo más. Los primeros modelos se entrenaban con todo internet sin distinción. Ahora se limpia la selección, se elimina la basura y se añaden ejemplos de buenos razonamientos escritos específicamente. ¿Recuerdas la lección sobre los datos? Ahí está la respuesta de por qué esto es más importante que el volumen.
- Entrenamiento con evaluaciones humanas. Se muestran pares de respuestas a las personas, estas marcan la mejor y el modelo se ajusta. Así aprende no a «continuar el texto», sino a ser útil: a responder de forma pertinente, a reconocer lo que no sabe, a no ser grosera.
Cómo se ve esto en una tarea
Tomemos una tarea donde la diferencia es visible a simple vista:
Tenía 8 años cuando mi hermana tenía la mitad. Ahora tengo 30. ¿Cuántos años tiene mi hermana?
La trampa está en las palabras «la mitad». Quien responde por primera impresión, divide la edad actual por la mitad y dice 15. Así respondían los primeros modelos, y, sinceramente, así responde también la mitad de la gente.
El enfoque correcto es otro. Cuando yo tenía 8, mi hermana tenía 4; eso significa que es 4 años menor, y esa diferencia nunca cambia. Yo tengo 30, así que mi hermana tiene 26.
La diferencia entre 15 y 26 no es «un poco más preciso». Son respuestas diferentes: una incorrecta, otra correcta. Y se obtiene precisamente porque el modelo primero analiza la condición paso a paso, en lugar de tomar el primer número que le parece adecuado.
Qué significa esto para ti personalmente
Tres conclusiones que valen más que cualquier lista de versiones.
- Tu experiencia queda obsoleta más rápido de lo que parece. «Lo probé, la IA no sabe hacer esto» es una frase con fecha de caducidad. Si lo probaste hace un año, eso no dice nada sobre hoy.
- No te aferres a un solo modelo. El líder cambia cada pocos meses. Una habilidad útil no es «conocer ChatGPT», sino saber plantear la tarea para que cualquier herramienta la entienda.
- Todavía hay que verificar. Los modelos se han vuelto más fiables, pero no infalibles. Cuanto más importante sea la decisión, más estricta debe ser la verificación: esta regla no ha quedado obsoleta en ninguna generación.
Hazlo ahora: intenta desactivar el razonamiento
No construiremos una máquina del tiempo, pero puedes intentar prohibir al modelo lo que le han enseñado en los últimos tres años: pensar antes de responder. Ejecuta dos prompts seguidos y compara.
El primero es un intento de recuperar la forma de los modelos antiguos: respuesta inmediata, sin pasos.
Responde al instante, en una sola línea, solo el número final. Sin razonamientos, sin pasos intermedios, sin verificación: La suscripción cuesta 300 rublos al mes. A partir del cuarto mes, el precio subió un 10%; a partir del octavo, bajó un 20% del último precio. ¿Cuánto se ha pagado en total durante 9 meses?
El segundo es cómo responden ahora: la misma tarea, pero con un análisis detallado.
Resuelve paso a paso, mostrando cada paso y las sumas intermedias. Al final, verifica la respuesta sumándolo todo de nuevo: La suscripción cuesta 300 rublos al mes. A partir del cuarto mes, el precio subió un 10%; a partir del octavo, bajó un 20% del último precio. ¿Cuánto se ha pagado en total durante 9 meses?
La respuesta correcta es 2748 rublos: tres meses a 300, cuatro a 330, dos a 264.
Qué verás, probablemente
Ejecutamos estos prompts antes de escribir la lección, y el resultado fue más interesante de lo esperado.
- El modelo a menudo no obedece al primer prompt. Le pides una sola línea sin razonamientos, y aun así empieza a calcular en voz alta. El hábito de pensar antes de responder se le ha inculcado tan profundamente que el modelo ignora la prohibición directa.
- Cuando sí obedece, se equivoca. En esta tarea, la respuesta rápida se desvía: es fácil pasar por alto que el descuento se calcula sobre el precio ya aumentado, y no sobre los 300 iniciales.
- El segundo prompt no solo da la respuesta, sino también la cadena de razonamiento. Y esto es lo principal: el número se puede verificar. La respuesta rápida hay que aceptarla sin más.
Por cierto, sobre los problemas clásicos con trampa —«el bate y la pelota», «los nenúfares en el estanque»—. También los comprobamos: el modelo actual los resuelve correctamente incluso sin pasos, porque los ha visto miles de veces en el entrenamiento. Las trampas en las que la IA tropezaba hace tres años han dejado de funcionar; de eso trata precisamente toda la lección.
Conclusión práctica: «resuelve paso a paso» no es una petición educada, sino un interruptor. Activa el mecanismo por el que han cambiado varias generaciones de modelos y transforma la respuesta de «créeme» en «compruébame».
Short questions on the lesson — with an explanation for every answer.