Le di a Claude un acertijo tonto de puntos. Y lo resolvió.

. .. . ... . .... . .... . ... .

El modelo respondió que el final faltante era:

.. .

En mi cabeza, algo no cuadraba. Los LLMs solo predicen el siguiente token. No ejecutan algoritmos. No razonan. Entonces, ¿cómo demonios lo resolvió?

Esa pregunta me llevó por un camino fascinante. Porque si verificas la respuesta, es correcta. Los puntos individuales son separadores; los grupos reales ascienden 2 3 4 y luego se reflejan 4 3 2. Leyendo las cantidades de principio a fin, obtenemos un palíndromo limpio:

1 2 1 3 1 4 1 4 1 3 1 2 1

Y aquí está lo interesante: este es un acertijo que el modelo probablemente nunca había visto antes.

“Si todo lo que hace un LLM es adivinar la siguiente palabra basándose en vectores y datos de entrenamiento, un acertijo difícil debería dejarlo paralizado. No hay una estadística de ‘siguiente palabra’ en la que apoyarse.”

O ese modelo mental está equivocado, o está ocurriendo algo más interesante. Spoiler: es la segunda opción.

”Predecir el siguiente token” es el objetivo, no el método

Sí, estos modelos se entrenan para predecir el siguiente token. Esa parte de la explicación popular es cierta. Pero lo que la gente omite es que ese es el objetivo con el que se evaluó, no una descripción de lo que aprendió a hacer.

Imagina un estudiante que solo recibe calificaciones por resolver exámenes. Técnicamente, todo lo que “hace” es responder preguntas de examen. Pero para volverse bueno en eso —a través de miles de preguntas variadas— no puede simplemente memorizar respuestas. Tiene que aprender aritmética, lógica, cómo leer un problema. El examen es la presión. La comprensión es lo que crece bajo la presión.

Mismo caso. Para predecir el siguiente token correctamente a través de billones de tokens —texto que incluye matemáticas, código, argumentos, historias y acertijos— memorizar “la palabra X tiende a seguir a la palabra Y” es inútil. El espacio de entradas posibles es efectivamente infinito.

La única manera de reducir el error de predicción a esa escala es desarrollar maquinaria interna que generalice: contar, comparar, reconocer simetría, continuar un patrón.

Esas habilidades emergieron porque eran útiles para la tarea de predicción. Nadie programó manualmente una función “detectar palíndromo”. Es una capacidad que surgió de la optimización implacable, de la misma manera que la comprensión real de un estudiante surge de la evaluación constante.

La analogía que funciona para desarrolladores: compresión

Imagina que tienes que comprimir cada libro jamás escrito en la representación más pequeña posible. No llegarías lejos almacenando texto crudo. Te verías forzado a descubrir las regularidades subyacentes: gramática, estructuras narrativas recurrentes, aritmética, las reglas de la química, cómo se estructura el código.

No porque alguien te las enseñara, sino porque capturar esos conceptos es la forma más eficiente de representar los datos.

Entrenar un LLM para predecir texto es el mismo proceso de compresión. Una buena predicción requiere modelos internos compactos de los patrones del mundo, y el modelo los construye.

Esta es la actualización más importante al modelo mental popular: la predicción del siguiente token es la señal de entrenamiento, y la competencia general es la estrategia que el modelo encontró para satisfacerla.

Una revelación: el acertijo no es realmente sobre puntos

Antes de llegar al mecanismo, algo que reformuló mi comprensión. El modelo nunca “ve” puntos. Ve tokens. Y la división exacta no importa, porque para el modelo mi acertijo es estructuralmente idéntico a:

A AA A AAA A AAAA A AAAA A AAA A

o

1 2 1 3 1 4 1 4 1 3 1 ...

Los puntos son solo el disfraz. Lo que el modelo realmente procesa es la forma abstracta de la secuencia: separadores intercalados con un conteo ascendente y luego descendente.

Eso es una gran pista sobre por qué generaliza: no está haciendo coincidencia de patrones sobre “puntos”, está operando sobre una estructura independiente de los símbolos que la transportan.

La imagen de “cada palabra se relaciona con la palabra anterior, fijo desde el entrenamiento” ignora el mecanismo que hace el trabajo pesado. Se llama ATENCIÓN, y es el núcleo de la arquitectura transformer sobre la que se construyen todos los LLMs modernos.

Cuando el modelo procesa tu entrada, cada posición puede “mirar” a cada otra posición y calcular cómo se relacionan sobre la marcha, para esta entrada específica. No es una búsqueda congelada horneada en el entrenamiento. Es un cálculo fresco cada vez que presionas Enter.

Con el acertijo de puntos, nada extrajo una “respuesta de acertijo de puntos” almacenada. En cambio, aproximadamente:

  • Los puntos individuales repetidos se reconocieron como un elemento separador
  • Los grupos se compararon entre sí
  • Los conteos ascendentes y descendentes (2, 3, 4, 4, 3…) se representaron como una estructura que “quiere” seguir descendiendo

Y esos vectores de tokens no son solo “el significado de este símbolo”. Llevan características abstractas que pueden manipularse casi geométricamente. “Reflejar esta secuencia” se vuelve una operación factible cuando tus datos viven como vectores en el espacio correcto.

También hay una dimensión de profundidad que vale la pena mencionar. La atención no es un pase único; la representación se refina a través de docenas de capas, cada una agregando un poco más de abstracción:

  • Capas tempranas: “estos símbolos se repiten”
  • Capas intermedias: “cada grupo más grande está separado por un punto individual”
  • Capas tardías: “todo esto es simétrico, probablemente estamos completando un espejo”

Ninguna capa contiene una oración en español. Pero el vector interno progresa codificando propiedades de alto nivel hasta que “completar el palíndromo” es la continuación obvia en ese espacio aprendido.

Por qué funciona en un acertijo que nunca ha visto

Esta es la respuesta real a “¿cómo resolvió mi acertijo?”.

No memorizó mi secuencia exacta de puntos. Aprendió operaciones generales: contar, comparar, detectar simetría, continuar un patrón. Y esas operaciones se combinan para manejar entradas nuevas.

Dale puntos, dale números, dale letras: la misma maquinaria de “encuentra la estructura y extiéndela” aplica.

Hay investigación real sobre esto, parte de equipos de interpretabilidad como el de Anthropic. Han encontrado circuitos internos específicos —un ejemplo famoso son las induction heads— que hacen continuación de patrones. El mecanismo es esencialmente: “antes en esta entrada, A fue seguido por B; aquí está A otra vez, así que B probablemente sigue”.

Eso es un componente literal e identificable dentro de la red haciendo coincidencia y extensión de patrones. Es exactamente el tipo de cosa que permite a un modelo continuar un patrón novedoso en lugar de recordar uno almacenado.

Cuando lo ves así, el acertijo de puntos deja de ser misterioso. Es un patrón. El modelo tiene maquinaria para encontrar y extender patrones. Lo encontró y lo extendió.

La lección práctica para desarrolladores

Si construyes con estos modelos, la lección práctica es esta: no estás trabajando con un autocompletado elegante que regurgita datos de entrenamiento. Estás trabajando con un sistema que aprendió operaciones transferibles bajo la presión de predecir el siguiente token, y las aplica a entradas que nunca ha visto.

Esa reformulación cambia cómo haces prompting, cómo depuras salidas extrañas y cómo razonas sobre dónde será confiable versus dónde fallará estrepitosamente.

“Es solo predecir la siguiente palabra” es el tipo de afirmación verdadera pero inútil que te llevará a intuiciones equivocadas.

Un acertijo tonto de puntos me hizo investigar todo esto. Y cambió mi forma de entender la inteligencia artificial que usamos todos los días.


¿Te interesa el razonamiento de IA y cómo aprovecharlo en tus proyectos? En DojoFullStack exploramos estas tecnologías a fondo para crear aplicaciones prácticas. Síguenos para más contenido sobre IA, desarrollo y automatización.