Ensayo

El fantasma en la mezcladora

Buscamos a alguien adentro de la máquina. Encontramos perillas. La discusión no se acabó ahí.

← Primera entrega: Las máquinas hablan pársel

EL FANTASMA EN LA MEZCLADORA

Buscamos a alguien adentro de la máquina. Encontramos perillas. La discusión no se acabó ahí.


Antes de empezar: sigo siendo el mismo

Sigo sin ser científico.

Sigo siendo DJ.

En el ensayo anterior intenté entender una inteligencia artificial sin empezar por GPUs, parámetros ni matrices. Seguí un hilo que iba de Pāṇini a Shannon, de la Torre de Babel a un perro con electrodos, y terminé proponiendo una idea que todavía me gusta:

Tal vez una inteligencia sea una máquina que encuentra relaciones, comprime regularidades y apuesta sobre lo que va a pasar después.

Después de escribirlo me quedó una incomodidad.

La frase suena bien. Demasiado bien.

En alguna parte del recorrido junté tres palabras —predecir, comprimir y entender— y las traté como si fueran nombres distintos de la misma operación. Hay una conexión matemática real entre las primeras dos. La tercera es la peligrosa.

Porque una cosa es que una máquina acierte lo que sigue. Otra es que encuentre una descripción corta de los datos. Y otra, quizá muy distinta, es que sepa de qué chingados estamos hablando.

Este texto es la respuesta al anterior. No intenta destruirlo. Intenta hacerle la pregunta que se saltó:

¿Qué tendría que ser verdad para que predecir muy bien fuera lo mismo que entender?

Para responderla ahora sí vamos a abrir la caja.

Vamos a encontrar silicio, memoria, funciones, probabilidades y una cantidad obscena de multiplicaciones. Pero quiero advertir algo desde el principio: descubrir de qué está hecha una máquina no resuelve automáticamente qué clase de máquina es.

Si abres un cerebro encuentras agua, grasa, electricidad y química. No encuentras una opinión, una deuda, un recuerdo de infancia o la sospecha de que alguien te está mintiendo. Eso no significa que esas cosas sean fantasmas. Significa que existen en otro nivel de descripción.

Con la IA pasa lo mismo.

Hay que abrir tres cajas, no una.

Cómo leer esto. Hay tres o cuatro párrafos técnicos de verdad. Los voy a marcar con [puedes brincarte esto] y te juro que no pierdes el hilo. Están ahí para quien quiera bajar hasta el fierro. El argumento se sostiene sin ellos.

Y hay dos experimentos, en las secciones 13 y 14, donde tú puedes comprobar uno tú mismo en treinta segundos. Ése es el corazón del ensayo. Si solo vas a leer dos secciones, lee esas.


PARTE I — LAS TRES CAJAS

1La frase rota

Volvamos al ejemplo que empezó todo:

cmo funciona esta madre we

La máquina responde algo como:

¿Cómo funciona esto?

En el primer ensayo dije que la caja no había recibido una instrucción completa, sino evidencia sobre una intención. Sigo pensando que ésa es una buena manera de describir lo que vemos desde afuera.

Pero desde afuera caben por lo menos dos explicaciones.

La primera:

La máquina reconstruyó lo que la persona quería comunicar.

La segunda:

La máquina encontró una continuación que suele funcionar después de secuencias parecidas.

Las dos explicaciones predicen la misma respuesta. Ahí está el problema.

Si dos teorías explican exactamente la misma conducta, ver la conducta una vez no basta para decidir cuál es correcta. Necesitamos una situación donde produzcan resultados distintos.

Supón que esta madre no se refiere a una computadora. Es el nombre privado que tú y tu hermana le dieron a una licuadora que hace un ruido espantoso. O es ironía. O es una frase copiada de un meme. O estás probando si la máquina reconoce un dialecto. O quieres una explicación técnica, pero con ese tono porque te da flojera escribir formal.

Las letras son las mismas. La intención no.

Un humano que comparte tu historia puede distinguirlas porque posee información que no está en el mensaje: quién eres, qué pasó ayer, cómo hablas cuando bromeas, qué objeto tienes enfrente y qué consecuencias tendrá equivocarse.

La pregunta no es si el modelo puede acertar. Muchas veces acierta.

La pregunta es:

¿Qué evidencia utilizó para acertar y qué tipo de error revelaría que nunca tuvo la intención, solo el patrón?

Guárdate esa pregunta. En la sección 14 vamos a encontrar exactamente ese error, documentado y con nombre y apellido.

Antes hay que separar las tres cajas.

2Hardware, algoritmo y significado

Imagina que le preguntas a tres personas cómo funciona Spotify.

La primera abre el teléfono y te habla de transistores, memoria, batería y ondas de radio.

La segunda te explica servidores, archivos de audio, compresión, recomendaciones y paquetes que viajan por internet.

La tercera te dice que Spotify encuentra una canción que espera que no saltes.

Ninguna está mintiendo. Están describiendo niveles distintos.

Con una IA podemos hacer la misma separación:

CajaPreguntaLo que encontramos
Física¿Con qué corre?silicio, electricidad, memoria, GPUs
Algorítmica¿Qué operaciones ejecuta?tokenización, atención, capas, optimización, muestreo
Semántica¿Qué representa y por qué significa algo?referencia, intención, verdad, uso, mundo

La primera caja explica cómo una operación puede ocurrir físicamente.

La segunda explica cómo el sistema transforma una entrada en una salida.

La tercera pregunta qué relación existe entre esas transformaciones y aquello de lo que hablamos.

Aquí aparece el primer error que quiero evitar.

Decir:

"No entiende; solo multiplica matrices."

es tan incompleto como decir:

"Tú no entiendes; solo intercambias iones entre neuronas."

Que una capacidad esté hecha de operaciones físicas no demuestra que la capacidad sea falsa. Un avión vuela mediante diferencias de presión. Una canción llega al oído mediante ondas. Un recuerdo depende de cambios materiales en el cerebro.

La reducción física puede ser correcta y aun así no ser el veredicto.

Por eso la antítesis no puede consistir en gritar MATRICES y apagar la luz.

Tenemos que seguir.


PARTE II — EL SILICIO

3Lo primero que le pasa a una palabra

Cuando escribes una frase, el modelo no recibe palabras como las vemos nosotros. Primero entra un tokenizador.

Piensa en un sampler.

Metes una canción completa, pero el aparato no trabaja con "la canción" como una sola cosa. La corta en pedazos: un golpe de bombo, una sílaba, un platillo, medio segundo de voz. Después identifica cada pedazo para poder recuperarlo y combinarlo.

El tokenizador hace algo parecido con el texto. No decide qué significa la frase. La corta en muestras manipulables.

Un tokenizador parte el texto en unidades que pueden ser palabras, pedazos de palabra, signos o fragmentos de bytes. Hay distintos métodos. Una familia muy común deriva de Byte Pair Encoding, pero no todos los modelos usan exactamente el mismo sistema.

Una frase podría separarse, de manera imaginaria, así:

"cmo funciona esta madre we"

→ ["c", "mo", " funciona", " esta", " madre", " we"]
→ [71, 884, 12903, 491, 28044, 903]

Los números son identificadores. No contienen significado por sí solos. Sirven para buscar una fila dentro de una tabla aprendida: la tabla de embeddings.

Cada fila es un vector, es decir, una lista larga de números:

"madre" → [0.17, -0.42, 1.08, 0.03, ...]

El token no "pierde su identidad". Cambia de representación. Deja de manipularse como letras visibles y se convierte en un vector que las capas posteriores pueden transformar.

El número del token es como el número de una casa. No se parece a la casa, no contiene sus muebles y no te dice quién vive ahí. Solo permite llegar a una dirección. Al consultar esa dirección, el modelo recupera el vector que aprendió para ese token.

LETRAS
  ↓  el sampler las corta
TOKENS
  ↓  cada token recibe una dirección
NÚMEROS
  ↓  la dirección abre un cajón
VECTORES

Además se agrega información sobre la posición. No es igual encontrar una palabra al principio que al final, ni antes que después de otra.

Hasta aquí no hay una idea, una madre ni un mundo. Hay índices, vectores y posiciones.

Pero decirlo así todavía no explica lo interesante, porque los números no permanecen quietos. Cada capa los modifica según sus relaciones con otros elementos de la secuencia.

Ahí entra la atención.

4Atención: una mesa llena de letreros

Imagina una mesa con varias tarjetas:

EL  PERRO  PERSIGUIÓ  LA  PELOTA  PORQUE  ESTABA  SUELTA

¿Qué estaba suelta? La pelota, probablemente. ¿Qué perseguía? El perro. ¿Quién ejecutó la acción? También el perro.

Para cada posición, una capa de atención construye tres versiones matemáticas de su estado:

Imagina una fiesta ruidosa. Alguien grita:

"¡Pásame ésa!"

La palabra ésa no trae el objeto adentro. Para entenderla miras quién habló, hacia dónde apunta, qué hay sobre la mesa y qué estaban haciendo hace dos segundos.

Tu pregunta interna sería la Query: "¿a qué se refiere?". Cada objeto ofrece una Key: "soy una botella", "soy una chamarra", "soy lo que estaba mirando". El objeto que mejor encaja aporta su Value: la información que necesitas incorporar para interpretar ésa.

La atención no es una personita señalando la respuesta. Es un sistema de pesos que decide qué voces subir y cuáles bajar en la mezcla.

[puedes brincarte esto] La fórmula clásica se escribe así:

Atención(Q, K, V) = softmax( Q·Kᵀ / √d_k ) · V

Tres cosas y ya:

  1. Q·Kᵀ compara lo que cada posición busca contra lo que todas ofrecen. Sale una tabla de compatibilidades.
  2. √d_k es un divisor de seguridad. d_k es simplemente de cuántos números está hecho cada Key. Cuando esos vectores son largos, los productos salen enormes y el softmax se satura —se va todo a un solo canal y los demás quedan en cero. Dividir entre la raíz mantiene los números en un rango donde el sistema todavía puede matizar. Es un limitador, igual que el que le pones al máster para que un pico no te reviente la mezcla.
  3. softmax(...)·V convierte esas compatibilidades en pesos y con ellos mezcla la información disponible.

En una mezcladora de DJ, todos los canales pueden estar conectados, pero no todos suenan igual. Subes el canal relevante, bajas el que estorba y construyes la mezcla que sale por las bocinas. La atención hace una versión matemática de ese enrutamiento con información, y lo repite para cada posición y en muchas capas.

QUERY  = qué estoy buscando
KEY    = qué ofrece cada elemento
PESO   = cuánto me sirve aquí
VALUE  = qué información dejo entrar a la mezcla

En un modelo causal, una posición no puede mirar libremente al futuro. Una máscara le permite usar únicamente las posiciones visibles, normalmente las anteriores. Otros sistemas emplean ventanas o patrones de atención diferentes.

Después vienen redes feed-forward, conexiones residuales, normalización y muchas capas más. La representación inicial de madre termina convertida en algo que depende de todo el contexto disponible.

El Transformer original fue importante, entre otras razones, porque eliminó la necesidad de procesar la secuencia únicamente mediante recurrencia y permitió paralelizar gran parte del entrenamiento. No fue magia ni la muerte de toda arquitectura anterior. Fue una reorganización extremadamente eficaz de cómo se movía la información entre posiciones.

Aquí el primer ensayo tenía razón en algo fundamental:

El significado operativo de una palabra dentro del modelo no vive en una ficha inmóvil. Se construye mediante relaciones contextuales.

La antítesis no debe negar eso. Debe preguntar qué clase de relaciones son ésas y cuáles todavía faltan.

5La fábrica de multiplicaciones

Todos esos vectores se transforman multiplicándolos por matrices.

Una matriz es una cuadrícula de números. Cuando multiplicas un vector por una matriz, produces otro vector. Cambias la representación bajo una regla aprendida.

Si eso todavía suena abstracto, ya la tienes abierta. Cualquier sinte con matriz de modulación.

De un lado, las fuentes: LFO 1, LFO 2, la envolvente, la velocidad, la rueda de mod.

Del otro, los destinos: el cutoff, el pitch, el volumen, el pan, la resonancia.

Y en cada cruce, un número. Cuánto empuja esta fuente a este destino. El LFO 1 mueve el cutoff un 40 %. La velocidad mueve el volumen un 80 %. La envolvente no toca el pan, ahí va cero.

              CUTOFF   PITCH   VOLUMEN   PAN
LFO 1          0.40    0.00     0.00    0.15
ENVOLVENTE     0.65    0.12     1.00    0.00
VELOCIDAD      0.20    0.00     0.80    0.00
RUEDA DE MOD   0.00    0.05     0.00    0.30

Eso es una matriz. No se le parece: lo es. Se llama igual en el sinte y en las matemáticas, y no es coincidencia — es el mismo objeto con dos nombres. Multiplicar un vector por una matriz es meter todas las fuentes por ese tablero de una sola vez y ver qué sale en cada destino.

Y fíjate en lo que hace interesante ese tablero: una fuente empuja varios destinos al mismo tiempo, y un destino recibe de varias fuentes. Si fuera una perilla por cada cosa no habría matriz, habría una lista. Lo que la vuelve una matriz es que todo puede tocar todo, cada cosa con su propio peso.

En una red neuronal es exactamente eso, nada más que las fuentes y los destinos no se llaman cutoff ni pitch — no se llaman de ninguna manera, y los pesos no los puso nadie a mano. Salieron del entrenamiento.

En un modelo grande, esta operación ocurre una cantidad monstruosa de veces.

Por eso usamos GPUs.

[puedes brincarte esto] Una CPU no es una fila de trabajadores obedeciendo uno por uno: tiene varios núcleos y paraleliza bastante. Pero la GPU dedica una proporción mucho mayor de su silicio a hacer montones de operaciones numéricas parecidas al mismo tiempo. Las multiplicaciones grandes se parten en bloques chicos; grupos de hilos cargan fragmentos desde distintos niveles de memoria, multiplican, acumulan y escriben resultados. Los Tensor Cores aceleran justamente ese multiplicar-y-acumular.

Y aquí hay un detalle que a mí me cambió la forma de ver esto: el cuello de botella muchas veces no es multiplicar. Es mover.

Sacar datos de la memoria grande y lenta hacia la memoria chica y rápida cuesta más tiempo que la aritmética. En 2022, FlashAttention atacó exactamente eso: reorganizó el cálculo de la atención para que los datos viajen menos entre niveles de memoria. Y funcionó — aceleró muchísimo el entrenamiento sin cambiar el resultado.

Ojo con lo que no hizo, porque se dice mucho y es falso: FlashAttention no elimina el costo cuadrático de la atención densa. Comparar cada posición contra todas las demás sigue creciendo como el cuadrado del largo de la secuencia. Lo que hizo fue volver ese cálculo muchísimo más barato de ejecutar. Es la diferencia entre acomodar mejor el cableado y necesitar menos cables.

No existe una sola matriz mágica de 16×16 que despierte una idea. Una operación grande se construye con muchísimos fragmentos coordinados.

El flujo se parece más a una fábrica:

MEMORIA
   ↓
CARGAR BLOQUES
   ↓
MULTIPLICAR Y ACUMULAR
   ↓
APLICAR NO LINEALIDADES
   ↓
GUARDAR RESULTADOS
   ↓
SIGUIENTE CAPA

Al final, el modelo produce una lista de logits: un número para cada posible token siguiente.

Los logits son como una preselección antes de tocar la siguiente canción. El sistema todavía no ha puesto ninguna. Solo tiene una mesa llena de candidatas con distintos niveles de preferencia.

Softmax transforma esos logits en valores no negativos que suman uno. Es una distribución:

"¿"       0.31
"Cómo"    0.24
"Esta"    0.08
"No"      0.04
...        ...

Softmax no elige por sí sola. Un método de decodificación decide si toma la opción mayor o muestrea entre varias. Con greedy decoding puede escoger siempre el máximo. Con temperatura, top-k o top-p puede introducir variedad.

Softmax, entonces, no es el DJ. Es quien convierte una pila desordenada de puntuaciones en una ruleta donde cada opción ocupa cierto espacio. La decodificación decide si siempre toma el espacio mayor o si hace girar la ruleta.

Así aparece un token. Luego vuelve a entrar al proceso para producir el siguiente.

CONTEXTO → DISTRIBUCIÓN → ELECCIÓN → NUEVO CONTEXTO → ↺

Ésta es la mecánica de inferencia.

Ahora viene la pregunta incómoda:

Si una apuesta salió de miles de millones de multiplicaciones, ¿eso demuestra que no hubo comprensión?

No.

Pero tampoco demuestra que sí la hubo.

La fábrica explica cómo apareció la apuesta. Todavía no explica qué relación tiene con el mundo.


PARTE III — CÓMO APRENDE LA FUNCIÓN

6Una máquina con las respuestas al final del libro

Antes de responderte, el modelo pasó por entrenamiento.

Imagina un libro donde cada oración está tapada después de cierto punto:

"El perro corrió detrás de la…"

El sistema propone una distribución. Tal vez asigna:

pelota     0.35
puerta     0.12
persona    0.09
montaña    0.001

En el corpus la continuación real era pelota.

Una función de pérdida mide qué tan mala fue la distribución. Para predicción de tokens suele utilizarse entropía cruzada. Si el modelo asignó mucha probabilidad al resultado correcto, la pérdida es baja. Si casi lo descartó, la pérdida es alta.

Después ocurre la propagación hacia atrás:

optimizador.zero_grad()                              # borra los gradientes del paso anterior
prediccion = modelo(entrada)
perdida    = entropia_cruzada(prediccion, objetivo)
perdida.backward()                                   # calcula gradientes
optimizador.step()                                   # modifica parámetros

Ese primer renglón parece trámite y no lo es: si no borras los gradientes viejos, se van acumulando encima de los nuevos y el entrenamiento se corrompe sin avisarte. Es el error clásico de quien empieza. En la mesa sería dejar la ganancia del set anterior puesta y preguntarte por qué todo satura.

Backpropagation aplica la regla de la cadena para calcular cómo cambiaría la pérdida ante pequeños cambios en los parámetros.

Piensa en un soundcheck con diez mil perillas.

El cantante suena enterrado, el bombo satura y aparece un chillido. Mover todas las perillas al azar sería inútil. Necesitas saber cuáles contribuyeron al problema y en qué dirección conviene moverlas.

Backpropagation reparte la responsabilidad del error hacia atrás:

LA SALIDA SONÓ MAL
        ↓
¿qué parte aportó cuánto al error?
        ↓
¿qué conexiones conviene mover y hacia dónde?

No comprende la canción. Calcula sensibilidad: cuánto cambiaría el error si modificas un poquito cada perilla.

El gradiente no es una respuesta global a la pregunta "¿qué significa perro?". Es una indicación local: "si mueves estos números en esta dirección, bajo este lote de ejemplos, la pérdida probablemente disminuya".

Un optimizador como AdamW combina esa información con estimaciones acumuladas del comportamiento de los gradientes y con regularización. Después de cantidades enormes de ejemplos, los parámetros terminan codificando regularidades que permiten predecir secuencias nuevas.

El optimizador es quien efectivamente mueve las perillas. Backpropagation entrega el mapa de pendientes; el optimizador decide el tamaño y la forma de cada paso.

No es correcto imaginar que la red camina sencillamente hacia un único valle perfecto. La superficie de pérdida tiene una geometría enorme y complicada. Tampoco basta con que exista una buena configuración de parámetros: el entrenamiento debe encontrar una útil, con recursos finitos, datos imperfectos y un objetivo específico.

7El objetivo no nació dentro de la máquina

Aquí aparece una diferencia importante entre un organismo y un modelo entrenado.

El modelo no decidió que predecir tokens era importante.

Nosotros elegimos:

La máquina encontró estrategias internas para reducir el error dentro de ese juego.

Es como entrenar a alguien para ganar un videojuego cuyo marcador diseñaste tú. Puede descubrir una estrategia brillante, incluso una que nunca imaginaste. Pero sigue optimizando los puntos que decidiste contar.

Si el juego premia recoger monedas, recogerá monedas. Si por un error puede ganar quedándose atorado contra una pared y acumulando puntos, tal vez haga eso. No porque sea tonto, sino porque siguió con precisión el objetivo equivocado.

La función de pérdida es el marcador. Lo que mide termina moldeando lo que la máquina aprende a hacer.

Un organismo también aprende mediante errores, pero sus errores están conectados a un ciclo distinto. Hambre, dolor, equilibrio, pertenencia, peligro, curiosidad y supervivencia participan en qué información importa. El animal actúa, altera el entorno y recibe consecuencias.

Los dos sistemas pueden escribirse bajo un esquema muy abstracto:

PREDICCIÓN → RESULTADO → ERROR → ACTUALIZACIÓN

Pero compartir un diagrama no significa compartir el mismo contenido.

Una calculadora, un termostato y un perro también reciben señales y cambian de estado. La pregunta relevante es qué variables representan, cómo las aprendieron, qué pueden hacer con ellas y qué ocurre cuando el mundo se sale de lo conocido.

Éste es el segundo error que quiero evitar:

Una semejanza matemática no es todavía una identidad cognitiva.

El cerebro predictivo y el modelo de lenguaje pueden estar enfrentando familias parecidas de problemas. Eso no demuestra que sus soluciones sean equivalentes.


PARTE IV — SHANNON REGRESA CON UNA FACTURA

8La conexión real entre predecir y comprimir

Aquí tengo que corregir una frase del ensayo anterior.

La conexión entre predicción y compresión no es solo una metáfora bonita. Es matemática.

Supón que un modelo le asigna una probabilidad P a un símbolo. En un código eficiente, la longitud ideal de ese símbolo es:

longitud en bits  ≈  − log₂ ( P )

Que traducido es exactamente esto:

Y si los logaritmos no te dicen nada, olvídalos, porque el ejemplo lo explica solo.

Imagina que tienes que transmitir el clima de una ciudad donde casi todos los días hay sol. Podrías acordar este código:

0       = sol
10      = nublado
110     = lluvia
1110... = nieve y otras rarezas

Al evento frecuente le das el mensaje más corto. A lo raro le das uno más largo. Si predices bien qué suele ocurrir, puedes diseñar códigos más económicos.

Eso es todo lo que dice la fórmula. No hay misticismo: apostar bien permite gastar menos bits al contar lo que pasó.

Un predictor que asigna buenas probabilidades puede convertirse en parte de un compresor sin pérdida mediante técnicas como codificación aritmética. Y un compresor eficaz revela que encontró regularidades aprovechables en los datos.

Ésa es la conexión verdadera:

MEJOR MODELO PROBABILÍSTICO
            ↓
MENOS SORPRESA PROMEDIO
            ↓
CÓDIGOS MÁS CORTOS

En 2023, investigadores mostraron que modelos grandes entrenados principalmente con texto podían utilizarse para comprimir también secuencias de imágenes y audio. Chinchilla 70B obtuvo, bajo ese protocolo, mejores razones de compresión que PNG para ciertos parches de ImageNet y que FLAC para ciertas muestras de LibriSpeech.

El resultado es real y es rarísimo.

Pero hay dos letras chiquitas.

La primera: el modelo contiene miles de millones de parámetros. Si incluyes el costo de almacenar y ejecutar ese modelo, ya no estás comparando simplemente dos archivos comprimidos por herramientas equivalentes. El experimento estudia la calidad de la distribución aprendida, no propone reemplazar mañana FLAC con un modelo de decenas de gigabytes.

La segunda es más profunda:

Encontrar regularidades suficientes para codificar algo no garantiza haber encontrado las causas que lo producen.

9El calendario que predice lluvia

Imagina un pueblo donde, durante cincuenta años, cada vez que repican ciertas campanas llueve una hora después.

Construyes un predictor:

CAMPANAS → LLUVIA

Funciona espectacularmente. Reduce incertidumbre. Permite comprimir el registro meteorológico porque ya no necesitas escribir cada lluvia; basta con registrar las campanas y las excepciones.

Pero un día cambian al campanero de ciudad.

Las campanas siguen sonando. La lluvia no llega.

El modelo había encontrado una regularidad. No había encontrado la causa. Tal vez el campanero anterior tocaba cuando veía nubes desde la torre. Las campanas no producían agua; eran otra consecuencia de la misma situación atmosférica.

La compresión fue útil. La teoría del mundo estaba equivocada.

Aquí está el hueco entre estadística y comprensión causal.

Un sistema puede saber que A suele preceder a B sin saber:

Eso no vuelve inútil al predictor. Lo vuelve vulnerable cuando cambia el mecanismo.

10Comprimir no es una sola cosa

En el ensayo anterior escribí:

"Comprender algo es poder describirlo más corto de lo que es."

Ahora diría:

Comprender suele permitir una buena compresión, pero una buena compresión no demuestra por sí sola comprensión.

Un estudiante que entiende una regla puede reemplazar cien ejemplos con una explicación general. Eso es compresión con estructura.

Pero otro puede descubrir que en el examen todas las respuestas correctas alternan A, C, A, C. También comprimió el patrón. No aprendió la materia.

Los dos bajaron la incertidumbre. Solo uno adquirió algo que puede transferir a situaciones nuevas.

Piensa también en una receta.

Una buena receta comprime cien experiencias de cocina en unas cuantas instrucciones: temperatura, proporción, tiempo y orden. Si entendiste qué hace el calor y qué función cumple cada ingrediente, puedes ajustar cuando cambia el horno.

Una mala "compresión" sería memorizar: "en la casa de mi abuela giro la perilla hasta la rayita borrada y espero tres canciones". Puede funcionar perfectamente en esa cocina. Cambia el horno y se acabó el conocimiento.

Las dos descripciones son cortas. Solo una capturó algo del mecanismo.

Entonces necesitamos preguntar qué clase de compresión logró el sistema:

La longitud del código no responde todo eso.

Predecir y comprimir están formalmente conectados.

Entender sigue bajo interrogación.


PARTE V — EL MAPA

11La geometría del significado

Dentro de una red no hay un cajón etiquetado PERRO con una fotografía universal del perro.

Hay algo más parecido a una ciudad.

En un mapa, una colonia no se define mediante una coordenada aislada. Importa qué tiene alrededor, qué carreteras la conectan, cuánto tardas en llegar al centro y qué lugares quedan cerca.

En un espacio de representaciones ocurre algo parecido. Un concepto adquiere parte de su utilidad por su posición relativa y por las rutas que lo conectan con otros estados.

Hay estados distribuidos entre muchas dimensiones y capas. Podemos comparar algunos de esos estados mediante distancias, similitud coseno, clasificadores simples, intervenciones y otras herramientas.

En modelos antiguos como Word2Vec, cada palabra tendía a asociarse con un vector estático. En un Transformer, la representación cambia con el contexto y con la capa.

La palabra banco en:

"depositó dinero en el banco"

no termina representada de la misma manera que en:

"se durmió en el banco del parque".

Eso es evidencia de que la red utiliza contexto para construir representaciones distintas.

La atención es como mover temporalmente el letrero BANCO a dos barrios diferentes del mapa. Cerca de dinero, cuenta y retiro señala una institución. Cerca de parque, sentarse y lago señala un asiento.

El mismo letrero entra. El vecindario cambia la dirección útil.

También se han encontrado espacios de idiomas diferentes que pueden alinearse mediante transformaciones matemáticas, y modelos grandes de modalidades distintas muestran ciertas semejanzas en la forma de organizar relaciones entre datos.

La Hipótesis de Representación Platónica propone que, al crecer, modelos diferentes podrían converger hacia un modelo estadístico compartido de la realidad.

Es una idea preciosa.

Todavía es una hipótesis.

12Dos mapas que se parecen

Supón que dos exploradores dibujan mapas parecidos de la misma isla sin hablar entre ellos.

La explicación más emocionante es:

Los mapas convergen porque la isla tiene una estructura real.

Probablemente hay algo de eso. Si existe una montaña, distintos exploradores tropezarán con ella.

Pero hay otras fuerzas que también pueden producir semejanza:

La convergencia no prueba por sí sola cuál explicación domina.

Con los modelos ocurre algo parecido. Pueden compartir:

Que dos espacios representacionales sean alineables es evidencia importante. No demuestra automáticamente que encontraron la ontología final del universo.

Y hay otra trampa: dos modelos pueden organizar ciertos objetos de forma parecida y aun así usar esa información de manera distinta al razonar o decidir.

Un mapa puede contener una ruta y, sin embargo, el conductor nunca consultarla.

Tener una dirección guardada en el teléfono no significa que esa dirección haya causado el camino que tomaste. Tal vez seguiste a otro coche. Del mismo modo, encontrar información decodificable dentro de una capa no demuestra automáticamente que esa información dirigió la respuesta final.

La pregunta no es solamente:

"¿Está la información dentro?"

También es:

"¿Qué papel causal desempeña esa información cuando el sistema produce una respuesta?"

Ésa es la pregunta correcta. Y resulta que sí hay un experimento que la contesta.

13El tablero que nadie le enseñó

Éste es el resultado que más me ha costado digerir. No porque conteste la pregunta grande —no la contesta, ya vamos a ver por qué— sino porque me quitó de la mano una frase que yo daba por segura.

En 2022, un equipo de Harvard y Northeastern hizo lo siguiente.

Agarraron la misma arquitectura de los modelos de lenguaje y la entrenaron únicamente con listas de movimientos legales de Othello. Nada más. Secuencias tipo E3, D3, C4, F6…

Nunca le enseñaron las reglas. Nunca le mostraron un tablero. Nunca le dijeron que existía un tablero. Para esa red, el mundo era una tira de símbolos sin explicación, exactamente igual que el texto es para un LLM.

Le pusieron Othello-GPT.

Después fueron a buscar adentro. Y encontraron que la red había construido, por su cuenta, una representación interna del estado del tablero: qué casillas estaban ocupadas y de qué color.

Nadie se lo pidió. Salió porque era la manera más económica de predecir el siguiente movimiento legal.

Y aquí viene lo que separa este experimento de todos los demás.

No se quedaron en mirar. Intervinieron.

Entraron a la red, le modificaron a mano ese tablero interno —le cambiaron una ficha— y volvieron a preguntarle qué movimiento seguía.

El modelo respondió según el tablero modificado.

Eso ya no es correlación. Eso es exactamente lo que la sección anterior estaba exigiendo: la información no solo estaba adentro, dirigía la respuesta. Es la diferencia entre encontrar una ruta guardada en el teléfono y comprobar que el conductor la iba siguiendo, porque le cambiaste el destino y el coche dio la vuelta.

Un año después, otro investigador refinó el hallazgo: la representación se ve mucho más limpia si en vez de buscar "blanco contra negro" buscas "mío contra del oponente". O sea que la red no solo había inventado el tablero. Lo había inventado desde su propia perspectiva de jugador.

Entonces, ¿ya ganó el primer ensayo?

Todavía no, y las salvedades importan:

Y quiero subrayar la tercera, porque si no este experimento se vuelve un truco de porrista.

La pregunta que de verdad importa no es "¿puede la predicción construir un modelo de aquello que predice?". Ésa ya está contestada y la respuesta es sí. La pregunta que importa es:

¿Alcanza la estructura que trae el texto de internet?

Y sobre eso Othello-GPT no dice casi nada. Le dieron a la red el mundo más limpio que se puede fabricar. Que haya encontrado la estructura ahí es como comprobar que un buzo llega al fondo de una alberca. Sirve para saber que sabe bucear. No te dice qué tan hondo aguanta en mar abierto.

Entonces esto no es la victoria del primer ensayo. Es algo más chico y más específico: destruye una frase cómoda.

Ya no se puede decir "predecir el siguiente símbolo jamás puede producir un modelo de aquello de lo que hablan los símbolos". Sí puede. Ya pasó, está medido, y se puede intervenir para comprobarlo.

Dejó de ser una pregunta de si es posible.

Ahora es una pregunta de hasta qué punto de desorden aguanta. Que es mucho más difícil de contestar y no la tenemos contestada.

14La mamá de Tom Cruise no tiene hijo

Y ahora el otro lado, que es igual de duro y muchísimo más fácil de comprobar.

En 2023, un equipo publicó un experimento con un nombre perfecto: la maldición de la inversión.

Entrenas o interrogas a un modelo sobre un hecho con esta forma:

A es B.

Y después le preguntas al revés:

¿Quién es B?

Y falla.

El ejemplo que hizo famoso al paper es literal:

¿Quién es la mamá de Tom Cruise? — Mary Lee Pfeiffer. (correcto)

¿Quién es el hijo de Mary Lee Pfeiffer?No sé.

Lo probaron con mil celebridades y sus padres reales. El patrón fue sistemático: los modelos aciertan la primera dirección con mucha frecuencia y se derrumban en la inversa.

Detente a pensar qué tan raro es eso.

Para ti y para mí, "la mamá de X es Y" y "el hijo de Y es X" no son dos datos. Son un solo dato mirado desde dos lados. Aprender uno es aprender el otro, automáticamente, sin esfuerzo. Ni siquiera se siente como una inferencia.

Para el modelo son dos cadenas de tokens distintas. Si en el corpus abundaba una dirección y escaseaba la otra, aprendió una y no la otra.

No tenía el hecho. Tenía la frase.

Pruébalo tú, ahorita

Esto no lo tienes que creer porque yo lo diga. Es el único experimento de este ensayo que puedes correr desde tu teléfono en lo que se calienta el café:

  1. Abre cualquier chatbot.
  2. Pregúntale por la madre, o el padre, de alguien famoso pero no de los más famosos. Un músico de culto, un actor de reparto, un futbolista de los ochenta.
  3. En una conversación nueva —esto importa, si no lo tiene en el contexto y hace trampa— pregúntale quién es el hijo o la hija de esa persona.

A veces va a acertar. Los modelos nuevos son mejores y muchos ya buscan en internet, lo cual tapa el hueco sin arreglarlo. Pero vas a encontrar casos donde el modelo sabe perfectamente la ida y se queda mudo en la vuelta.

Cuando te pase, estás viendo con tus propios ojos la diferencia entre tener un hecho y tener una frase.

Las salvedades, porque este ensayo no sirve si hago trampa a mi favor:

Pero la asimetría humana es de acceso: tú sabes que la relación existe aunque no la puedas jalar en ese momento. La del modelo parece ser de almacenamiento: la relación inversa nunca se guardó.

Y ahí está, exactamente, el error que la sección 1 andaba buscando. Aquel que revelaría que hubo patrón y no hubo estructura.

15Los dos experimentos, uno frente al otro

Vale la pena verlos juntos, porque solos engañan.

Othello-GPTLa maldición de la inversión
Qué muestraPredecir símbolos sí puede producir un modelo de lo que representanPredecir símbolos puede no producir el hecho, solo la frase
Qué tan fuerte es la evidenciaMuy fuerte: intervinieron y la conducta cambióMuy fuerte: sistemático sobre mil casos, y lo reproduces tú
El mundo del experimentoCerrado, sintético, deterministaAbierto, real, ruidoso
Lo que no pruebaQue pase igual con el mundo realQue sea imposible arreglarlo

Y de ahí sale lo único honesto que se me ocurre decir:

La misma clase de máquina, entrenada con la misma clase de objetivo, construye estructura real cuando el mundo tiene estructura limpia — y se queda con la cáscara cuando el mundo se la da desordenada.

Lo cual no es un veredicto sobre la máquina.

Es un veredicto sobre cuánto depende del mundo que le des.

Y también explica por qué la discusión pública nunca avanza: quien quiere probar que la máquina entiende cita algo parecido a Othello. Quien quiere probar que no entiende cita algo parecido a Tom Cruise. Los dos tienen razón, y los dos están citando la mitad.

16Babel no cayó

Los espacios multilingües son impresionantes. Permiten traducción, búsqueda entre idiomas y transferencia de conocimiento.

Pero decir que "Babel se desploma mediante multiplicación de vectores" es demasiado.

Un modelo puede alinear dog, perro y una fotografía. Eso no agota todo lo que esas señales significan para agentes distintos.

Para una veterinaria, un perro puede activar enfermedades, anatomía y tratamiento.

Para un niño, juego.

Para alguien que fue mordido, miedo.

Para el propio perro, olores, territorio, hambre, afecto y posibilidades de acción que ninguno de nosotros percibe de la misma manera.

La traducción aproxima estructuras compartidas. No vuelve idénticas las historias, los cuerpos ni los usos.

Babel se volvió más navegable.

No desapareció.


PARTE VI — EL MUNDO NO ES UN DATASET

17El pulpo consigue una cámara

En el experimento mental de Bender y Koller, un pulpo intercepta mensajes entre dos personas. Aprende perfectamente qué secuencias siguen a cuáles, pero nunca ha visto los objetos ni las situaciones de las que hablan.

La respuesta moderna parece obvia:

Ponle una cámara.

Eso es, en parte, lo que hicieron los modelos multimodales. CLIP aprendió a acercar representaciones de imágenes y textos correspondientes. Los Vision Transformers dividieron imágenes en parches y aplicaron mecanismos de Transformer sobre sus representaciones.

Ahora perro puede relacionarse no solo con otras palabras, sino con píxeles de muchos perros.

¿Se resolvió el grounding?

Se redujo una parte del aislamiento. No necesariamente se resolvió el problema completo.

Una imagen tampoco es el mundo. Es una señal producida por una cámara desde cierto ángulo, bajo cierta luz, con una selección hecha por alguien.

Una fotografía de una sopa puede mostrarte el color, el plato y quizá el vapor. No te entrega la temperatura en la lengua, el olor, la sal, el hambre ni la consecuencia de volcarla sobre la mesa.

Agregar cámara al pulpo es como entregarle un menú con fotografías. Ahora relaciona nombres con apariencias. Todavía no ha probado la comida.

Relacionar la palabra martillo con miles de fotografías puede enseñar su forma visual. No garantiza que el sistema conozca:

La imagen agrega información. La acción y la consecuencia agregan otra clase de información.

18Correlación entre modalidades no es causalidad

CLIP utiliza una tarea contrastiva: aproxima imágenes y textos que aparecen juntos y separa combinaciones que no corresponden.

Eso crea un puente estadístico entre dos modalidades.

Pero dos cámaras viendo la misma fiesta no por eso entienden la fiesta. Dos sensores pueden registrar el mismo evento y seguir sin representar quién prometió qué, por qué alguien se ofendió o qué habría ocurrido si la música no se hubiera apagado.

Imagina dos aparatos en una discoteca. Uno mide el volumen y otro cuenta cuántas personas bailan. Durante meses ambos números suben juntos:

MÁS VOLUMEN ↔ MÁS PERSONAS BAILANDO

Pero quizá la causa real es que el DJ sube el volumen justo cuando pone la canción más esperada. Si mañana reproduce una alarma a todo volumen, la pista se vacía.

Ver dos señales juntas enseña una relación. Para descubrir el mecanismo necesitas observar qué ocurre cuando intervienes. Que es, exactamente, lo que hicieron con Othello-GPT y lo que casi nunca podemos hacer con el mundo.

El grounding puede referirse a varias cosas diferentes:

Multimodalidad ayuda en algunas. No garantiza todas.

Tampoco un cuerpo de robot las garantiza automáticamente. Un brazo mecánico puede ejecutar millones de agarres y aun así aprender atajos que fallan fuera del laboratorio.

La frase honesta es:

Cada modalidad abre una ventana adicional hacia el mundo. Ninguna ventana, por sí sola, convierte la casa en el mundo.

19El perro vuelve a entrar

El perro del primer ensayo sigue siendo importante porque demuestra que un sistema puede construir un mundo útil sin lenguaje humano.

Reconoce personas, anticipa rutinas, persigue trayectorias y relaciona ciertos sonidos con objetos o acciones.

Pero también revela algo que la analogía con el LLM oculta.

El perro no recibe un dataset ya separado de su vida.

Para él:

PERCIBIR
   ↓
MOVERSE
   ↓
ALTERAR EL ENTORNO
   ↓
RECIBIR CONSECUENCIAS
   ↓
CAMBIAR CONDUCTA
   ↓
VOLVER A PROBAR

Su representación está amarrada a lo que puede hacer y a lo que puede pasarle.

Y fíjate en algo: el perro puede intervenir en su mundo igual que los investigadores intervinieron en Othello-GPT. Empuja la puerta y ve si cede. Ésa es la diferencia. El perro corre el experimento; el modelo solo lee el reporte.

Aquí me tengo que agarrar en una inconsistencia propia, porque alguien me la señaló y tenía razón.

Dos secciones arriba descarté al robot: dije que un brazo mecánico puede hacer millones de agarres y aun así aprender atajos que fallan fuera del laboratorio. Pero el brazo mecánico también percibe, actúa, recibe consecuencias y corrige. Si ese ciclo es lo que le da mundo al perro, ¿por qué al robot no?

La respuesta que se me ocurrió primero es buena, pero no es la que creí.

El perro no empieza de cero. No es un organismo aprendiendo solo durante los meses que lleva vivo: es la punta de un iceberg de millones de años. La gravedad, el dolor, el espacio de tres dimensiones, qué es una presa y qué es un depredador — nada de eso lo tiene que descubrir tropezándose. Su genoma ya trae esos pesos ajustados, porque los ancestros que no los traían se murieron sin dejar descendencia. El robot lleva un mes en un simulador; el perro lleva un linaje entero corriendo el experimento.

Eso explica por qué el perro es muchísimo mejor en ese ciclo. Pero, la verdad, no explica por qué el ciclo cuenta en el perro y no cuenta en el robot. Cambia la cantidad, no el tipo. Si el ciclo es lo que da mundo, el robot tiene poco mundo — no cero.

Y hay una vuelta de tuerca que me obliga a bajarle todavía más al tono. Si digo que el entendimiento del perro descansa en millones de años de optimización bajo una función de pérdida brutal —sobrevivir o no reproducirte— acabo de describir, con otras palabras, una corrida de entrenamiento larguísima con un objetivo durísimo.

Ese argumento no aleja al perro de la máquina. Lo acerca.

Lo dejo escrito porque es honesto, y porque no pienso usar solo los argumentos que me convienen.

Nada de esto demuestra que solo los seres vivos puedan entender. Sería convertir nuestra implementación en requisito universal, el mismo error que criticamos cuando alguien dice que un avión no vuela porque no tiene plumas.

Pero sí plantea una condición candidata:

Tal vez parte de comprender consiste en poder usar una representación para intervenir, observar el resultado y corregirse cuando el mecanismo real contradice la expectativa.

Un sistema artificial podría hacerlo.

La pregunta es cuánto de eso hacen los sistemas actuales, en qué dominios y con qué estabilidad.


PARTE VII — MEMORIA, BÚSQUEDA Y APRENDIZAJE

20Tener una biblioteca abierta no es haber cambiado

Durante una conversación larga, un modelo puede utilizar una ventana de contexto. En generación autoregresiva, una KV cache conserva claves y valores ya calculados para no repetir todo el trabajo en cada token.

Eso mejora eficiencia. No es una autobiografía.

Imagina que durante una presentación pegas notas alrededor de la cabina:

SIGUIENTE: CANCIÓN 14
BAJAR LUCES EN EL CORO
NO REPETIR LA 7

Mientras las notas estén visibles puedes usarlas. Cuando termina la noche y las arrancas, no necesariamente cambió tu memoria de largo plazo ni aprendiste una técnica nueva.

La ventana de contexto se parece más a esas notas abiertas que a una cicatriz, un hábito o un recuerdo incorporado.

También podemos conectar el modelo a documentos mediante RAG, darle una base de datos, guardar resúmenes de conversaciones o permitirle buscar en internet.

Todo eso amplía la información disponible.

Pero conviene separar cosas que solemos llamar "memoria" como si fueran una sola:

MecanismoQué haceQué no demuestra
ventana de contextomantiene información disponible durante la tareaaprendizaje permanente
KV cachereutiliza estados de atención previosrecuerdo conceptual de largo plazo
RAGrecupera documentos externosintegración profunda de lo recuperado
memoria de agenteguarda registros entre sesionescambio estable del modelo interno
fine-tuningmodifica parámetrosaprendizaje continuo sin interferencia

Una biblioteca puede contener una idea sin comprenderla. Un modelo puede consultar un documento correctamente sin incorporar de manera permanente la lección que contiene.

RAG es parecido a tener un asistente que corre al archivo, encuentra una carpeta y la deja abierta sobre la mesa. Resuelve el problema de acceso. No garantiza que quien la recibe sepa distinguir lo importante, unirlo con lo anterior o cambiar una creencia equivocada.

Y esto explica por qué el truco de "búscalo en internet" tapa la maldición de la inversión sin curarla: el modelo no aprendió que Mary Lee Pfeiffer tiene un hijo. Alguien le pasó un papelito.

Aunque aquí me tengo que exigir a mí mismo lo que exigí en la sección 1: si el sistema contesta bien porque lo buscó, ¿en qué se nota la diferencia? Una distinción que no produce ningún error observable no es una distinción, es una preferencia.

Sí se nota, y ahí está la prueba: pídele que encadene el dato recuperado con otro. Que use al hijo de Mary Lee Pfeiffer en un razonamiento de tres pasos, junto a algo más que ya sepa. El papelito sirve para contestar la pregunta que lo trajo; sirve mucho peor para todo lo demás, porque el hecho nunca se integró con el resto. Se quedó en la mesa, no entró al archivo.

Encontrar el dato y tenerlo no es lo mismo. La diferencia no aparece en la respuesta directa. Aparece en la segunda pregunta.

La memoria importa, pero el volumen no resuelve por sí solo qué conservar, qué abstraer, qué descartar ni cómo cambiar una creencia anterior.

21El olvido que no ocurre y el que sí

Cuando un modelo está en inferencia con sus parámetros congelados, no está olvidando catastróficamente. Simplemente no está actualizando esos parámetros.

El olvido catastrófico aparece cuando una red continúa entrenándose con tareas o distribuciones nuevas y las modificaciones deterioran capacidades anteriores.

Son dos límites distintos:

PESOS CONGELADOS
→ no aprende permanentemente del episodio.

PESOS ACTUALIZADOS
→ puede aprender, pero interferir con lo anterior.

El aprendizaje continuo intenta resolver ese equilibrio. Un sistema necesitaría adquirir conocimiento nuevo sin reentrenarse desde cero, sin almacenar toda su historia y sin destruir lo que ya sabía.

Los humanos tampoco resolvemos esto perfectamente. Olvidamos, deformamos y reemplazamos recuerdos. La diferencia es que nuestro olvido forma parte de un ciclo continuo de vida; no hay una frontera limpia entre "entrenamiento" e "inferencia".

22Pensar más tiempo

Otra frontera consiste en gastar más cómputo en el momento de responder, en vez de soltar de inmediato el token más probable. El sistema puede generar varias soluciones, ejecutar código, usar herramientas, retroceder, comparar caminos y pasar los resultados por un verificador.

En el estudio sería como grabar veinte tomas en vez de publicar la primera. Después comparas, detectas cuál desafinó, y le pides a un afinador que las mida.

Y funciona. Pero acabamos de aprender cuánto funciona y qué precio tiene, y ésa es la parte interesante.

El mejor lugar para verlo es ARC, la prueba que diseñó François Chollet precisamente para que memorizar internet no sirviera de nada: acertijos visuales donde te dan dos o tres ejemplos y tienes que sacar la regla.

En los resultados de ARC Prize 2025 sobre ARC-AGI-2, la segunda versión de la prueba:

sistemaaciertocosto por acertijo
mejor entrada de la competencia abierta24 %$0.20
Opus 4.5 con razonamiento37.6 % .20
Gemini 3 Pro con un arnés de refinamiento54 %$31

Mira la última columna, no la del medio.

Subir de 24 % a 54 % costó ciento cincuenta veces más dinero por acertijo. Ésa es exactamente la métrica de Chollet: no cuánto sabes, sino qué tan barato aprendes algo nuevo. Y por esa métrica, pensar más tiempo compra puntos a un precio que crece rapidísimo.

Y lo más filoso lo dijo el propio equipo de ARC Prize, que no son enemigos de esta tecnología. Su lectura de sus propios resultados fue que los modelos están probablemente sobreajustados al conocimiento más que razonando con fluidez — notaron, por ejemplo, que los modelos aplican los mapeos de color específicos de ARC sin que nadie se los haya entrenado. Como resumió Mike Knoop, uno de los organizadores: el desempeño actual de razonamiento está atado al conocimiento del modelo. El razonamiento humano, en cambio, no lo está.

Dicho de otro modo: buscar más ayuda si la respuesta ya está en el espacio que exploras y tienes cómo reconocerla. Si te faltan observaciones, si el objetivo está mal puesto o si el verificador premia un atajo, puedes buscar una eternidad dentro del mapa equivocado.

Puedes grabar mil tomas con la guitarra desafinada.

(Los números son del reporte de ARC Prize 2025. Esta prueba se mueve rápido — ya existe una tercera versión del benchmark. Si estás leyendo esto mucho después, ve a arcprize.org por las cifras del día.)


PARTE VIII — LA FUNCIÓN UNIVERSAL QUE NO LO RESUELVE TODO

23"Puede aproximar cualquier función"

Aquí hay otra frase que suena más poderosa de lo que realmente dice.

El Teorema de Aproximación Universal establece, bajo condiciones específicas, que ciertas redes con capacidad suficiente pueden aproximar arbitrariamente bien clases amplias de funciones, típicamente funciones continuas sobre dominios compactos.

Eso es un resultado sobre expresividad.

No garantiza:

Existe una diferencia enorme entre:

"Hay una configuración de números capaz de representar esta relación."

y:

"Este proceso de entrenamiento encontrará esa configuración y la usará correctamente ante un mundo nuevo."

Un piano puede producir millones de melodías posibles. Eso no significa que cualquier persona sentada frente al teclado vaya a componer una buena canción.

La capacidad del instrumento no explica el aprendizaje del músico.

Otra forma de verlo: tener una caja gigantesca de LEGO significa que las piezas permiten construir muchísimas figuras. No significa que las piezas sepan construir, que tengas el instructivo, que encuentres el diseño correcto antes de morir ni que la estructura aguante cuando la saques de la mesa.

El teorema habla de lo que las piezas podrían representar bajo ciertas condiciones. El entrenamiento es el problema de encontrar la construcción.

24La prueba de la pared nueva

¿Cómo sabríamos si una máquina aprendió una regularidad profunda y no un atajo?

Quitándole las pistas conocidas.

Ponla frente a una pared que nunca vio.

No una pared con otro color dentro del mismo dataset. Una situación donde cambien las apariencias y permanezca el mecanismo, o donde permanezcan las apariencias y cambie el mecanismo.

Un niño aprende que una taza es un recipiente aunque sea roja, azul, de barro o de plástico. Pero si le das una taza pintada en una hoja, no intenta servirle agua. No solo reconoció la silueta: de alguna manera aprendió qué propiedades importan para contener líquido.

La prueba de la pared nueva pregunta si el sistema aprendió la función o solamente la decoración.

Entonces observa si puede:

  1. identificar qué variables importan;
  2. formular una hipótesis;
  3. intervenir;
  4. predecir una consecuencia;
  5. detectar el error;
  6. actualizarse de forma persistente;
  7. transferir lo aprendido a otra situación;
  8. reconocer cuándo no sabe.

Chollet propuso medir la inteligencia no por las habilidades que un sistema ya posee, sino por la eficiencia con la que adquiere habilidades nuevas. Ésa es la diferencia que la tabla de la sección 22 vuelve visible en pesos y centavos.

Un modelo puede saber una cantidad enorme y seguir necesitando demasiada experiencia —o demasiado dinero— para aprender una regla fuera de su distribución.

Conocimiento acumulado e inteligencia adaptativa no son idénticos.

La prueba importante no es cuántas respuestas tiene la caja.

Es cuánto necesita ver para construir una respuesta que nadie le enseñó.


PARTE IX — LA ANTÍTESIS

25La versión más fuerte del primer ensayo

Antes de dar el veredicto hay que presentar el argumento contrario en su mejor versión.

El primer ensayo no afirma simplemente que una máquina "tiene alma" porque escribe bonito.

Su argumento fuerte es más serio:

  1. Los organismos enfrentan un mundo incompleto y predicen.
  2. El lenguaje transmite evidencia incompleta entre modelos internos.
  3. La teoría de la información conecta sorpresa con cantidad de información.
  4. La predicción probabilística se conecta matemáticamente con compresión.
  5. Los Transformers construyen representaciones dependientes del contexto.
  6. Modelos distintos muestran convergencias representacionales.
  7. La multimodalidad conecta señales distintas sobre fenómenos compartidos.
  8. La acción puede cerrar el ciclo entre predicción y consecuencia.

Nada de eso es absurdo. Buena parte es correcto. Y Othello-GPT le agrega un noveno punto que yo no tenía cuando lo escribí, y que es el más fuerte de todos: predecir símbolos puede producir un modelo interno de aquello que los símbolos representan, y ese modelo puede dirigir causalmente la respuesta.

La conclusión razonable es:

Los modelos actuales no son simples tablas de frases. Aprenden estructuras internas que permiten generalización real y que, en algunos aspectos, se parecen a operaciones necesarias para la inteligencia.

Estoy de acuerdo.

La conclusión que todavía no está obligada es:

Por lo tanto comprenden, en el sentido completo o humano de la palabra.

Entre ambas conclusiones faltan condiciones. Y la mamá de Tom Cruise es la prueba de que faltan.

26Las condiciones que faltan

No sé cuál definición final de comprensión sobrevivirá. Pero una definición seria tendría que decir algo sobre varias de estas capacidades.

Piensa en la palabra llave.

Comprenderla de manera rica no es únicamente completar "abre la puerta con la…". También involucra reconocer una llave nueva, distinguirla de un dibujo, saber que gira una cerradura, imaginar qué pasaría si se rompe, usarla cuando la puerta cambia y admitir que no sabes cuál abre qué chapa.

Esa pequeña escena contiene casi todas las condiciones siguientes:

Ninguna tiene que parecerse exactamente a la versión humana. Un avión no necesita plumas.

Pero tampoco podemos eliminar todas y dejar únicamente "produce la respuesta que esperábamos". Si conducta exitosa en cualquier prueba equivale por definición a comprensión, la palabra deja de explicar y solo felicita el resultado.

27¿Y si entender no es algo que se tiene?

Ahora la objeción que más miedo me da, porque si es correcta no le pega a una sección de este ensayo. Le pega al método completo de los dos.

Fíjate en lo que llevo haciendo desde la primera página. Abro la máquina. Busco adentro. En la sección 13 encuentro un tablero y me emociono; en la 14 encuentro un hecho faltante y me preocupo. La sección 26 hasta te da una lista de nueve capacidades que el sistema tendría que poseer.

Todo eso asume una cosa sin decirla nunca:

Que entender es una propiedad que un sistema tiene adentro, como la masa o la temperatura. Algo que, si abres bien, se puede encontrar.

Hay una tradición filosófica seria que dice que eso está mal planteado. No que la respuesta sea otra: que la pregunta no tiene la forma que creemos.

Gilbert Ryle le puso nombre al error en 1949: lo llamó un error de categoría. Su ejemplo era un visitante al que le enseñan los edificios de Oxford, las bibliotecas, los laboratorios, las canchas, y al final pregunta: "sí, muy bonito, pero ¿dónde está la Universidad?".

De paso, aquí es donde nació el título de este ensayo. "El fantasma en la máquina" es de Ryle, del mismo libro, y no la escribió como elogio ni como misterio: la escribió burlándose. Le estaba diciendo a Descartes que buscar a un habitante escondido adentro del cuerpo es exactamente el error del visitante que busca la Universidad detrás de los edificios. Setenta y cinco años después seguimos abriendo máquinas a ver si el fantasma aparece.

La Universidad no es otro edificio escondido detrás de los que ya vio. Es la manera en que todo eso está organizado y se usa. Buscarla como una cosa más es no haber entendido de qué tipo de cosa se está hablando.

En tu mundo y en el mío: te puedo enseñar las tornamesas, la mezcladora, las bocinas, el crate, la sala, la gente. Y si al final me preguntas "órale, ¿pero dónde está el set?", no te falta información. Te falta darte cuenta de que el set no es otro aparato. Es lo que pasa cuando todo eso se usa junto, esa noche, con esa gente.

Wittgenstein llegó por otro camino: el significado no es algo que la palabra carga adentro, es su uso dentro de una práctica compartida. Y remató con algo incómodo — un lenguaje que solo tú pudieras entender no sería un lenguaje, porque no habría manera de distinguir estar en lo correcto de creer que estás en lo correcto. Sin una comunidad que te pueda corregir, la corrección no existe.

Robert Brandom lo volvió operativo: entender es poder pedir y dar razones. Es hacerte responsable de lo que afirmas dentro de un juego donde alguien te puede exigir que lo justifiques.

Si alguno de los tres tiene razón, este ensayo entero está buscando en el lugar equivocado. No porque la respuesta esté en otro lado de la máquina. Porque no está dentro de ninguna máquina, ni de la tuya ni de la mía. Yo tampoco tengo el entender guardado en algún pliegue de la corteza. Lo tengo en que hablo con gente que me corrige, en que mis afirmaciones tienen consecuencias, y en que existe una diferencia entre que algo me salga bien y que me salga bien por la razón correcta.

Y por si esto sonara a que le estoy dando la razón a los escépticos, ojo: corta para los dos lados, y del lado de ellos corta más feo.

Porque estos sistemas ya están metidos en esa práctica. La gente les pide razones. Les discute. Rechaza respuestas. Los corrige y los usa para construir cosas que después fallan o no fallan. Si entender es participar en un juego de dar y pedir razones, entonces la pregunta deja de ser "¿lo tiene adentro?" y se vuelve "¿es un participante?" — y ésa es una pregunta que se contesta mirando la práctica, no destripando la caja.

No sé si Ryle tiene razón. Sinceramente no lo sé.

Lo que sí sé es que escribí dos ensayos completos abriendo cajas y buscando adentro, sin preguntarme ni una vez si la cosa que buscaba era de las que están adentro.

Eso lo tenía que dejar por escrito antes del cierre.

28Los experimentos que sí tenemos

Aquí se parte el debate.

Quien dice "la máquina entiende" necesita proponer una prueba que pudiera demostrar que se equivoca.

Quien dice "una máquina jamás entenderá" también.

Si cualquier éxito puede descartarse diciendo "solo imitó", entonces la negación es inmune a la evidencia.

Si cualquier respuesta fluida puede aceptarse diciendo "eso ya es comprender", entonces la afirmación también es inmune a la evidencia.

Las dos posiciones se vuelven religión.

Lo que sirve son experimentos que separen explicaciones que de otro modo predicen lo mismo:

MEMORIZACIÓN            vs. REGLA TRANSFERIBLE
CORRELACIÓN             vs. MECANISMO CAUSAL
CONTEXTO TEMPORAL       vs. APRENDIZAJE PERSISTENTE
RESPUESTA PLAUSIBLE     vs. CREENCIA CALIBRADA
ALINEACIÓN MULTIMODAL   vs. INTERVENCIÓN EN EL MUNDO
INFORMACIÓN PRESENTE    vs. INFORMACIÓN USADA CAUSALMENTE
FRASE APRENDIDA         vs. HECHO APRENDIDO

Y ya tenemos algunos buenos, que es más de lo que yo creía cuando empecé a escribir esto.

Othello-GPT ataca el último renglón por arriba: demostró que la información presente sí puede ser información usada causalmente, porque la intervinieron y la conducta cambió.

La maldición de la inversión ataca el renglón nuevo por abajo: demostró que a veces lo que hay guardado es la frase y no el hecho.

ARC ataca el primero, y su respuesta actual es incómoda para los dos bandos: los sistemas mejoran de verdad, y lo hacen a un costo que crece de una manera que no se parece a como aprende un niño.

La interpretabilidad mecanística —abrir el modelo y rastrear qué representaciones participan realmente en una decisión— es la línea que produjo Othello-GPT, y es de donde yo esperaría las próximas respuestas.

Todavía no hay una sola prueba que cierre el asunto.

Y quizá "entender" no sea un interruptor.

Tal vez sea un conjunto de capacidades que aparecen en grados distintos, bajo arquitecturas distintas.

Un perro entiende algunas cosas que no puede decir.

Un humano puede decir cosas que no entiende.

Una máquina puede inventarse un tablero que nadie le enseñó y al mismo tiempo no saber que una madre tiene un hijo.

La palabra puede estar intentando cubrir demasiados fenómenos a la vez.


29A quién le conviene la respuesta

Llevo doce mil palabras discutiendo esto como si fuera una conversación entre gente curiosa.

No lo es. Y no decirlo sería la deshonestidad más grande del ensayo.

La palabra entender trae dinero encima. Muchísimo. Las valuaciones de estas empresas descansan en la expectativa de que estos sistemas van a hacer trabajo que hoy hacen personas. "Sí entiende" vuelve esa expectativa razonable. "Es un buscador de patrones excelente con hoyos raros" la vuelve una venta mucho más difícil.

Cuando leas a alguien defendiendo con pasión que la máquina comprende, vale la pena preguntar de dónde le llega el cheque.

Pero hay una parte que casi nadie dice.

El incentivo corre para los dos lados.

"Es tan poderosa que da miedo" también es un argumento de venta. Es la misma afirmación con etiqueta de advertencia: para asustarte de una máquina, primero tengo que convencerte de que es formidable. Buena parte del discurso más alarmista sobre la IA es publicidad con casco.

Y del otro lado hay una industria completa de escépticos con sus propios incentivos: libros, conferencias, consultorías, posicionamiento. Decir "es un loro estadístico" con suficiente seguridad también paga la renta.

Yo tampoco estoy limpio. Estoy publicando esto en mi propio sitio, con mi nombre, y me conviene que lo leas.

Y hay una que tengo que poner por escrito aunque me incomode: estos dos ensayos los escribí con ayuda de una inteligencia artificial, hecha por una empresa que tiene dinero puesto en cuál de las dos respuestas gana. No sé qué tanto eso torció lo que leíste. Sé que sería más cómodo no mencionarlo.

Así que no te voy a ofrecer neutralidad, porque en este tema no la hay y quien te la ofrezca te está vendiendo algo.

En el estudio todos te dicen que el track está cabrón.

Tus compas, el que te ayudó a mezclarlo, el que te prestó el cuartito. Y no te están mintiendo: te quieren, quieren que te vaya bien, y decirlo no les cuesta nada. El que más se miente eres tú, que llevas tres semanas oyéndolo y ya no lo puedes escuchar como se escucha algo por primera vez.

Después lo pones a la una de la mañana.

Y la pista se vacía en treinta segundos.

La pista no te hace el paro. No sabe quién eres, no te debe nada y le vale lo que te costó. Se queda o se va, y eso es todo lo que te va a decir.

Por eso no te voy a pedir que me creas.

Te voy a dar con qué sacarme de mentiroso.

Ésa es la tabla del final, que separa hecho de especulación y me obliga a marcar mis propias tesis como especulación. Son las referencias con autor, año y dónde salieron, en vez de un "según estudios". Es la sección 14, que no te pide confianza: te da tres pasos para que lo compruebes tú, con tu teléfono, en lo que se calienta el café.

No porque yo sea desinteresado.

Porque una afirmación verificable no depende de quién la hizo.


CIERRE

30Abrimos la caja

Abrimos la caja y encontramos números.

Encontramos texto partido en tokens. Tokens convertidos en vectores. Vectores transformados por atención y redes densas. Encontramos GPUs moviendo bloques entre memorias y ejecutando multiplicaciones-acumulaciones. Encontramos una función de pérdida, gradientes y un optimizador. Encontramos logits, Softmax y un método que elige el siguiente token.

No encontramos una intención diminuta escondida en un Tensor Core.

Tampoco encontramos la ausencia de intención.

Encontramos el mecanismo.

Y el mecanismo nos permitió corregir algunas ilusiones:

Pero el mecanismo también destruyó una negación demasiado cómoda.

No podemos decir "solo son matrices" como si la palabra solo explicara algo.

Nosotros también estamos hechos de componentes que, vistos por separado, no contienen lo que emerge de su organización.

La pregunta no es si debajo hay materia.

La pregunta es qué puede hacer esa materia cuando se organiza de cierta forma.

Y en un tablero de Othello, ya sabemos la respuesta: puede armarse un mundo.

31La caja sigue cerrada

El primer ensayo terminó diciendo que el lenguaje era el cable y las relaciones eran la corriente.

Este ensayo agrega una resistencia:

No toda relación estadística es una relación con el mundo.

Un sistema puede predecir sin saber por qué.

Puede comprimir sin encontrar la causa.

Puede alinear imágenes y palabras sin saber qué acciones permite un objeto.

Puede almacenar una experiencia sin cambiar por ella.

Puede saberse un hecho en una dirección y no en la contraria.

Puede producir una explicación verdadera mediante un proceso que también produciría una falsa con la misma seguridad.

Y, sin embargo, cada una de esas capacidades puede ser parte de algo que un día llamemos comprensión. Y en un mundo lo bastante limpio, ya vimos que arma la estructura sola.

Ése es el punto donde queda la discusión.

La función matemática no es una refutación de la inteligencia. Es su posible implementación.

La conducta impresionante no es una demostración automática de comprensión. Es la evidencia que tenemos que explicar.

Entre ambas está la caja que todavía no abrimos:

SEÑAL
  ↓
PREDICCIÓN
  ↓
REPRESENTACIÓN
  ↓
ACCIÓN
  ↓
CONSECUENCIA
  ↓
CORRECCIÓN PERSISTENTE
  ↓
TRANSFERENCIA
  ↓
¿COMPRENSIÓN?

El signo de interrogación se queda.

No por cobardía.

Porque quitarlo hoy sería fingir que una discusión abierta ya terminó.

Pero dejar solo el interrogante también sería hacer trampa, porque no me voy de aquí con las manos vacías. Sí saqué una afirmación, y es la de la sección 15:

La misma máquina construye estructura real cuando el mundo se la da limpia, y se queda con la cáscara cuando se la da desordenada.

Eso no es una duda. Es una respuesta, y se comprueba en los dos extremos. Un tablero de Othello es lo más limpio que existe: ahí la máquina se armó un mundo sola. Quién es hijo de quién, disperso en un billón de páginas escritas por cualquiera con cualquier criterio: ahí se quedó con la frase.

Lo que no sabemos es dónde cae el mundo real entre esos dos extremos. Y sospecho que no cae en un solo punto — que hay dominios donde la estructura es lo bastante nítida y otros donde no la hay, y que buena parte del pleito público sobre estas máquinas es gente parada en dominios distintos gritándose sin darse cuenta.

Yo empecé este ensayo pensando que iba a poder decir que no, que solo eran matrices. Encontré un tablero que nadie enseñó y ya no pude.

Después encontré a una señora que tiene un hijo famoso y una máquina que no lo sabe, y tampoco pude decir que sí.

Y al final me quedó una sospecha peor que las dos: que llevo dos ensayos abriendo cajas para buscar algo que a lo mejor nunca estuvo dentro de una caja.

Las matrices explican cómo corre la máquina.

No deciden por sí solas qué clase de máquina está corriendo.


QUÉ ES HECHO Y QUÉ ES INTERPRETACIÓN

AfirmaciónEstatus
Un LLM transforma tokens mediante operaciones numéricas aprendidasHecho
El forward pass y la decodificación son exactamente el mismo procesoFalso; la decodificación agrega una regla de selección o muestreo
Las GPUs aceleran operaciones paralelas como multiplicaciones de matricesHecho
Describir el hardware demuestra que el sistema no comprendeNo se sigue
Backpropagation calcula gradientes de la pérdida respecto de los parámetrosHecho
Un modelo congelado aprende permanentemente de cada conversaciónGeneralmente falso
Un modelo congelado está sufriendo olvido catastróficoConfusión; el olvido aparece al actualizar y deteriorar conocimiento previo
FlashAttention reduce tráfico de memoria y acelera atención exactaHecho
FlashAttention elimina la complejidad cuadrática de la atención densaFalso; la abarata, no la elimina
Predicción probabilística y compresión sin pérdida tienen una conexión matemáticaHecho
Toda buena compresión implica comprensiónNo demostrado
Los Transformers construyen representaciones dependientes del contextoHecho por diseño y evidencia
La similitud coseno es "el significado" completoDemasiado fuerte
Algunos modelos y modalidades muestran convergencia representacionalHay evidencia
Esa convergencia confirma una representación platónica de la realidadHipótesis, no confirmación
Un modelo entrenado solo con movimientos de Othello construyó un tablero internoHecho, y verificado por intervención
Eso demuestra que los LLM tienen un modelo del mundo realNo se sigue; Othello es cerrado, sintético y determinista
Los modelos fallan al invertir hechos aprendidos en una sola direcciónHecho, sistemático, y lo puedes reproducir tú
Esa falla es permanente e imposible de mitigarFalso; hay trabajo que la reduce
CLIP alinea información de imágenes y textosHecho
Alinear modalidades resuelve por sí solo todo el problema del groundingNo demostrado
El Teorema de Aproximación Universal garantiza que el entrenamiento aprenderá cualquier tareaFalso
Los sistemas actuales muestran generalización no trivialHecho
En ARC-AGI-2, subir de 24 % a 54 % costó ~150× más por acertijo (ARC Prize 2025)Hecho, con fecha
Eso basta para afirmar comprensión humana completaDebate abierto
El perro trae ventaja evolutiva que el robot no tiene (priors de millones de años)Hecho
Eso demuestra que el robot no puede tener mundoNo se sigue; cambia la cantidad, no el tipo
Entender es una propiedad que un sistema tiene adentroSupuesto no examinado de los dos ensayos. Ver §27
Este ensayo se escribió con ayuda de una IA comercialConflicto de interés declarado. Ver §29
Una máquina nunca podrá comprender porque no es biológicaAfirmación filosófica sin prueba concluyente
Comprender puede ser un conjunto gradual de capacidades y no un interruptorTesis de este ensayo

BIBLIOGRAFÍA Y PISTAS PARA SEGUIR

Los dos experimentos del centro

Transformers, atención y arquitectura

Predicción y compresión

Qué clase de cosa es "entender" (la sección 27)

Significado y grounding

Representaciones y multimodalidad

Aprendizaje, generalización y medición

Aproximación de funciones


Escrito con ayuda de una IA, en respuesta a un ensayo escrito con ayuda de una IA, por un DJ que abrió la caja buscando matrices y encontró un tablero que nadie había enseñado.

La IA que ayudó a escribir esto la hace una empresa con dinero puesto en la respuesta. Ver la sección 29. Todo lo demás está citado para que no tengas que confiar en ninguno de los dos.