La prueba
Epoch AI publicó el 23 de septiembre los resultados de su Furniture Assembly Benchmark, que fotografía tres montajes de IKEA a medio hacer con errores introducidos a propósito y pide al modelo que los encuentre.
El conjunto son 60 imágenes. Al modelo se le entrega el manual de montaje junto con las fotografías, más una herramienta de zoom y un intérprete de Python, y debe identificar cada paso en que se cometió un error y dar una descripción razonable de cada uno. La corrección es en varios pasos: el modelo tiene que nombrar los pasos correctos, y un corrector basado en un modelo de lenguaje —GPT-5.6 Sol— comprueba si la descripción del error es acertada, con un criterio deliberadamente indulgente.
El resultado
GPT-6 Astra obtiene un 80 por ciento. Claude Fable 5.1 le sigue con un 70, y Claude Opus 5 con un 61.
El movimiento es lo noticioso. El mejor resultado en noviembre de 2025 fue del 28 por ciento, logrado por Claude Opus 4.5. Diez meses después la frontera está en 80.

La velocidad, que es la otra mitad
Astra tarda además una mediana de tres minutos por tarea, lo que Epoch describe como lo más rápido de cualquier modelo evaluado: entre dos y diez veces más rápido que los que lideraban antes.
Esa combinación es lo que hace interesante la puntuación, y no simplemente alta. Un modelo que razona hasta la respuesta correcta en veinte minutos por fotografía es un resultado de investigación. Uno que lo hace en tres se acerca a algo que podría estar detrás de una cámara.
Epoch es clara en que todavía no lo está: sigue siendo demasiado lento para ayudar en tiempo real durante el montaje, aunque los investigadores sugieren que la capacidad podría acabar trasladándose a reparaciones de coches o de electrodomésticos.
Qué mide en realidad y qué no
La tarea es visual y espacial: comparar la fotografía de un objeto físico con un diagrama de cómo debería ser y encontrar la divergencia. Es un indicador razonable del tipo de percepción anclada que ha ido por detrás del razonamiento textual, y es difícil de hacer trampa memorizando, porque los errores se introducen a propósito.
Las salvedades son reales. El banco de pruebas usa tres muebles, lo que la propia Epoch señala que limita hasta dónde generaliza el resultado al razonamiento físico en general. El corrector es un modelo de lenguaje. Y Epoch construyó y ejecutó el banco de pruebas ella misma, lo que lo convierte en una evaluación independiente de los modelos de los laboratorios, pero no en una evaluación independiente de la metodología de Epoch.

Por qué merece atención
Porque es uno de los pocos bancos de pruebas cuyo modo de fallo es legible para cualquiera. No hace falta saber qué significa la puntuación para mirar la foto de una estantería con un panel al revés y entender qué se le pidió al modelo.
Es además un caso poco común en que quien informa de la cifra que se ha movido es un evaluador independiente y no un proveedor. El salto del 28 al 80 es la medición que Epoch hace de modelos ajenos, no el relato de ninguna empresa sobre sí misma.
Qué vigilar
Si la mediana de tres minutos sigue bajando, y si alguien amplía el conjunto más allá de tres montajes. La cuestión de la generalización es la que el resultado actual no puede responder.