Qué ha cambiado

Artificial Analysis publicó la versión 4.3 de su Intelligence Index el 7 de septiembre, dos días después de lanzar la versión 4.2. La firma describe ambas como entregas provisionales adelantadas de una versión 5 planificada, y el ritmo es significativo: el índice se revisa más deprisa de lo que se publican los modelos que clasifica.

Se movieron dos evaluaciones. Terminal-Bench pasó de la v2.1 a la v4.0, que el responsable describe como tareas de terminal más difíciles en varios dominios. Y una prueba llamada τ³-Banking fue sustituida por AutomationBench-AA, un test de automatización de flujos de trabajo empresariales con conjunto de prueba privado, que hereda el mismo peso del 5%.

Los pesos por categoría no se movieron: Agentes 30%, General 30%, Programación 20% y Razonamiento científico 20%. Lo que sí se movió es cuánto del índice no puede ver un laboratorio. Las evaluaciones con conjuntos de prueba privados suponen ahora el 45% del total, frente al 40% de la v4.2, que ya duplicaba la proporción de la v4.1.

Notas manuscritas cubriendo una pizarra de oficina
Terminal-Bench pasó de la v2.1 a la v4.0 en esta revisión. Imagen de archivo. K · pexels · Pexels License

La clasificación

En la v4.3, Claude Fable 5.1 y GPT-6 Astra empatan en el primer puesto con 53 puntos. Le siguen Claude Opus 5 con 51, Claude Fable 5 con 50, Muse Spark 1.3 de Meta con 48 y GPT-5.6 Sol con 47.

Eso supone un cambio respecto a la v4.2, publicada dos días antes, en la que Fable 5.1 lideraba en solitario. Artificial Analysis atribuye el desplazamiento a los puntos en los que ambos modelos difieren: Fable 5.1 puntúa más alto en AA-Briefcase y SciCode, mientras que Astra puntúa más alto en Terminal-Bench v4.0 y en la recién añadida AutomationBench-AA. Al meter una prueba de terminal más dura y un conjunto de automatización agéntica, la distancia se cierra.

El índice se apoya ahora en diez evaluaciones: AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA-Omniscience y AA-LCR v1.1.

La cifra que hay debajo del empate

El dato más útil no es el empate sino lo que cuesta. Artificial Analysis sitúa a GPT-6 Astra en 3,26 dólares por tarea frente a los 7,63 de Claude Fable 5.1: un 57% menos para alcanzar la misma puntuación medida.

Es el tipo de comparación sobre la que un comprador puede actuar, y también el tipo que necesita sus matices. El coste por tarea depende de cuántos tokens gasta un modelo razonando, lo que varía según la mezcla de tareas; otro conjunto de diez evaluaciones daría otra proporción.

Compañeros reunidos alrededor de una mesa con portátiles abiertos
Dos revisiones en dos días cambiaron la clasificación sin que cambiara ningún modelo. Imagen de archivo. Christina Morillo · pexels · Pexels License

Cómo leer un índice que se mueve tanto

Son mediciones independientes, no puntuaciones aportadas por los fabricantes, que es lo que las hace dignas de lectura. Pero dos revisiones en dos días recuerdan lo que en realidad es un índice compuesto: una opinión ponderada sobre qué capacidades cuentan. Cambia las pruebas que lo componen y la clasificación cambia sin que ningún modelo cambie.

La proporción creciente de conjuntos de prueba privados responde directamente a esa fragilidad. Si casi la mitad del índice no se puede entrenar, una puntuación es más difícil de fabricar. También significa que el público no puede auditar esa mitad: el equilibrio que ha elegido Artificial Analysis, y que conviene nombrar.

Qué vigilar

Si la v5 llega con los mismos componentes o con otra reorganización, y si el empate entre Astra y Fable sobrevive. Un primer puesto que cambia de manos por un cambio de pruebas, y no por un modelo nuevo, dice tanto del índice como de los modelos.