Un 40% que los laboratorios no ven

Artificial Analysis publicó el 4 de septiembre la versión 4.2 de su Índice de Inteligencia, y el cambio principal no es una puntuación. Los conjuntos de prueba reservados suponen ya el 40% del peso del índice, el doble que en la versión 4.1. Esa parte reservada la componen AA-Briefcase, AA-Omniscience y las soluciones de CritPt, y Artificial Analysis afirma que la proporción volverá a crecer en la versión 5.

El razonamiento es sencillo. Un índice construido con pruebas públicas puede optimizarse a propósito o por contaminación de los datos de entrenamiento, y un modelo que en la práctica ya ha visto el examen no está siendo medido. Mantener las respuestas en privado es la única defensa de un evaluador independiente.

Artificial Analysis describe la v4.2 como una entrega intermedia que adelanta partes de la versión 5 prevista para que el índice siga el ritmo de la frontera.

Qué entra y qué sale

Se añadieron dos evaluaciones. AA-Briefcase es el conjunto propio de trabajo intelectual con agentes, construido con expertos del sector en torno a proyectos realistas de varios pasos y calificado con una mezcla de rúbrica y comparación por pares en éxito de la tarea, calidad analítica y presentación. GDP.pdf, creado por Surge AI, evalúa el razonamiento documental profesional en un solo turno sobre 100 PDF de diez ámbitos, y exige reunir pruebas repartidas por 4.592 páginas de texto, tablas, gráficos, notas al pie y exclusiones.

Una analista revisando gráficos en un monitor grande
AA-Briefcase califica el trabajo con agentes por éxito de la tarea, calidad analítica y presentación. Leeloo The First · pexels · Pexels License

Salió una evaluación. GPQA Diamond, el conjunto de razonamiento científico de nivel de posgrado que lleva dos años apareciendo en las fichas de los modelos de frontera, se retiró: Artificial Analysis lo califica de evaluación excepcional que ya está saturada. Junto al cambio, AA-LCR pasó a la versión 1.1 con su propio prompt de calificación y claves de respuesta corregidas, y GDPval-AA v2 y AA-Briefcase recibieron mejor muestreo y una escala Elo reanclada para que las puntuaciones se mantengan estables cuando lleguen modelos nuevos.

El orden tras la reconstrucción

En el índice reconstruido lidera Claude Fable 5.1, de Anthropic. GPT-6 Astra, de OpenAI, queda segundo, con lo que Artificial Analysis describe como una ganancia de unos cuatro puntos respecto a la entrada anterior de OpenAI. Meta es el tercer laboratorio, por delante de SpaceXAI, Kimi de Moonshot, Z.AI y Google.

Son mediciones independientes, no cifras facilitadas por los fabricantes: Artificial Analysis ejecuta cada evaluación por su cuenta a través de las API públicas de los modelos. Esa es exactamente la razón por la que un número así pesa cuando la tabla de resultados de un laboratorio no lo hace.

Gráficos impresos y una hoja de cálculo sobre una mesa
Las puntuaciones de la versión 4.2 no son comparables con las de la 4.1 porque cambiaron componentes y pesos. Max Vakhtbovych · pexels · Pexels License

Por qué importan aquí los números de versión

Conviene decir una consecuencia con claridad. Como cambiaron los componentes y los pesos, una puntuación de la v4.2 no se puede comparar con una de la v4.1. Un modelo que parezca haber ganado o perdido terreno entre ambas puede haber sido simplemente medido de otra manera, y retirar una prueba saturada comprime mecánicamente la parte alta del rango.

Lo que hay que vigilar es la versión 5, en la que Artificial Analysis ha dicho que la parte reservada crecerá aún más. El intercambio que acepta es transparencia por integridad: cuanto más del índice queda fuera del escrutinio público, más difícil es manipularlo y más difícil es auditarlo.