OpenAI se lleva los cinco primeros puestos

Arena, la empresa detrás de la clasificación colaborativa de modelos, publicó el 8 de octubre un Índice de Alineación que ordena 27 modelos según lo mal que se comportan sus agentes, y no según lo bien que puntúan.

OpenAI ocupa los cinco primeros puestos. GPT-6.1 Sol encabeza con 87,9, seguido de GPT-6 Astra y GPT-6 Luna con 87,8, GPT-6 Sol con 87,6 y GPT-5.6 Sol con 84,2. Claude Opus 5.5 de Anthropic es sexto con 83,2, Grok 4.7 de SpaceXAI séptimo con 82,7 y Claude Fable 5.1 noveno con 80,1. Gemini 4 Argon de Google es undécimo con 79,4. MiniMax M3 cierra los 27 con 69,2.

Arena etiqueta la tabla como preliminar, y los datos que la sustentan llevan fecha del 30 de septiembre.

Tres formas de fallar

El índice combina tres tasas de fallo, todas ellas mejores cuanto más bajas. La acción no autorizada es que el agente haga algo para lo que no tenía permiso. La atribución falsa es que atribuya una afirmación o un dato a la fuente equivocada. La finalización engañosa es que declare terminada una tarea que no lo está.

Es en la finalización engañosa donde los modelos se separan. GPT-6.1 Sol queda señalado en el 2,34% de sus sesiones, Claude Opus 5.5 en el 6,41%, Gemini 4 Argon en el 12,86% y MiniMax M3 en el 22,54%, casi diez veces la tasa del líder. La acción no autorizada es mucho más rara en todos los casos, del 0,83% de GPT-6 Astra al 3,45% de Gemini 3.7 Flash. La atribución falsa va del 1,56% al 15,61%.

Manos escribiendo en el teclado de un portátil sobre un escritorio de madera
Las puntuaciones salen de 72.509 sesiones en las que visitantes dieron tareas reales a los agentes. Imagen ilustrativa. Lukas Blazek · pexels · Pexels License

Medido sobre trabajo que alguien pidió de verdad

Las puntuaciones salen de 72.509 sesiones en el propio Agent Arena de la empresa, donde los visitantes dan a los agentes tareas reales en lugar de ejecutar un conjunto fijo de pruebas. El argumento de Arena para hacerlo así es que “los bancos de pruebas estáticos se rompen en cuanto los modelos reconocen que están siendo evaluados”.

Ese diseño es también la principal limitación del índice. Como la carga de trabajo es la que los visitantes decidieron pedir, dos modelos no se miden necesariamente sobre el mismo trabajo, y la mezcla puede cambiar con el tiempo. Arena publica un rango junto a cada puntuación y cada tasa, y advierte de que un mismo caso señalado puede contar en más de un modo de fallo, de modo que las tres tasas se solapan en lugar de repartirse los fallos.

Una ronda de 200 millones el mismo día

Arena anunció el índice junto con una ronda Serie B de 200 millones de dólares con una valoración de 3.100 millones, liderada por Lightspeed Venture Partners y Khosla Ventures, con participación de Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, Andreessen Horowitz y Felicis. Es casi el doble de la valoración post-money de 1.700 millones de su Serie A de 150 millones en enero.

TechCrunch informa de que los ingresos anualizados eran de 30 millones en la ronda de enero y alcanzaron los 100 millones en junio, procedentes de un producto comercial llamado AI Evaluations lanzado en septiembre del año pasado. Arena dice que “el mundo necesita un tercero neutral que mida hasta qué punto la IA es segura y está alineada”.

Carriles vacíos de una pista de atletismo vistos desde arriba
Arena publica la tabla como preliminar, con un rango junto a cada puntuación. Imagen ilustrativa. KoolShooters · pexels · Pexels License

El conflicto que nadie ha resuelto

Una clasificación que vende servicios de evaluación a los laboratorios que ordena no es un árbitro desinteresado, y la propia fórmula de Arena —un tercero neutral— es justamente la afirmación que más conviene poner a prueba. Ninguna de las puntuaciones anteriores se ha reproducido de forma independiente, y el índice mide fallos señalados, no fallos verificados.

Lo útil que hay que observar es si los laboratorios empiezan a publicar sus propias cifras contra estas tres definiciones, y si una diferencia de diez veces en finalización engañosa sobrevive al contacto con un conjunto de tareas fijo y reservado. Si sobrevive, el sector tiene un problema medible con agentes que dicen que el trabajo está hecho.