El resultado

GPT-6 Astra (Max) encabeza la tabla Code Arena: WebDev de Arena.ai con 1.797 puntos, por delante de Claude Fable 5.1 (Max) con 1.762 y de Claude Opus 5 (Max) con 1.688. Qwen3.8-Max-0902, de Alibaba, es cuarto con 1.686, y Kimi K3 (Max), de Moonshot, quinto con 1.674. La tabla se actualizó por última vez el 5 de septiembre y refleja 650.961 votos sobre 126 modelos.

OpenAI lanzó Astra el 3 de septiembre, así que se trata de una posición conseguida en dos días de votación.

Cómo funciona la tabla

Code Arena es una clasificación tipo Elo alimentada por votación pública. Un visitante propone una tarea de desarrollo web, recibe dos intentos anónimos y vota por el que prefiere; las identidades de los modelos se revelan después del voto. Arena señala que las tareas incluyen flujos de programación con agentes que exigen razonamiento en varios pasos y uso de herramientas, según resumió CryptoBriefing.

Ese diseño tiene una virtud real y un defecto real, y aquí importan los dos.

Un programador escribiendo código en la pantalla de un portátil
La tabla la votan visitantes que comparan dos intentos anónimos de la misma tarea. Imagen de archivo. Lukas Blazek · pexels · Pexels License

Qué significan y qué no significan 35 puntos

La virtud es que las tareas no son un conjunto fijo contra el que un laboratorio pueda entrenar. Nadie puede memorizar la evaluación, porque la evaluación es lo que un desconocido escribió esta mañana.

El defecto es qué mide realmente un voto. El votante mira brevemente dos resultados renderizados y elige uno. Eso premia la salida que parece terminada: maquetaciones completas, estilos plausibles, estructura segura de sí misma. No premia el código correcto en condiciones que el votante no probó, seguro frente a entradas que el votante no dio, ni mantenible por otra persona dentro de seis meses. Una diferencia de 35 puntos Elo en una tabla de preferencias dice qué salida gustó más, y ahí se acaba.

Conviene añadir que una puntuación solo significa algo frente a otras capturadas el mismo día. Estas tablas se mueven de forma continua conforme llegan votos, y la distancia entre el primero y el segundo el 5 de septiembre no es un hecho duradero sobre ninguno de los dos modelos.

El ángulo del precio

Los dos modelos de cabeza tienen precios idénticos: 10 dólares por millón de tokens de entrada y 50 por millón de salida, con ventanas de contexto de un millón de tokens, según el relato de la tabla que hace CryptoBriefing. Esa es la parte con consecuencias comerciales: en una tabla que muchos compradores consultan de verdad, el nuevo líder no ha llegado con un sobreprecio.

Una diseñadora trabajando en la maquetación de un sitio web en su escritorio
Las puntuaciones de preferencia miden qué gustó más, no si el código es correcto. Imagen de archivo. cottonbro studio · pexels · Pexels License

Dónde quedan los modelos chinos

Que el cuarto y el quinto puesto sean para Qwen3.8-Max y Kimi K3 es el hallazgo más silencioso. Ambos quedan por detrás de los líderes, pero por menos que la distancia entre el primero y el tercero, en una tabla votada por quien se presentó y no por el banco de pruebas interno de un laboratorio.

Qué vigilar

Si Astra mantiene la posición conforme crezca el número de votos: las posiciones tempranas en tablas de preferencia son ruidosas, y un modelo de dos días tiene una ventaja de novedad que se desvanece. La señal más informativa será dónde estén estos cinco modelos en la misma tabla dentro de un mes, y si algo con pesos publicados cierra la distancia que queda.