El resultado
GPT-6 Astra (Max) encabeza la tabla Code Arena: WebDev de Arena.ai con 1.797 puntos, por delante de Claude Fable 5.1 (Max) con 1.762 y de Claude Opus 5 (Max) con 1.688. Qwen3.8-Max-0902, de Alibaba, es cuarto con 1.686, y Kimi K3 (Max), de Moonshot, quinto con 1.674. La tabla se actualizó por última vez el 5 de septiembre y refleja 650.961 votos sobre 126 modelos.
OpenAI lanzó Astra el 3 de septiembre, así que se trata de una posición conseguida en dos días de votación.
Cómo funciona la tabla
Code Arena es una clasificación tipo Elo alimentada por votación pública. Un visitante propone una tarea de desarrollo web, recibe dos intentos anónimos y vota por el que prefiere; las identidades de los modelos se revelan después del voto. Arena señala que las tareas incluyen flujos de programación con agentes que exigen razonamiento en varios pasos y uso de herramientas, según resumió CryptoBriefing.
Ese diseño tiene una virtud real y un defecto real, y aquí importan los dos.

Qué significan y qué no significan 35 puntos
La virtud es que las tareas no son un conjunto fijo contra el que un laboratorio pueda entrenar. Nadie puede memorizar la evaluación, porque la evaluación es lo que un desconocido escribió esta mañana.
El defecto es qué mide realmente un voto. El votante mira brevemente dos resultados renderizados y elige uno. Eso premia la salida que parece terminada: maquetaciones completas, estilos plausibles, estructura segura de sí misma. No premia el código correcto en condiciones que el votante no probó, seguro frente a entradas que el votante no dio, ni mantenible por otra persona dentro de seis meses. Una diferencia de 35 puntos Elo en una tabla de preferencias dice qué salida gustó más, y ahí se acaba.
Conviene añadir que una puntuación solo significa algo frente a otras capturadas el mismo día. Estas tablas se mueven de forma continua conforme llegan votos, y la distancia entre el primero y el segundo el 5 de septiembre no es un hecho duradero sobre ninguno de los dos modelos.
El ángulo del precio
Los dos modelos de cabeza tienen precios idénticos: 10 dólares por millón de tokens de entrada y 50 por millón de salida, con ventanas de contexto de un millón de tokens, según el relato de la tabla que hace CryptoBriefing. Esa es la parte con consecuencias comerciales: en una tabla que muchos compradores consultan de verdad, el nuevo líder no ha llegado con un sobreprecio.

Dónde quedan los modelos chinos
Que el cuarto y el quinto puesto sean para Qwen3.8-Max y Kimi K3 es el hallazgo más silencioso. Ambos quedan por detrás de los líderes, pero por menos que la distancia entre el primero y el tercero, en una tabla votada por quien se presentó y no por el banco de pruebas interno de un laboratorio.
Qué vigilar
Si Astra mantiene la posición conforme crezca el número de votos: las posiciones tempranas en tablas de preferencia son ruidosas, y un modelo de dos días tiene una ventaja de novedad que se desvanece. La señal más informativa será dónde estén estos cinco modelos en la misma tabla dentro de un mes, y si algo con pesos publicados cierra la distancia que queda.