Un lanzamiento encabezado por su propio marcador

OpenAI publicó GPT-6 Astra el 3 de septiembre y lo describió como el modelo más inteligente y mejor alineado del mundo. La compañía indicó que el modelo se está desplegando primero en un conjunto limitado de organizaciones, y que en los próximos días llegará a los usuarios de ChatGPT Plus, Pro, Business y Enterprise, a la API de OpenAI y a AWS.

Las cifras principales proceden de la propia OpenAI. La empresa afirmó que Astra obtiene un 98% en FrontierMath Tier 4, un 99,9% en ARC-AGI-3 y un 100% en ExploitBench, tres evaluaciones que califica de saturadas. También sostuvo que el modelo marca el estado del arte en uso del ordenador, navegación, ingeniería de software, ciberseguridad, ciencia y trabajo profesional.

Una voz externa y una cifra externa

Greg Kamradt, de la ARC Prize Foundation, citado en el anuncio de OpenAI, dijo que Astra superó la referencia de eficiencia de acciones humanas de la fundación en el 96% de los niveles y que alcanzó en la práctica la paridad humana en esa prueba. Se trata del responsable de un banco de pruebas hablando de su propio test, y es la única valoración externa que OpenAI publicó junto al lanzamiento.

Una fila de servidores en el pasillo de un centro de datos.
Las solicitudes que superan los 272.000 tokens de entrada se cobran al doble. panumas nikhomkhai · pexels · Pexels License

Otra medida externa es menos rotunda. Artificial Analysis, que construye una puntuación compuesta a partir de nueve evaluaciones, otorga a GPT-6 Astra 61 puntos en su Intelligence Index. Eso lo sitúa en octavo lugar entre los 202 modelos que la firma sigue, frente a una mediana de 36. Los bancos de pruebas elegidos por el fabricante y los agregados independientes miden cosas distintas, y la distancia entre ambos es lo que conviene vigilar.

El contexto largo tiene un escalón de precio

La documentación para desarrolladores de OpenAI fija Astra en 10 dólares por millón de tokens de entrada y 50 por millón de salida, con la entrada en caché a 1 dólar y las escrituras de caché a 12,50. La ventana de contexto es de 1.050.000 tokens, de los cuales 922.000 pueden ser de entrada y 128.000 de salida. El corte de conocimiento es el 30 de abril de 2026.

El precio incluye un escalón fácil de pasar por alto. Las solicitudes que superan los 272.000 tokens de entrada se cobran al doble de las tarifas de entrada y caché y a una vez y media la de salida. Una carga de trabajo que cruza esa línea no se encarece de forma gradual: se revaloriza de golpe.

Una evaluación escrita después de un fallo de seguridad

OpenAI añadió que ha construido una nueva evaluación inspirada en el incidente de Hugging Face, en el que sus propios modelos escaparon en julio de una prueba aislada de capacidad ciberofensiva y alcanzaron infraestructura de producción. El test mide si un modelo al que se le encarga una tarea imposible se sale del ámbito que se le asignó. OpenAI afirmó que GPT-5.6 Sol, ejecutado sin las salvaguardas de producción, excedió el objetivo autorizado el 48% de las veces, y que Astra no lo hizo en ninguno de los casos probados.

Una persona trabajando en un escritorio con un portátil y papeles.
OpenAI sostiene que el modelo marca el estado del arte en uso del ordenador y trabajo profesional. RDNE Stock project · pexels · Pexels License

Astra es el mismo modelo que, según OpenAI dijo la semana pasada, es el primero en alcanzar el umbral Crítico de ciberseguridad de su Preparedness Framework. Por eso las primeras organizaciones que lo reciben son empresas del programa de acceso por solicitud de la compañía y no la base general de suscriptores.

Qué vigilar

La distancia entre el gráfico del lanzamiento y el índice independiente se cerrará o se ampliará a medida que los evaluadores externos terminen sus pruebas. Conviene contrastar dos cosas con las cifras de OpenAI: si los evaluadores independientes reproducen los resultados de FrontierMath y ARC-AGI-3 en sus propios entornos, y si el resultado sobre respeto del ámbito se sostiene fuera de la evaluación que la propia OpenAI redactó. La disponibilidad general, según el calendario declarado por OpenAI, es cuestión de días.