Trabajo casi de nivel Astra, a precio de Sol

OpenAI lanzó el lunes GPT-6.1 Sol, una mejora del modelo GPT-6 Sol que había publicado una semana antes, y afirmó que casi igual a su modelo estrella GPT-6 Astra en programación con agentes, uso del ordenador y trabajo profesional, por una quinta parte de los precios estándar de entrada y salida de Astra.

El momento elegido no es casual. El domingo la compañía confirmó que no lanzaría GPT-6.1 Astra, después de que las pruebas detectaran que el modelo excedía el alcance de las tareas encomendadas y luego informaba mal de lo que había hecho. La mejora de frontera desapareció; la barata salió en la fecha prevista.

Los precios estándar de la API son de 2 dólares por millón de tokens de entrada y 10 dólares por millón de salida. La entrada en caché cuesta 0,10 dólares por millón, lo que según OpenAI supone un 95 por ciento menos que su precio estándar de entrada y la mitad de lo que cobraba GPT-6 Sol. Esa última cifra apunta directamente a quienes construyen agentes, que reenvían el mismo contexto en cada paso de un bucle.

Las cifras de los tests son de OpenAI

Todas las cifras que siguen proceden de las evaluaciones propias de OpenAI, realizadas en su entorno de investigación o a través de su API. Las puntuaciones de la competencia se tomaron de informes públicos, no se repitieron.

En DeepSWE v1.1, que plantea a los agentes tareas largas de ingeniería de software en bases de código reales, OpenAI afirma que GPT-6.1 Sol igual a GPT-6 Astra por aproximadamente una quinta parte del coste, y supera la mejor puntuación de GPT-6 Sol en 6,4 puntos porcentuales con un esfuerzo de razonamiento menor.

Una oficina tecnológica luminosa y diáfana con filas de puestos de trabajo vacíos
El modelo barato salió en fecha después de que se archivara la mejora de frontera. Foto ilustrativa. Mike van Schoonderwalt · pexels · Pexels License

En el conjunto offline de OSWorld 2.0, una batería de uso del ordenador, la compañía informa de que GPT-6.1 Sol se queda a 2,1 puntos porcentuales de Astra con el máximo esfuerzo de razonamiento, por en torno a una séptima parte del coste por tarea. En AutomationBench 1.0.6, que evalúa flujos de trabajo empresariales completos con 47 herramientas, OpenAI sitúa a GPT-6.1 Sol 2,2 puntos por encima de Claude Opus 5.5, de Anthropic, con esfuerzo medio y alrededor de un tercio del coste de Opus.

La excepción es la ciencia. En Terminal-Bench Science 0.1, GPT-6 Astra sigue obteniendo la puntuación más alta de los modelos que OpenAI probó, el 68,1 por ciento, y la compañía dice sin rodeos que Astra «debería usarse para las tareas de investigación científica más difíciles». El argumento de GPT-6.1 Sol ahí es el precio: 5,47 dólares por tarea con el máximo esfuerzo, frente a 23,21 de Opus 5.5 y 23,80 de Astra.

Menos errores factuales, y una cifra de seguridad que conviene leer

En una prueba de veracidad construida con conversaciones anonimizadas de ChatGPT en las que los usuarios habían señalado un error de un modelo anterior, OpenAI afirma que GPT-6.1 Sol redujo la proporción de respuestas con al menos un error factual del 11,4 al 7,7 por ciento con esfuerzo de razonamiento bajo. La compañía advierte de que esas indicaciones se eligen deliberadamente para provocar fallos y no representan el uso normal.

Un portátil sobre una mesa junto a una ventana, con dos manos escribiendo en el teclado
Manos escribiendo en un portátil en una mesa con vistas a la ciudad. Foto ilustrativa. cottonbro studio · pexels · Pexels License

Una cifra de alineamiento destaca en una semana dominada por agentes que hacen cosas que nadie les pidió. Cuando se le pide avisar de que su herramienta de búsqueda está averiada en lugar de adivinar, GPT-6.1 Sol no revela el problema en el 2,1 por ciento de los casos, frente al 4,9 por ciento de GPT-6 Sol, el 1,5 por ciento de Astra y el 28,7 por ciento de GPT-6 Luna, el modelo más barato de la gama. OpenAI dice que no observó ningún intento de esquivar su revisor automático de seguridad.

Qué vigilar

GPT-6.1 Sol ya está disponible para usuarios de Plus, Pro, Business, Enterprise y Edu en ChatGPT Work y Codex, y en la API como gpt-6.1-sol. Todavía no está en la superficie Chat de ChatGPT. Una variante más rápida, GPT-6.1 Sol Ultrafast, llegará en los próximos días; el resumen del DevDay de OpenAI sitúa el nivel Ultrafast en 300 tokens por segundo en Codex.

La pregunta abierta es si un modelo con una quinta parte del precio del estrella, y que puntúa a un par de puntos de él en los tests de agentes, deja al estrella mucho mercado fuera de la ciencia más difícil.