Un acuerdo de investigación, no un lanzamiento de producto
OpenAI dijo el 6 de octubre que se está asociando directamente con un pequeño número de empresas de software para convertir sus flujos de trabajo más difíciles en tareas de entrenamiento y evaluación para sus agentes. La primera es Ironclad, una plataforma de ciclo de vida de contratos. El objetivo, según OpenAI, es entrenar modelos “para entender las reglas de negocio de una empresa, ejecutar flujos de varios pasos y verificar que su trabajo cumple los requisitos originales”.
Es un acuerdo distinto de una asociación de API. Ironclad aportó instancias alojadas de su propio producto para que los modelos practicaran en ellas, y sus empleados —más personal de OpenAI que usa Ironclad internamente— ayudaron a identificar 11 tareas de trabajo jurídico, comercial y de compras. Los ejemplos citados incluyen montar acuerdos de confidencialidad, crear procesos de aprobación de compras y actualizar una cláusula legal reutilizable para que refleje la jurisdicción que elija quien la solicita. OpenAI estima que cada una llevaría a un usuario experimentado entre 30 y 40 minutos.

Las cifras, y qué miden
Cada tarea se puntuó frente a entre 8 y 50 criterios según su complejidad. OpenAI dijo que después sus investigadores construyeron tareas sintéticas de entrenamiento en torno a flujos representativos y usaron aprendizaje por refuerzo para mejorar los modelos mediante la práctica.
Comparando GPT-6 Astra con razonamiento Max y GPT-5.6 Sol con razonamiento High —los ajustes en los que cada uno puntuó más alto—, OpenAI informó de una puntuación media de rúbrica del 55,0% para Astra frente al 41,6% de Sol, y un tiempo medio estimado por intento de 19,2 minutos frente a 37,0. Un modelo interno no publicado usado en el desarrollo de Astra obtuvo un 63,7%.
Las notas al pie importan. OpenAI precisa que los resultados cubren esas 11 tareas y no todos los flujos de Ironclad, y que los tiempos son “estimaciones simuladas basadas en velocidades supuestas de procesamiento y generación del modelo, no ahorros de tiempo medidos en clientes”. Las tareas sintéticas de entrenamiento se construyeron a partir de contratos de la base de datos EDGAR de la SEC tras filtrar información personal; OpenAI dice que no usó datos de clientes, sus propios contratos internos ni contratos no públicos de clientes de Ironclad.

Por qué merece atención
La cifra del titular es menos interesante que el montaje. A los laboratorios de frontera se les están acabando las tareas difíciles y verificables que se parezcan a trabajo real, y los benchmarks públicos se contaminan o se saturan. Comprar acceso al producto en vivo de un proveedor, a sus expertos de dominio y a su definición de éxito es una respuesta a eso, y entrega al laboratorio un conjunto de evaluación privado que nadie más puede ejecutar.
La directora de tecnología de Ironclad, Sunita Verma, formuló el límite más que el logro: “Los agentes necesitan entender todo el ciclo de vida de la contratación, incluido cómo se conectan los flujos de negocio preservando los controles de los que dependen los equipos”. El propio texto de OpenAI va más lejos y dice que el modo de fallo —un agente que pierde el hilo de una regla de negocio a mitad de camino— “subraya por qué la supervisión humana sigue importando” y por qué una plataforma de contratación completa “sigue siendo esencial”.
OpenAI invita a más empresas de software a presentarse, pidiendo una tarea concreta que falle, pruebas de dónde fallan los agentes en ella y personas que conozcan el trabajo. Lo que hay que vigilar es cuántos proveedores deciden que entregar sus flujos más difíciles a un laboratorio de frontera es un buen trato.