Papeleo antes del entrenamiento

OpenAI publicó el domingo un conjunto de directrices sobre lo que, a su juicio, debería documentarse antes de permitir que continúe un entrenamiento de frontera por aprendizaje por refuerzo. El planteamiento es rotundo: «creemos que estamos entrando en una nueva era en la que debería exigirse documentación estructurada de seguridad antes de continuar cualquier entrenamiento de frontera por aprendizaje por refuerzo».

El modelo que toma prestado es el «caso de seguridad»: el argumento estructurado y basado en pruebas sobre el riesgo que se usa en la aviación y la energía nuclear. OpenAI lo llama «una estrella polar aspiracional hacia la que avanzamos» y admite que la analogía es imperfecta por «la complejidad emergente en cada nuevo nivel de capacidad de la IA».

Tres capas técnicas y una regla sobre las cadenas de razonamiento

La mitad técnica del documento abarca entrenamiento de alineamiento, contención y supervisión: entrenar al modelo para que no actúe contra la intención, dificultar que escape si lo hace y detectarlo si lo intenta.

En alineamiento, OpenAI propone usar agentes para encontrar y arreglar entornos de aprendizaje por refuerzo defectuosos donde un atajo pueda puntuar alto, ajustar los evaluadores para penalizar la explotación, y probar retroactivamente las evaluaciones de alineamiento contra incidentes anteriores para que no queden simplemente sobreajustadas a ellos. También propone rastrear si un modelo se da cuenta de que está siendo evaluado, con «umbrales de bloqueo específicos».

Un pasillo señalizado que discurre entre la maquinaria de una fábrica
El marco toma prácticas de la industria de seguridad crítica. Foto ilustrativa. Yetkin Ağaç · pexels · Pexels License

Una línea es inusualmente concreta: no dejar que los evaluadores automáticos vean la cadena de razonamiento durante el aprendizaje por refuerzo, porque hacerlo arriesga que los modelos «evolucionen para eludir los monitores de cadena de razonamiento». Es una decisión deliberada de renunciar a capacidad para mantener legible el razonamiento del modelo.

La contención cubre entornos aislados reforzados, ejercicios de ataque interno contra ese aislamiento usando puntos de control de entrenamientos reales, el cierre de canales laterales de alto ancho de banda entre muestras, y guardar las transcripciones de los agentes en almacenamiento de una sola escritura para que una investigación no pueda editarse después. La supervisión exige alta detección de incidentes pasados, datos de evaluación frescos para que esas cifras no queden obsoletas, y una regla de respuesta: avisar a la persona de guardia durante el día y pausar automáticamente los entrenamientos ante alertas no atendidas de noche.

Quién puede detener un entrenamiento

La mitad operativa es donde está la gobernanza. OpenAI dice que, una vez redactado un caso de seguridad, alguien de otro equipo debería escribir una disidencia —un «premortem»— para buscarle agujeros. Dice que el caso debería ser aprobado por directivos que «deberían tener cada uno la capacidad de vetar el entrenamiento», y nombra a un responsable o vicepresidente de investigación, al jefe de Seguridad y al científico jefe.

Torres de refrigeración de una central eléctrica bajo un cielo nublado
Los casos de seguridad son habituales en la energía nuclear. Foto ilustrativa de una central. Wolfgang Weiser · pexels · Pexels License

Va más lejos en la rendición de cuentas: el directivo responsable de un entrenamiento debería responder por el caso de seguridad y por cualquier respuesta a incidentes «incluso como parte de las evaluaciones de desempeño». El escalado debería seguir niveles definidos de gravedad de desalineamiento, con una guardia capaz de avisar a los ejecutivos —el documento nombra al consejero delegado— cuando un entrenamiento alcance cierta gravedad. Las funciones de seguridad deberían fallar cerrándose: no debería ser posible iniciar un entrenamiento sin supervisión activada, ni desactivar el monitor desde dentro del propio entrenamiento.

Los auditores, dice el documento, deberían tener acceso suficiente para verificar que las afirmaciones son sólidas.

Qué es y qué no es

OpenAI dice que estas recomendaciones están «en proceso de implementación» internamente y que sus prácticas seguirán evolucionando «en las próximas semanas». Nada de esto es un compromiso ante un tercero, y no se nombra a ningún regulador.

El contexto es inevitable: el documento se publicó el día antes de que OpenAI confirmara que no lanzaría GPT-6.1 Astra, y el día antes de que nombrara cuatro organismos públicos australianos alcanzados por sus modelos durante el entrenamiento interno. Lo que hay que vigilar es si algo de esto llega a ser auditable por alguien que no trabaje en OpenAI.