Antes de la semana previa al lanzamiento

OpenAI publicó el martes un documento que expone cómo quiere que organizaciones externas evalúen sus modelos. La empresa lo describe como prioridades y principios para evaluaciones de seguridad rigurosas, seguras e independientes de modelos de frontera y de sus salvaguardas.

Lo sustancial es un cambio de calendario. Hasta ahora, los grupos externos entraban poco antes del lanzamiento de un modelo, para evaluar algo muy cercano al producto terminado. OpenAI dice ahora que los evaluadores podrán trabajar durante el entrenamiento, la evaluación y el despliegue, informó Bloomberg el martes.

Esto importa porque una evaluación previa al lanzamiento llega cuando ya se han tomado todas las decisiones caras. Un evaluador que ve el entrenamiento puede preguntar por elecciones que todavía se pueden revertir.

Quién podría hacerlo

OpenAI dice que negocia con grupos como METR y Redwood Research, según The Next Web, que informó de que no se ha confirmado ninguna alianza formal ni se ha revelado un calendario. Ambas organizaciones ya habían examinado un incidente en el que un modelo de OpenAI alcanzó en Hugging Face sistemas a los que no debía llegar.

Lama Ahmad, responsable de la relación de OpenAI con expertos externos en seguridad, expuso las condiciones que la empresa considera necesarias para esas revisiones: mecanismos de independencia, rigor científico, prácticas de seguridad y responsabilidades claras. OpenAI añade que algunos evaluadores podrían trabajar desde sus oficinas en las fases más delicadas.

Personas reunidas en torno a una mesa en una oficina
OpenAI dice que algunos evaluadores podrían trabajar desde sus oficinas. Imagen ilustrativa. Matheus Bertelli · pexels · Pexels License

Menos concreto que lo prometido por Altman

The Next Web señaló que el anuncio es más laxo que el compromiso que Sam Altman asumió diez días antes, cuando describió evaluadores independientes con escritorios, credenciales y ordenadores, y con derecho a publicar. El documento del martes menciona el acceso a las oficinas para el trabajo más delicado, pero no fija condiciones de acceso, derechos de publicación ni un socio con nombre.

La distancia entre ambas declaraciones es toda la cuestión. Un evaluador con credencial y sin derecho a publicar es un consultor. Un evaluador con derecho a publicar es un control.

La comparación de al lado

OpenAI no es el único laboratorio que reordena esto. La semana pasada Anthropic nombró a Accenture como evaluador externo, en un acuerdo en el que cada parte aporta 1.000 millones de dólares, admitiendo a la vez que pagar al propio examinador genera un problema de incentivos.

Una persona escribe en un portapapeles dentro de una instalación industrial
No se ha nombrado ningún socio ni revelado un calendario. Imagen ilustrativa. Daniel Andraski · pexels · Pexels License

Europa tiene otro modelo para la misma tarea. En la evaluación de la conformidad, el organismo que certifica un producto está acreditado por un regulador y no contratado por el fabricante, y no depende de este para su próximo contrato. Nada de lo anunciado hasta ahora por ninguno de los dos laboratorios estadounidenses funciona así.

Qué vigilar

Tres cosas mostrarán si esto es un cambio de gobernanza o de comunicación: si se nombra realmente a un socio, si ese socio puede publicar hallazgos sin el visto bueno de OpenAI, y si los evaluadores acceden a las decisiones de entrenamiento y no solo a la sala donde se enseñan los modelos terminados.