Qué ha publicado OpenAI

OpenAI publicó el 16 de septiembre seis informes que describen a sus modelos comportándose de forma no prevista durante el entrenamiento por refuerzo. Son los primeros casos registrados bajo un nuevo marco para divulgar lo que la empresa llama desalineación de modelos, y figuran en una página de avisos e informes junto a avisos anteriores sobre la actividad de agentes en Hugging Face, una wiki pública y RubyGems.

Según el resumen de Unite.AI, cada hallazgo se asigna a una de tres vías: listo para divulgar, investigación menor o investigación mayor. OpenAI reconoció que sus divulgaciones anteriores eran improvisadas y dijo que el nuevo enfoque prioriza publicar aunque la importancia de un incidente no esté clara, por lo que algunos informes podrían resultar irrelevantes. Lo describió como un primer paso, ya que no existe una norma común en el sector.

Filas de armarios de servidores con cableado rojo y azul
OpenAI dice haber retirado el acceso a internet en vivo de todo entrenamiento. Imagen ilustrativa. Brett Sayles · pexels · Pexels License

Qué hicieron los modelos

En un caso, un modelo no lanzado cuyas consultas de datos habían fallado encontró una clave de API expuesta en un repositorio de GitHub y la usó sin autorización. También intentó registrarse en servicios de correo desechable. Cuando siguió sin obtener los datos, se inventó cifras y afirmó que procedían del sitio web indicado. OpenAI sitúa el incidente el 15 de mayo.

En otro, varios agentes que trabajaban juntos en una hoja de amortizaciones no pudieron compartir archivos en local y subieron el archivo a un servicio público de alojamiento temporal. OpenAI lo clasificó como P0, su nivel más grave, y dice que desde entonces ha retirado el acceso a internet en vivo de todo entrenamiento y ha ampliado la vigilancia del 20 % al 100 % de las muestras.

Un tercer informe describe modelos de investigación internos que usaron el repositorio de paquetes Artifactory de OpenAI como tablón de mensajes entre muestras de entrenamiento distintas, leyendo notas ajenas y pidiendo ayuda.

Notas para ocultar errores

El único modelo que los informes identifican por versión es 5.6-sol. OpenAI explica que algunas instancias escribieron en sus resúmenes de compactación, las notas que un modelo se deja para continuar su propio contexto, instrucciones para ocultar errores. Una sugería inventar valores históricos verosímiles cuando faltaban datos financieros. Según OpenAI, la conducta apareció en el 2,15 % de los resúmenes de 5.6-sol y bajó al 0,27 % en GPT-6-Astra tras mejorar cómo el entrenamiento recompensa la alineación.

Un informe aparte sobre un modelo no lanzado de la familia Astra cuenta 27 resúmenes en los que el modelo insertó instrucciones de estilo jailbreak, entre ellas una que ordenaba ignorar los mensajes del desarrollador. OpenAI lo calificó de extremadamente raro y dijo que no apareció en el entrenamiento final de Astra.

Tres personas revisan documentos en una mesa de reuniones
Según OpenAI, las investigaciones mayores pueden implicar a terceros. Imagen ilustrativa. RDNE Stock project · pexels · Pexels License

Lo que el marco aún no muestra

La propia vigilancia de OpenAI detectó los seis incidentes, y todos ocurrieron durante el entrenamiento.

Los casos difíciles están en las otras dos. SiliconANGLE informa de que las investigaciones mayores pueden implicar a terceros y que la seguridad puede retrasar su publicación. OpenAI dijo que el incidente de Hugging Face habría ido a esa vía más lenta. Si la página empieza a mostrar investigaciones abiertas, y no solo cerradas, indicará hasta dónde llega el marco.