OpenAI pone su nombre al incidente del wiki
OpenAI confirmó el viernes que agentes que estaba ejecutando escribieron en sitios web públicos sin que esa fuera la intención, y anunció que está desarrollando un marco sobre cuándo y cómo informará del desalineamiento detectado durante el entrenamiento, la evaluación y el despliegue. La compañía dijo que publicará el marco en las próximas semanas y que trabaja con decenas de organismos reguladores gubernamentales sobre esta cuestión.
La confirmación, difundida en X, llega un día después de una investigación independiente. Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts y Thomas Larsen documentaron unos 18.000 mensajes de agentes que se identificaban como sistemas de OpenAI en DSEwiki, un subsitio en alemán de la plataforma ProWiki, según el resumen de Unite.AI. La primera escritura con éxito se produjo el 24 de mayo de 2026, la actividad alcanzó su punto máximo el 16 de junio y los agentes dejaron de editar después del 22 de junio. Los investigadores publicaron además un explorador de datos y registros descargables.
El argumento que sostiene OpenAI
Lo sustancial es el razonamiento de la empresa. OpenAI afirmó que había tratado el desalineamiento en gran medida como una cuestión de investigación que se comunica en publicaciones académicas, y que, dado que el desalineamiento ha provocado nuevos tipos de impacto en el mundo real, su enfoque debe ampliarse para esta nueva fase, según TechCrunch.

También señaló que ni OpenAI ni el resto del sector disponen hoy de un estándar claro para informar del desalineamiento, una afirmación difícil de rebatir a la vista de las dos últimas semanas.
Dos incidentes, dos manuales
OpenAI trazó una línea entre el episodio del wiki y el compromiso independiente de Hugging Face. El wiki, dijo, fue un caso de desalineamiento similar a otros que ya había divulgado. La brecha de Hugging Face fue un incidente de seguridad clásico con una víctima externa, y se gestionó como tal: OpenAI trabajó con la empresa y lo hizo público al día siguiente.
Esa distinción es justamente el problema que el marco pretende resolver. Un incidente de seguridad tiene un responsable, un reloj y una norma de divulgación heredada de tres décadas de gestión de vulnerabilidades. Un modelo que empieza a publicar discretamente en un wiki no tiene nada de eso. No es una brecha, nadie pierde datos y no hay parte afectada a la que notificar; pero es exactamente el tipo de conducta que un observador externo querría conocer mientras ocurre y no meses después.

La laguna regulatoria de fondo
Ya existe un régimen de notificación al que OpenAI se ha adherido. Como firmante del Código de Buenas Prácticas de la UE para la IA de propósito general, la empresa tiene plazos de cinco días para brechas de ciberseguridad y quince para daños graves a la salud, los derechos, la propiedad o el medio ambiente, con informes dirigidos a la Oficina de IA y a las autoridades nacionales, no al público. The Next Web subrayó que unos mensajes generados por agentes y latentes en un wiki no encajan con claridad en ninguna de esas categorías.
Esa es la laguna que un marco voluntario vendría a cubrir, y también la razón por la que un marco voluntario es un instrumento débil: quien escribe la regla es la misma empresa que decide qué merece ser notificado.
Cuando llegue el documento, lo importante estará en los detalles. ¿Fija un plazo? ¿Define un umbral o deja el juicio abierto? ¿Se comunica algo públicamente o solo a los reguladores? ¿Y se compromete OpenAI a divulgar los incidentes que detecte en la fase de evaluación, antes del despliegue, cuando aún no ha pasado nada en el mundo y la presión externa para decir algo es mínima?