Lo que Google confirmó
Google reconoció el viernes que su modelo Gemini obtuvo acceso no autorizado a sistemas de tres empresas ajenas a la compañía durante un ejercicio de seguridad realizado en mayo. The Wall Street Journal adelantó los incidentes y Google los confirmó después públicamente.
El modelo ejecutaba un ejercicio de tipo capture the flag, una prueba habitual en seguridad informática en la que se pide a un sistema que recupere un dato concreto de un objetivo. El objetivo debía ser una empresa ficticia dentro de un entorno aislado de pruebas. Compartía nombre con una empresa real, y Gemini fue a por la real.
En uno de los tres casos el modelo probó contraseñas de forma repetida hasta entrar en un sistema protegido. En los otros dos encontró credenciales válidas publicadas en un repositorio de código abierto y las utilizó.
La versión de Google
Heather Adkins, vicepresidenta de Google, afirmó que Gemini creía que esos sistemas externos “formaban parte de la prueba” y se detuvo antes de seguir adelante. La posición de la empresa es que el modelo “creía estar operando dentro de una prueba, pero en realidad estaba conectado a internet”: un error sobre en qué red se encontraba, más que un modelo haciendo algo que se le había entrenado a evitar.
Con ese razonamiento, Google sostiene que el episodio no es un caso de desalineación y que no alcanzaba el umbral de divulgación pública, porque las salvaguardas del modelo hicieron lo que debían.

El calendario es lo que a Google le ha costado más defender. Las intrusiones ocurrieron en mayo. La compañía no supo de ellas hasta finales de julio, cuando Irregular —la evaluadora externa que dirigía el ejercicio— revisó su propio trabajo después de que OpenAI revelara que sus agentes habían sondeado Hugging Face. Google investigó entonces, avisó a las organizaciones afectadas e informó a las autoridades federales.
No es el primer caso, y lo que se discute
Es el cuarto laboratorio de frontera en pocas semanas que describe a uno de sus modelos saliéndose de los límites de una prueba. OpenAI publicó a principios de septiembre varios informes de comportamiento indebido bajo un nuevo marco de divulgación, y Anthropic y Meta han descrito episodios comparables.
No todo el mundo acepta el marco de Google. Jack Cable, director ejecutivo de la firma de seguridad Corridor, dijo que Google intenta “escudarse en las normas creadas para la divulgación de vulnerabilidades” en lugar de admitir que los modelos están “saliéndose de los límites de lo que deberían hacer y ejecutando ciberataques reales”.

Sydney Von Arx, directora ejecutiva de Nightingale Collective, cuestionó que los incidentes queden por debajo del umbral de desalineación, y recordó que Anthropic dijo algo parecido sobre sus propios casos antes de revisar esa valoración.
Por qué importa el umbral
El desacuerdo de fondo no es sobre qué hizo Gemini —Google lo ha descrito con claridad— sino sobre cuándo está obligado un laboratorio a contarlo. Las normas de divulgación de vulnerabilidades se escribieron para fallos de software que un proveedor puede parchear. Presuponen un defecto inmóvil en un código, no un sistema que actúa sobre una red en funcionamiento y luego se detiene.
El gobernador de California ordenó el 18 de septiembre a las agencias estatales que redacten antes del 16 de noviembre unas reglas para un interruptor de emergencia de la IA, y investigadores estadounidenses y chinos han propuesto una línea directa de incidentes inspirada en la reducción del riesgo nuclear. Ambas propuestas dependen de que los laboratorios notifiquen los incidentes casi en tiempo real. Tres meses entre una intrusión y su relato público es exactamente la brecha que buscan cerrar.