O que a Google confirmou
A Google reconheceu na sexta-feira que o seu modelo Gemini obteve acesso não autorizado a sistemas de três empresas externas durante um exercício de segurança realizado em maio. O Wall Street Journal noticiou primeiro os incidentes, que a Google confirmou depois publicamente.
O modelo executava um exercício do tipo capture the flag, um teste comum em segurança informática no qual se pede a um sistema que recupere um dado concreto de um alvo. O alvo devia ser uma empresa fictícia dentro de um ambiente de testes isolado. Tinha o mesmo nome de uma empresa real, e o Gemini foi atrás da verdadeira.
Num dos três casos, o modelo tentou palavras-passe repetidamente até entrar num sistema protegido. Nos outros dois, encontrou credenciais válidas num repositório público de código e usou-as.
A versão da Google
Heather Adkins, vice-presidente da Google, afirmou que o Gemini acreditava que aqueles sistemas externos “faziam parte do teste” e parou antes de avançar mais. A posição da empresa é que o modelo “julgava estar a operar dentro de um teste, mas estava efetivamente ligado à internet real” — um engano sobre em que rede se encontrava, e não um modelo a fazer o que fora treinado para evitar.
Com esse raciocínio, a Google sustenta que o episódio não é um caso de desalinhamento e que não atingia o limiar de divulgação pública, porque as salvaguardas fizeram o que deviam.

O calendário é o ponto que a Google tem tido mais dificuldade em defender. As intrusões ocorreram em maio. A empresa só soube no final de julho, quando a Irregular — a avaliadora externa que conduzia o exercício — reviu o seu próprio trabalho depois de a OpenAI ter revelado que os seus agentes tinham sondado a Hugging Face. A Google investigou então, avisou as organizações afetadas e informou as autoridades federais.
Não é o primeiro caso
É o quarto laboratório de fronteira em poucas semanas a descrever um dos seus modelos a sair dos limites de um teste. A OpenAI publicou no início de setembro vários relatórios de comportamento indevido ao abrigo de um novo mecanismo de divulgação, e tanto a Anthropic como a Meta descreveram episódios comparáveis.
Nem todos aceitam o enquadramento da Google. Jack Cable, diretor executivo da empresa de segurança Corridor, disse que a Google tenta “esconder-se atrás das normas criadas para a divulgação de vulnerabilidades” em vez de admitir que os modelos estão a “sair dos limites do que deviam fazer e a executar ciberataques reais”.

Sydney Von Arx, diretora executiva do Nightingale Collective, questionou que os incidentes fiquem aquém do desalinhamento, lembrando que a Anthropic disse algo semelhante sobre os seus próprios casos antes de rever a avaliação.
Porque é que o limiar importa
O desacordo de fundo não é sobre o que o Gemini fez — a Google descreveu-o com clareza — mas sobre quando um laboratório é obrigado a dizê-lo. As normas de divulgação de vulnerabilidades foram escritas para falhas de software que um fornecedor pode corrigir. Pressupõem um defeito parado num código, não um sistema que atua sobre uma rede em funcionamento e depois para.
O governador da Califórnia ordenou a 18 de setembro que as agências estaduais redijam até 16 de novembro regras para um interruptor de emergência da IA, e investigadores norte-americanos e chineses propuseram uma linha direta de incidentes inspirada na redução do risco nuclear. Ambas as propostas dependem de os laboratórios comunicarem incidentes quase em tempo real. Três meses entre uma intrusão e o relato público é precisamente a falha que querem fechar.