O que foi noticiado e o que a OpenAI confirmou

The Information noticiou primeiro que a OpenAI usa uma técnica chamada profundidade recorrente — por vezes descrita como transformadores em ciclo — no GPT-6 Astra. A Fortune noticiou a 3 de setembro que a técnica alarmou um conjunto de investigadores de segurança em IA, e que o diretor científico da OpenAI, Jakub Pachocki, reconheceu o seu uso e prometeu mais detalhes de arquitetura mais tarde.

O mecanismo é simples de enunciar. Um modelo de raciocínio convencional produz os passos intermédios como texto: escreve tokens, e esses tokens são legíveis. A profundidade recorrente, em vez disso, faz passar repetidamente as mesmas camadas do transformador sobre um estado interno oculto antes de emitir qualquer token. A computação adicional acontece em ativações e não em palavras, pelo que não deixa rasto na saída.

O argumento a favor é a eficiência: mais profundidade efetiva sem um modelo proporcionalmente maior.

Uma investigadora a analisar dados num monitor de computador
Num modelo de raciocínio convencional os passos intermédios são escritos como texto que um auditor pode ler. Tima Miroshnichenko · pexels · Pexels License

Porque objetam os investigadores de segurança

A supervisão da cadeia de pensamento é a principal ferramenta prática que laboratórios e avaliadores externos usam para apanhar um modelo a portar-se mal. Funciona por uma razão pouco vistosa: se um modelo tem de escrever o raciocínio para o usar, um auditor pode ler o que ele escreveu. Essa propriedade é um efeito secundário da arquitetura, não uma salvaguarda desenhada, e desaparece quando o raciocínio deixa de ser escrito.

Steven Adler, antigo investigador de segurança da OpenAI, disse à Fortune que a abordagem atravessa potencialmente uma das poucas linhas vermelhas do setor. Peter Wildeford, da AI Policy Network, chamou-lhe potencialmente muito preocupante e potencialmente temerária. Daniel Kokotajlo, do AI Futures Project, avançou o argumento que mais conta para a área e não para um modelo: outros podem seguir, e a opacidade espalha-se por precedente.

A resposta da OpenAI

Pachocki disse que a empresa se preocupa profundamente com a supervisão da cadeia de pensamento e que tem trabalhado para a preservar e usar desde os seus primeiros modelos de raciocínio. Ele e outros investigadores da OpenAI contestaram a cobertura, sustentando que criou alarme desproporcionado face ao que a empresa fez: a OpenAI teria limitado até onde vai a arquitetura em ciclo precisamente para que o raciocínio do modelo continue legível.

Um emaranhado de cabos de rede coloridos num bastidor
A supervisão da cadeia de pensamento é a principal ferramenta prática para apanhar um modelo a portar-se mal. pipop kunachon · pexels · Pexels License

As duas coisas podem ser verdade. Um uso delimitado da profundidade recorrente pode deixar raciocínio escrito suficiente para supervisionar. O desacordo é, na verdade, sobre se esse limite é um compromisso ou uma escolha de engenharia do momento, e não há especificação publicada com que o confrontar.

O que resolveria a questão

Os detalhes de arquitetura prometidos por Pachocki. Em concreto: que parte da profundidade efetiva de raciocínio do Astra ocorre no espaço latente, se essa proporção é fixa ou cresce com a tarefa, e se os avaliadores externos — as organizações que este ano correram as avaliações de capacidade da própria OpenAI — obtêm acesso suficiente para testar a supervisionabilidade e não apenas o desempenho.

Enquanto isso não existir, a questão não é se o Astra é supervisionável. É que ninguém fora da OpenAI o consegue verificar neste momento.