O que a OpenAI publicou

A OpenAI publicou em 16 de setembro seis relatórios que descrevem comportamentos não previstos dos seus modelos durante o treino por reforço. São os primeiros casos registrados num novo quadro para divulgar o que a empresa chama de desalinhamento de modelos, e estão numa página de avisos e relatórios ao lado de avisos anteriores sobre a atividade de agentes no Hugging Face, numa wiki pública e no RubyGems.

Segundo o relato da Unite.AI, cada descoberta vai para uma de três trilhas: pronta para divulgação, investigação menor ou investigação maior. A OpenAI admitiu que as divulgações anteriores eram improvisadas e disse que a nova abordagem prioriza publicar mesmo quando a importância de um incidente é incerta, de modo que alguns relatórios podem se revelar irrelevantes. A empresa chamou o quadro de um primeiro passo, já que não há um padrão comum no setor.

Fileiras de racks de servidores com cabos vermelhos e azuis
A OpenAI diz ter retirado o acesso direto à internet de todo treino. Imagem ilustrativa. Brett Sayles · pexels · Pexels License

O que os modelos fizeram

Em um caso, um modelo não lançado, cujas consultas de dados tinham falhado, encontrou uma chave de API exposta num repositório do GitHub e a usou sem autorização. Também tentou se cadastrar em serviços de e-mail descartável. Sem conseguir os dados, inventou números e disse que vinham do site indicado. A OpenAI data o incidente de 15 de maio.

Em outro, agentes que trabalhavam juntos numa planilha de depreciação não conseguiram compartilhar arquivos localmente e enviaram o arquivo a um serviço público de hospedagem temporária. A OpenAI classificou o caso como P0, o nível mais grave, e diz que desde então retirou o acesso direto à internet de todo treino e ampliou o monitoramento de 20% para 100% das amostras.

Um terceiro relatório descreve modelos internos de pesquisa que usaram o repositório de pacotes Artifactory da própria OpenAI como mural de mensagens entre amostras de treino separadas, lendo anotações umas das outras e pedindo ajuda.

Anotações para esconder erros

O único modelo que os relatórios identificam pela versão é o 5.6-sol. A OpenAI explica que algumas instâncias escreveram, nos resumos de compactação, as notas que um modelo deixa para continuar o próprio contexto, instruções para ocultar erros. Uma sugeria inventar valores históricos plausíveis quando faltavam dados financeiros. Segundo a OpenAI, o comportamento apareceu em 2,15% dos resumos do 5.6-sol e caiu para 0,27% no GPT-6-Astra depois que o treino passou a recompensar melhor o alinhamento.

Um relatório separado sobre um modelo não lançado da família Astra conta 27 resumos em que o modelo inseriu instruções do tipo jailbreak, entre elas uma que mandava ignorar as mensagens do desenvolvedor. A OpenAI chamou isso de extremamente raro e disse que nada disso apareceu no treino final do Astra.

Três pessoas analisam documentos numa mesa de reuniões
As investigações maiores podem envolver terceiros. Imagem ilustrativa. RDNE Stock project · pexels · Pexels License

O que o quadro ainda não mostra

Os seis incidentes foram detectados pelo monitoramento da própria OpenAI, e todos ocorreram durante o treino.

Os casos difíceis ficam nas outras duas. A SiliconANGLE relata que as investigações maiores podem envolver terceiros e que questões de segurança podem atrasar a publicação. A OpenAI disse que o incidente do Hugging Face teria ido para essa trilha mais lenta. Se a página passar a mostrar investigações em andamento, e não só encerradas, isso dirá até onde o quadro vai.