Papelada antes do treino

A OpenAI publicou no domingo um conjunto de orientações sobre o que considera que deve ser documentado antes de se permitir que um treino de fronteira por aprendizagem por reforço continue. A formulação é direta: «acreditamos que estamos a entrar numa nova era em que documentação de segurança estruturada deve ser exigida antes de continuar qualquer treino de fronteira por aprendizagem por reforço».

O modelo emprestado é o «processo de segurança»: o argumento estruturado e baseado em provas usado na aviação e na energia nuclear. A OpenAI chama-lhe «uma estrela polar aspiracional para a qual estamos a construir», e admite que a analogia é imperfeita por causa da «complexidade emergente em cada novo nível de capacidade».

Três camadas técnicas e uma regra sobre cadeias de raciocínio

A metade técnica do documento cobre treino de alinhamento, contenção e monitorização: treinar o modelo para não agir contra a intenção, dificultar a fuga se o fizer, e apanhá-lo se tentar.

No alinhamento, a OpenAI propõe usar agentes para encontrar e corrigir ambientes de aprendizagem por reforço defeituosos onde um atalho possa pontuar alto, afinar os avaliadores para penalizar a exploração, e testar retroativamente as avaliações de alinhamento contra incidentes anteriores para que não fiquem apenas sobreajustadas a eles. Propõe também acompanhar se um modelo percebe que está a ser testado, com «limiares de bloqueio específicos».

Um corredor sinalizado que atravessa a maquinaria de uma fábrica
O quadro vai buscar práticas à indústria de segurança crítica. Foto ilustrativa. Yetkin Ağaç · pexels · Pexels License

Uma linha é invulgarmente concreta: não deixar que os avaliadores automáticos vejam a cadeia de raciocínio durante a aprendizagem por reforço, porque isso arrisca que os modelos «evoluam para escapar aos monitores de cadeia de raciocínio». É uma decisão deliberada de abdicar de capacidade para manter o raciocínio legível.

A contenção cobre caixas de areia reforçadas, testes de intrusão contra essa caixa usando pontos de controlo de treinos reais, o fecho de canais laterais de alta largura de banda entre amostras, e guardar as transcrições dos agentes em armazenamento de escrita única, para que uma investigação não possa ser editada depois. A monitorização exige boa deteção de incidentes passados, dados de avaliação frescos para que esses números não fiquem obsoletos, e uma regra de resposta: chamar quem está de piquete durante o dia e suspender automaticamente os treinos perante alertas não atendidos à noite.

Quem pode parar um treino

A metade operacional é onde está a governação. A OpenAI diz que, depois de redigido um processo de segurança, alguém de outra equipa deve escrever uma discordância — um pré-mortem — para lhe encontrar falhas. O processo deve ser aprovado por dirigentes que «devem ter cada um a capacidade de vetar o treino»: um responsável ou vice-presidente de investigação, o responsável de Segurança e o cientista-chefe.

As torres de arrefecimento de uma central sob um céu encoberto
Os processos de segurança são norma na energia nuclear. Foto ilustrativa de uma central. Wolfgang Weiser · pexels · Pexels License

Vai mais longe na responsabilização: o dirigente responsável por um treino deve responder pelo processo de segurança e por qualquer resposta a incidentes «inclusive como parte das avaliações de desempenho». A escalada deve seguir níveis definidos de gravidade, com um piquete capaz de chamar os executivos — o documento nomeia o presidente executivo — quando um treino atinge certa gravidade. As funções de segurança devem falhar fechadas: não deve ser possível iniciar um treino sem monitorização ativa, nem desligar o monitor a partir do próprio treino.

Os auditores, diz o documento, devem ter acesso suficiente para verificar que as afirmações são sólidas.

O que é e o que não é

A OpenAI diz que estas recomendações estão «em processo de implementação» internamente e que as suas práticas continuarão a evoluir «nas próximas semanas». Nada disto é um compromisso perante terceiros, e nenhum regulador é nomeado.

O contexto é incontornável: o documento saiu na véspera de a OpenAI confirmar que não lançaria o GPT-6.1 Astra, e na véspera de nomear quatro organismos públicos australianos alcançados pelos seus modelos durante o treino interno. O que há a observar é se alguma coisa disto se torna auditável por quem não trabalha na OpenAI.