O que a OpenAI vai ligar

A OpenAI anunciou na segunda-feira que vai acrescentar nas próximas semanas uma marca de água invisível ao texto gerado pelo ChatGPT e pelo Codex na União Europeia, em todos os planos. A partir do mesmo dia, os clientes da API em qualquer parte do mundo podem optar por ativá-la em modelos selecionados. Na API continua desativada por omissão, e a empresa disse que “não está a tornar a marca de água de texto uma predefinição global no lançamento”.

O que desencadeia a mudança é a Lei de IA da União Europeia, que obriga os fornecedores de IA generativa a tornar o texto gerado por máquina identificável de forma legível por máquina. A OpenAI abre também candidaturas para aceder ao seu detetor, concedido caso a caso a investigadores e organizações peritas aprovadas, nos termos do Código de Conduta europeu. Não ficará disponível ao público.

O textGrain e o que faz ao modelo

A tecnologia chama-se textGrain e funciona acrescentando um sinal estatístico invisível às escolhas de palavras do modelo. A OpenAI afirmou que o textGrain igualou ou superou as outras abordagens testadas, incluindo o SynthID para texto da Google, e que tenciona lançar a tecnologia em código aberto.

O teclado de um portátil fotografado de perto sobre uma secretária
A marca acrescenta um sinal estatístico às escolhas de palavras. Fotografia ilustrativa. Christian Naccarato · pexels · Pexels License

A empresa publicou resultados de referência para o Astra com e sem a marca e não encontrou diferença relevante: 49,57 contra 49,76 pontos no Artificial Analysis Intelligence Index, 94,44% contra 93,94% no GPQA Diamond e 53,90% contra 56,06% no Terminal-Bench 4.0. São números da própria OpenAI sobre o seu próprio modelo.

Os números que enfraquecem a ideia

A parte mais interessante do texto é a franqueza com que expõe os limites. Com uma taxa alvo de falsos positivos de 1%, a OpenAI indicou que o seu detetor encontrou a marca em cerca de 80% das passagens de 200 tokens e cerca de 95% das de 400 tokens em conteúdos como psicologia. Em matemática, onde a escolha de palavras é mais restrita, a deteção foi substancialmente menor.

A edição degrada-a mais depressa. Numa avaliação de passagens de 400 tokens, substituir 10% das palavras por sinónimos reduziu a deteção de cerca de 92% para 66%. Substituir 25% levou-a a 17%. É o número a reter: uma reescrita ligeira derrota a marca.

Bandeiras da União Europeia hasteadas junto a um edifício
A exigência vem da Lei de IA da União Europeia. Fotografia ilustrativa. Christian Wasserfallen · pexels · Pexels License

A OpenAI é explícita: uma deteção não mede o contributo humano, não estabelece propriedade nem responsabilidade, não identifica o utilizador e não verifica a exatidão; e a ausência de marca não prova que o texto foi escrito por uma pessoa, já que pode ser curto demais, editado, traduzido, vir de um modelo não suportado ou de ferramentas de outra empresa.

O que acompanhar

A empresa já aplica Content Credentials a imagens suportadas, é conforme ao C2PA e insere marcas SynthID em imagens e áudio suportados, com ferramentas públicas de verificação para ambos. O texto é a parte que resiste ao método, porque é a parte que as pessoas reescrevem. A seguir: o relatório técnico atualizado, o lançamento em código aberto e se o acesso ao detetor se alarga para lá da lista aprovada.