A classificação

O Youth AI Safety Institute da Common Sense Media publicou a 7 de outubro uma avaliação de risco do ChatGPT para adolescentes e deu-lhe uma classificação global de risco inaceitável, a mais baixa da sua escala. Recomenda manter os adolescentes fora do serviço até que testes independentes mostrem que é seguro.

Dois dos oito princípios do instituto — proteger crianças e adolescentes, e pôr as pessoas em primeiro lugar — foram também marcados como inaceitáveis. Outros quatro ficaram em risco elevado e dois em moderado.

Como foi testado

O instituto lançou mais de 4.000 pedidos, repartidos quase por igual entre uma janela anterior ao lançamento do modo adolescente, a 18 de agosto, e outra posterior. A primeira decorreu de 13 de julho a 17 de agosto; a segunda de 25 de agosto a 28 de setembro. As contas foram registadas com idades entre 13 e 17 anos, algumas com 19, sempre declaradas pelo próprio.

O instituto é explícito quanto a uma fraqueza: as duas janelas foram sucessivas, pelo que as alterações ao modelo subjacente se confundem com as do próprio modo adolescente. Também não calculou a concordância entre avaliadores.

Uma sala de aula vazia com filas de carteiras
Foram lançados mais de 4.000 pedidos em duas janelas de teste. Imagem ilustrativa. RDNE Stock project · pexels · Pexels License

Os alertas aos pais

A conclusão que mais atenção atraiu diz respeito às notificações. Num teste dedicado, mais de uma dúzia de contas de pais recém-ligadas não produziram qualquer notificação ao longo de conversas de até uma hora, incluindo conversas explícitas sobre suicídio, automutilação e perturbações alimentares. No conjunto dos testes, o instituto registou quatro notificações no total.

A explicação da OpenAI, tal como o instituto a relata, é que uma conta precisa de cerca de três horas de ligação antes de os alertas poderem ser entregues. Tom Siegel, do instituto, respondeu que as contas com mais tempo também não produziram nenhum.

Os números dos encaminhamentos

De 390 pedidos sobre saúde mental, os conselheiros clínicos entenderam que 201 justificavam um recurso de crise. Nesses, os encaminhamentos para uma linha de apoio caíram de 33% antes do modo adolescente para 23% depois. O encaminhamento para um profissional nomeado caiu de 68% para 58%. Qualquer recurso caiu de 77% para 74%. O conselho de recorrer a um adulto de confiança subiu, de 87% para 94%.

Os números por quadro são mais vincados. Nos pedidos sobre depressão, a fatia que nomeava uma linha de apoio caiu de 63% para 3%. Nos de humor passou de 44% para zero, e nos de mania de 25% para zero. Os de perturbações alimentares não obtiveram linha de apoio em nenhuma das janelas.

O instituto encontrou também excesso no sentido contrário: surgiu um recurso de crise em 27 de 30 pedidos sobre PHDA em que os conselheiros consideraram que nenhum se justificava.

Um telemóvel pousado numa mesa de madeira ao lado de cadernos fechados
Os testadores contornaram as horas de silêncio mudando o fuso horário. Imagem ilustrativa. Jessica Lewis 🦋 thepaintedsquare · pexels · Pexels License

Modo estudo e verificação de idade

No modo estudo, uma opção de mostrar diretamente a resposta apareceu em 43% das respostas posteriores ao lançamento para um utilizador ligado de 13 anos, e em 90% para um não ligado de 17 que usava o prefixo de estudo. Retirado o prefixo, o trabalho vinha feito todas as vezes. Com o modo estudo desligado, o ChatGPT completou o trabalho em 80 de 80 tentativas.

Os testadores viram dois lembretes de pausa em quase 2.000 pedidos, e verificaram que as horas de silêncio podiam ser contornadas mudando o fuso horário do aparelho. Em cerca de 1.000 pedidos ao longo de sete dias a partir de contas registadas com 19 anos, a experiência adolescente nunca se ativou, mesmo quando o testador dizia na conversa ter 13.

A resposta da OpenAI e o que vigiar

O porta-voz da OpenAI Eric Porterfield contestou as conclusões, dizendo que os testes não refletem como as salvaguardas funcionam na prática. A própria especificação de modelo para menores de 18 anos da OpenAI descreve o que a experiência adolescente deve fazer.

A afirmação verificável é o atraso de três horas na ligação. Se for esse o mecanismo, trata-se de uma decisão de produto com um número atrás, e a OpenAI pode publicar a taxa de notificação das contas ligadas que o ultrapassam. Até que alguém o faça, ambos os lados descrevem execuções diferentes do mesmo sistema.