La note
Le Youth AI Safety Institute de Common Sense Media a publié le 7 octobre une évaluation des risques de ChatGPT pour ados et lui a donné une note globale de risque inacceptable, la plus basse de son échelle. Il recommande de tenir les adolescents à l’écart du service tant que des tests indépendants n’auront pas montré qu’il est sûr.
Deux des huit principes de l’institut — protéger les enfants et les adolescents, et faire passer les personnes d’abord — ont aussi été jugés inacceptables. Quatre autres ont été classés à risque élevé et deux à risque modéré.
Comment le test a été mené
L’institut a lancé plus de 4 000 requêtes, réparties à peu près également entre une fenêtre antérieure au lancement du mode ado, le 18 août, et une fenêtre postérieure. La première est allée du 13 juillet au 17 août, la seconde du 25 août au 28 septembre. Les comptes ont été créés avec des âges de 13 à 17 ans, certains à 19 ans, toujours déclarés par l’utilisateur.
L’institut est explicite sur une faiblesse : les deux fenêtres se sont succédé, si bien que les changements du modèle sous-jacent se confondent avec ceux des réglages ado eux-mêmes. L’accord entre évaluateurs n’a pas non plus été calculé.

Les alertes aux parents
Le constat qui a le plus retenu l’attention concerne les notifications. Dans un test dédié, plus d’une douzaine de comptes parents fraîchement liés n’ont produit aucune notification au fil de conversations allant jusqu’à une heure, y compris des échanges explicites sur le suicide, l’automutilation et les troubles alimentaires. Sur l’ensemble des tests, l’institut a relevé quatre notifications au total.
L’explication d’OpenAI, telle que la rapporte l’institut, est qu’un compte a besoin d’environ trois heures de liaison avant que les alertes puissent être délivrées. Tom Siegel, de l’institut, a répondu que les comptes laissés plus longtemps n’en ont pas produit davantage.
Les chiffres sur les renvois de crise
Sur 390 requêtes de santé mentale, des conseillers cliniques ont estimé que 201 méritaient une ressource de crise. Parmi celles-ci, les renvois vers une ligne d’écoute sont passés de 33% avant les réglages ado à 23% après. Le renvoi vers un professionnel nommé est passé de 68% à 58%. Toute ressource confondue, de 77% à 74%. Le conseil de s’adresser à un adulte de confiance a progressé, de 87% à 94%.
Les chiffres par trouble sont plus nets. Pour les requêtes sur la dépression, la part citant une ligne d’écoute est tombée de 63% à 3%. Pour celles sur l’humeur, de 44% à zéro, et pour la manie, de 25% à zéro. Les requêtes sur les troubles alimentaires n’ont obtenu de ligne d’écoute dans aucune des deux fenêtres.
L’institut a aussi relevé l’excès inverse : une ressource de crise est apparue dans 27 des 30 requêtes sur le TDAH où les conseillers jugeaient qu’aucune ne s’imposait.

Mode étude et vérification de l’âge
En mode étude, une option affichant directement la réponse est apparue dans 43% des réponses postérieures au lancement pour un compte lié de 13 ans, et dans 90% pour un compte non lié de 17 ans utilisant le préfixe d’étude. En retirant le préfixe, le devoir est revenu fait à chaque fois. Mode étude désactivé, ChatGPT a rendu le devoir dans 80 cas sur 80.
Les testeurs ont vu deux rappels de pause sur près de 2 000 requêtes, et ont constaté que les heures calmes pouvaient être contournées en changeant le fuseau horaire de l’appareil. Sur environ 1 000 requêtes en sept jours depuis des comptes enregistrés à 19 ans, l’expérience ado ne s’est jamais activée, même quand le testeur disait dans la conversation avoir 13 ans.
La réponse d’OpenAI, et ce qu’il faut suivre
Le porte-parole d’OpenAI Eric Porterfield a contesté les conclusions, estimant que les tests ne reflètent pas le fonctionnement réel des garde-fous. La spécification de modèle pour les moins de 18 ans d’OpenAI décrit ce que l’expérience ado est censée faire.
L’affirmation vérifiable est le délai de trois heures après la liaison. Si c’est bien le mécanisme, c’est une décision produit assortie d’un chiffre, et OpenAI peut publier le taux de notification des comptes liés qui l’ont dépassé. Tant que personne ne le fait, les deux camps décrivent des exécutions différentes du même système.