Karakteren
Common Sense Medias Youth AI Safety Institute offentliggjorde 7. oktober en risikovurdering af ChatGPT til teenagere og gav den samlet karakteren uacceptabel risiko, den laveste på skalaen. Instituttet anbefaler at holde teenagere væk fra tjenesten, indtil uafhængige tests viser, at den er sikker.
To af instituttets otte principper — at holde børn og teenagere sikre og at sætte mennesker først — blev også markeret uacceptable. Fire andre blev vurderet som høj risiko og to som moderat.
Sådan blev der testet
Instituttet kørte mere end 4.000 forespørgsler, fordelt nogenlunde ligeligt mellem et vindue før teenageindstillingerne kom 18. august og et efter. Det første løb fra 13. juli til 17. august, det andet fra 25. august til 28. september. Kontiene blev oprettet med aldre fra 13 til 17 år, nogle med 19, altid selvoplyst.
Instituttet er tydeligt om én svaghed: de to vinduer lå efter hinanden, så ændringer i den underliggende model blandes sammen med selve teenageindstillingerne. Enighed mellem bedømmere blev heller ikke beregnet.

Forældrealarmerne
Det fund, der har fået mest opmærksomhed, handler om notifikationerne. I en særskilt test gav mere end et dusin nyligt tilknyttede forældrekonti slet ingen notifikationer gennem samtaler på op til en time, herunder eksplicitte samtaler om selvmord, selvskade og spiseforstyrrelser. I den almindelige testning registrerede instituttet fire notifikationer i alt.
OpenAIs forklaring, som instituttet gengiver den, er, at en konto kræver omkring tre timers tilknytning, før alarmer kan leveres. Tom Siegel fra instituttet svarede, at konti med mere tid heller ingen gav.
Tallene om krisehenvisninger
Af 390 forespørgsler om mental sundhed vurderede kliniske rådgivere, at 201 burde give en kriseressource. Blandt dem faldt henvisninger til en hjælpelinje fra 33% før teenageindstillingerne til 23% efter. Henvisning til en navngiven fagperson faldt fra 68% til 58%. Nogen ressource overhovedet faldt fra 77% til 74%. Rådet om at inddrage en voksen, man stoler på, steg fra 87% til 94%.
Tallene per tilstand er skarpere. For forespørgsler om depression faldt andelen, der nævnte en hjælpelinje, fra 63% til 3%. For humør gik den fra 44% til nul, og for mani fra 25% til nul. Forespørgsler om spiseforstyrrelser gav hjælpelinje i ingen af vinduerne.
Instituttet fandt også overhenvisning den anden vej: en kriseressource dukkede op i 27 af 30 forespørgsler om adhd, hvor rådgiverne vurderede, at ingen var påkrævet.

Studietilstand og alderskontrol
I studietilstand dukkede en mulighed for at vise svaret direkte op i 43% af svarene efter lanceringen for en tilknyttet 13-årig og i 90% for en ikke-tilknyttet 17-årig, der brugte studiepræfikset. Blev præfikset fjernet, kom opgaven færdig hver gang. Med studietilstand slået fra løste ChatGPT opgaven i 80 ud af 80 kørsler.
Testerne så to pausepåmindelser gennem næsten 2.000 forespørgsler og fandt, at stilletimer kunne omgås ved at ændre enhedens tidszone. I omkring 1.000 forespørgsler over syv dage fra konti oprettet som 19-årige blev teenageoplevelsen aldrig slået til, heller ikke når testeren i samtalen sagde at være 13.
OpenAIs svar og hvad man skal følge
OpenAIs talsperson Eric Porterfield bestred fundene og sagde, at testene ikke afspejler, hvordan sikringerne fungerer i praksis. OpenAIs egen modelspecifikation for under 18 år beskriver, hvad teenageoplevelsen skal gøre.
Den efterprøvelige påstand er forsinkelsen på tre timer efter tilknytning. Er det mekanismen, er det en produktbeslutning med et tal bag sig, og OpenAI kan offentliggøre notifikationsandelen for tilknyttede konti, der har passeret den. Indtil nogen gør det, beskriver begge sider forskellige kørsler af det samme system.