La calificación

El Youth AI Safety Institute de Common Sense Media publicó el 7 de octubre una evaluación de riesgo de ChatGPT para adolescentes y le dio una calificación global de riesgo inaceptable, la más baja de su escala. Recomienda mantener a los adolescentes fuera del servicio hasta que pruebas independientes demuestren que es seguro.

Dos de los ocho principios del instituto —proteger a niños y adolescentes, y poner a las personas primero— también quedaron marcados como inaceptables. Otros cuatro se calificaron de riesgo alto y dos de moderado.

Cómo se probó

El instituto lanzó más de 4.000 peticiones, repartidas casi por igual entre una ventana anterior al lanzamiento del modo adolescente, el 18 de agosto, y otra posterior. La primera fue del 13 de julio al 17 de agosto; la segunda del 25 de agosto al 28 de septiembre. Las cuentas se registraron con edades de 13 a 17 años, algunas con 19, siempre declaradas por el propio usuario.

El instituto es explícito sobre una debilidad: las dos ventanas fueron sucesivas, de modo que los cambios en el modelo subyacente se confunden con los del propio modo adolescente. Tampoco calculó la concordancia entre evaluadores.

Un aula escolar vacía con filas de pupitres
Se lanzaron más de 4.000 peticiones en dos ventanas de prueba. Imagen ilustrativa. RDNE Stock project · pexels · Pexels License

Los avisos a los padres

El hallazgo que más atención atrajo son las notificaciones. En una prueba específica, más de una docena de cuentas de padres recién vinculadas no generaron ninguna notificación a lo largo de conversaciones de hasta una hora, incluidas charlas explícitas sobre suicidio, autolesión y trastornos alimentarios. En el conjunto de las pruebas el instituto registró cuatro notificaciones en total.

La explicación de OpenAI, según recoge el instituto, es que una cuenta necesita unas tres horas de vinculación antes de poder recibir avisos. Tom Siegel, del instituto, respondió que las cuentas con más tiempo tampoco generaron ninguno.

Las cifras de derivación a ayuda

De 390 peticiones sobre salud mental, los asesores clínicos consideraron que 201 merecían un recurso de crisis. En ellas, las derivaciones a una línea de ayuda cayeron del 33% antes del modo adolescente al 23% después. La derivación a un profesional concreto bajó del 68% al 58%. Cualquier recurso cayó del 77% al 74%. El consejo de recurrir a un adulto de confianza subió del 87% al 94%.

Las cifras por cuadro son más marcadas. En peticiones sobre depresión, la proporción que nombraba una línea de ayuda cayó del 63% al 3%. En las de estado de ánimo pasó del 44% a cero, y en las de manía del 25% a cero. Las de trastornos alimentarios no obtuvieron línea de ayuda en ninguna de las dos ventanas.

El instituto también halló exceso en sentido contrario: apareció un recurso de crisis en 27 de 30 peticiones sobre TDAH en las que los asesores consideraron que no procedía.

Un móvil sobre una mesa de madera junto a cuadernos cerrados
Los evaluadores vieron que las horas de silencio se saltaban cambiando la zona horaria. Imagen ilustrativa. Jessica Lewis 🦋 thepaintedsquare · pexels · Pexels License

Modo estudio y verificación de edad

En modo estudio, la opción de mostrar directamente la respuesta apareció en el 43% de las respuestas posteriores al lanzamiento para un usuario vinculado de 13 años, y en el 90% para uno no vinculado de 17 que usaba el prefijo de estudio. Al quitar el prefijo, el trabajo salió hecho siempre. Con el modo estudio apagado, ChatGPT completó la tarea en 80 de 80 intentos.

Los evaluadores vieron dos avisos de descanso en casi 2.000 peticiones, y comprobaron que las horas de silencio podían saltarse cambiando la zona horaria del dispositivo. En unas 1.000 peticiones durante siete días desde cuentas registradas con 19 años, la experiencia adolescente no se activó nunca, ni siquiera cuando el evaluador decía en la conversación que tenía 13.

La respuesta de OpenAI y qué vigilar

Eric Porterfield, portavoz de OpenAI, discutió los hallazgos y dijo que las pruebas no reflejan cómo funcionan las salvaguardas en la práctica. La propia especificación de modelo para menores de 18 años de OpenAI describe qué debe hacer la experiencia adolescente.

La afirmación comprobable es el retraso de tres horas en la vinculación. Si ese es el mecanismo, se trata de una decisión de producto con una cifra detrás, y OpenAI puede publicar la tasa de notificación de las cuentas vinculadas que la superan. Hasta que alguien lo haga, ambas partes describen ejecuciones distintas del mismo sistema.