Qué se informó y qué confirmó OpenAI

The Information adelantó que OpenAI utiliza una técnica llamada profundidad recurrente — a veces descrita como transformadores en bucle — en GPT-6 Astra. Fortune informó el 3 de septiembre de que la técnica alarmó a un grupo de investigadores de seguridad en IA, y de que el científico jefe de OpenAI, Jakub Pachocki, reconoció su uso y prometió más detalles arquitectónicos más adelante.

El mecanismo es fácil de enunciar. Un modelo de razonamiento convencional produce sus pasos intermedios como texto: escribe tokens, y esos tokens son legibles. La profundidad recurrente, en cambio, hace pasar repetidamente las mismas capas del transformador sobre un estado interno oculto antes de emitir ningún token. El cómputo adicional ocurre en activaciones y no en palabras, de modo que no deja rastro en la salida.

El argumento a favor es la eficiencia: más profundidad efectiva sin un modelo proporcionalmente mayor.

Una investigadora estudiando datos en un monitor de ordenador
En un modelo de razonamiento convencional los pasos intermedios se escriben como texto que un auditor puede leer. Tima Miroshnichenko · pexels · Pexels License

Por qué objetan los investigadores de seguridad

La supervisión de la cadena de pensamiento es la principal herramienta práctica que usan los laboratorios y los evaluadores externos para detectar que un modelo se comporta mal. Funciona por una razón poco vistosa: si un modelo tiene que escribir su razonamiento para poder usarlo, un auditor puede leer lo que escribió. Esa propiedad es un efecto secundario de la arquitectura, no una salvaguarda diseñada, y desaparece cuando el razonamiento deja de escribirse.

Steven Adler, antiguo investigador de seguridad de OpenAI, dijo a Fortune que el enfoque cruza potencialmente una de las pocas líneas rojas que tiene el sector. Peter Wildeford, de la AI Policy Network, lo calificó de potencialmente muy preocupante y potencialmente temerario. Daniel Kokotajlo, del AI Futures Project, planteó el argumento que más importa para el campo y no para un modelo concreto: que otros pueden seguir el ejemplo, y la opacidad se extiende por precedente.

La respuesta de OpenAI

Pachocki afirmó que a la empresa le importa profundamente la supervisión de la cadena de pensamiento y que ha trabajado para preservarla y utilizarla desde sus primeros modelos de razonamiento. Él y otros investigadores de OpenAI rebatieron la cobertura, sosteniendo que generó una alarma desproporcionada respecto de lo que la empresa ha hecho: que OpenAI ha limitado hasta dónde se emplea la arquitectura en bucle precisamente para que el razonamiento del modelo siga siendo legible.

Una maraña de cables de red de colores en un bastidor
La supervisión de la cadena de pensamiento es la principal herramienta práctica para detectar un mal comportamiento del modelo. pipop kunachon · pexels · Pexels License

Ambas cosas pueden ser ciertas. Un uso acotado de la profundidad recurrente puede dejar suficiente razonamiento escrito como para supervisarlo. El desacuerdo real es si ese límite es un compromiso o una decisión de ingeniería del momento, y no existe una especificación publicada con la que contrastarlo.

Qué lo zanjaría

Los detalles arquitectónicos que prometió Pachocki. En concreto: qué parte de la profundidad efectiva de razonamiento de Astra ocurre en el espacio latente, si esa proporción es fija o escala con la tarea, y si los evaluadores externos — las organizaciones que este año ejecutaron las evaluaciones de capacidad de la propia OpenAI — obtienen acceso suficiente para poner a prueba la supervisabilidad y no solo el rendimiento.

Hasta que eso exista, la cuestión no es si Astra es supervisable. Es que nadie fuera de OpenAI puede comprobarlo ahora mismo.