Una prueba para un fallo muy concreto

Aleph Alpha, la empresa alemana de IA, ha publicado una prueba de detección dirigida a una pregunta estrecha: ¿con qué frecuencia un modelo de pesos abiertos responde a una pregunta políticamente delicada sobre China reproduciendo el encuadre del gobierno chino? El trabajo, firmado por Bastian Boll y publicado el 28 de septiembre, usa 967 preguntas repartidas en 56 temas seleccionados a mano.

Un modelo juez — GPT-OSS 120B — clasificó las respuestas en tres grupos: las que repiten el encuadre del Partido Comunista, las equilibradas y las negativas a responder. Un segundo conjunto de 240 preguntas que nunca mencionan a China sirvió para comprobar si el comportamiento se desborda hacia asuntos no relacionados.

Los temas se agrupan en tres ejes: seguridad y liderazgo del Estado, con referencias a Xi Jinping; cuestiones territoriales sobre Taiwán, Hong Kong y Xinjiang; y conceptos ideológicos como la libertad de prensa, los derechos humanos y las elecciones democráticas.

Piezas de cerámica blanca variadas en un estante de taller
La prueba usa 967 preguntas repartidas en 56 temas seleccionados a mano. Fotografía ilustrativa. Anastasia Shuraeva · pexels · Pexels License

Los resultados

Se probaron seis modelos chinos de pesos abiertos: Qwen 3.6 35B-A3B y Qwen 3.8 2.4T-A95B, DeepSeek R1 0528 y V4 Pro 0813, y Kimi K2.5 y K3. Las referencias no chinas fueron Claude Sonnet 5, Mistral Small 2603 y Nemotron Cascade 2, de Nvidia.

Qwen 3.6 respondió con equilibrio al 17% de las preguntas y repitió el encuadre del Partido Comunista en el 80%. Claude Sonnet 5 respondió con equilibrio al 70%, con un 2,8% de alineamiento. Entre los modelos chinos la proporción equilibrada osciló entre el 17% y el 41%, según el resumen del trabajo publicado por The Decoder; el resto repitió el discurso oficial, esquivó la pregunta o se negó a contestar.

Nada de esto sorprende por sí solo. Los servicios chinos de IA generativa operan bajo normas que exigen que el contenido sostenga los valores socialistas fundamentales, y los modelos se moldean en consecuencia. La aportación de la prueba es una cifra en lugar de una impresión.

Filas de luces de estado encendidas en un bastidor de servidores
Aleph Alpha rastreó los resultados de un modelo occidental hasta sus datos de ajuste. Fotografía ilustrativa. panumas nikhomkhai · pexels · Pexels License

El resultado que más importa

Nemotron Cascade 2, de Nvidia, quedó señalado en el 17% de las preguntas: un modelo occidental, construido por una empresa estadounidense, produciendo el mismo encuadre a un ritmo comparable al del modelo chino peor situado.

La explicación de Aleph Alpha es contaminación, no intención. Dice haber encontrado unas 3.500 filas de los 9,3 millones de los datos de ajuste conversacional del modelo que contenían argumentarios del Partido Comunista, probablemente porque esos datos de ajuste supervisado se generaron a su vez con modelos chinos.

Ese es el hallazgo con consecuencias más allá de esta prueba. Generar datos sintéticos de ajuste con el modelo más barato y capaz disponible es hoy práctica corriente en el sector, y esos datos arrastran aquello que el modelo generador fue moldeado para sostener. Una fracción de un punto porcentual de un conjunto de entrenamiento bastó para mover una parte medible de las respuestas.

Habrá que ver si alguien empieza a auditar de forma rutinaria los datos sintéticos de entrenamiento en busca de posturas heredadas. Las herramientas existen, porque Aleph Alpha acaba de hacerlo con el modelo de otro.