Ett test för ett mycket specifikt fel
Aleph Alpha, det tyska AI-bolaget, har publicerat ett detektionstest riktat mot en smal fråga: hur ofta besvarar en modell med öppna vikter en politiskt känslig fråga om Kina på ett sätt som återger den kinesiska regeringens formuleringar? Arbetet, skrivet av Bastian Boll och publicerat den 28 september, använder 967 frågor fördelade på 56 handplockade ämnen.
Svaren klassificerades av en modelldomare — GPT-OSS 120B — i tre fack: svar som återger kommunistpartiets formuleringar, balanserade svar och vägranden. En andra uppsättning med 240 frågor som aldrig nämner Kina användes för att testa om beteendet spiller över på orelaterade frågor.
Ämnena samlas i tre teman: statens säkerhet och ledarskap, med hänvisningar till Xi Jinping; territoriella frågor om Taiwan, Hongkong och Xinjiang; samt ideologiska begrepp som pressfrihet, mänskliga rättigheter och demokratiska val.

Resultaten
Sex kinesiska modeller med öppna vikter testades: Qwen 3.6 35B-A3B och Qwen 3.8 2.4T-A95B, DeepSeek R1 0528 och V4 Pro 0813 samt Kimi K2.5 och K3. De icke-kinesiska jämförelserna var Claude Sonnet 5, Mistral Small 2603 och Nvidias Nemotron Cascade 2.
Qwen 3.6 svarade balanserat på 17 procent av frågorna och återgav kommunistpartiets formuleringar i 80 procent. Claude Sonnet 5 svarade balanserat i 70 procent, med 2,8 procent som visade anpassning. Bland de kinesiska modellerna låg den balanserade andelen mellan 17 och 41 procent, enligt The Decoders sammanfattning av arbetet; resten upprepade den statliga framställningen, vek undan eller vägrade svara.
Inget av detta är i sig överraskande. Kinesiska tjänster för generativ AI lyder under regler som kräver att innehåll upprätthåller centrala socialistiska värden, och modellerna formas därefter. Testets bidrag är en siffra i stället för ett intryck.

Resultatet som betyder mer
Nvidias Nemotron Cascade 2 flaggades på 17 procent av frågorna — en västerländsk modell, byggd av ett amerikanskt bolag, som producerade samma formuleringar i en takt jämförbar med den sämst placerade kinesiska modellen.
Aleph Alphas förklaring är kontaminering snarare än avsikt. Bolaget uppger sig ha hittat omkring 3 500 rader av 9,3 miljoner i modellens finjusteringsdata för chatt som bar kommunistpartiets talepunkter, sannolikt för att dessa övervakade finjusteringsdata i sin tur genererats med kinesiska modeller.
Det är fyndet med konsekvenser utanför det här testet. Syntetiska finjusteringsdata som genereras av vilken modell som är billigast och dugligast är nu standard i branschen, och de bär med sig det som den genererande modellen formats att hålla för sant. En bråkdel av en procent av en träningsmängd räckte för att flytta en mätbar andel av svaren.
Det som är värt att följa är om någon börjar granska syntetiska träningsdata för ärvda ståndpunkter som rutin. Verktygen finns uppenbarligen, för Aleph Alpha gjorde just det med någon annans modell.