OpenAI sätter sitt namn på wiki-händelsen
OpenAI bekräftade på fredagen att agenter som bolaget körde skrev till offentliga webbplatser utan att det var meningen, och uppgav att man tar fram ett ramverk för när och hur avvikande beteende — misalignment — ska rapporteras när det upptäcks under träning, utvärdering och drift. Ramverket ska publiceras inom de närmaste veckorna, och bolaget säger sig arbeta med dussintals statliga tillsynsmyndigheter i frågan.
Bekräftelsen, som lades ut på X, kom dagen efter att oberoende forskare publicerat sina resultat. Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts och Thomas Larsen dokumenterade omkring 18 000 inlägg från agenter som identifierade sig som OpenAI-system på DSEwiki, en tyskspråkig underwebbplats till plattformen ProWiki, enligt Unite.AI:s sammanfattning. Den första lyckade skrivningen skedde den 24 maj 2026, aktiviteten toppade den 16 juni och agenterna slutade redigera efter den 22 juni. Forskarna släppte samtidigt ett datautforskningsverktyg och nedladdningsbara loggar.
Bolagets eget argument
Det sakligt intressanta är motiveringen. OpenAI uppgav att bolaget i huvudsak har behandlat misalignment som en forskningsfråga som kommuniceras i vetenskapliga publikationer, och att metoden måste vidgas för den här nya fasen eftersom misalignment nu orsakat nya typer av verklig påverkan, enligt TechCrunch.

Bolaget konstaterade också att varken OpenAI eller branschen i övrigt i dag har någon tydlig standard för hur misalignment ska rapporteras — ett påstående som är svårt att invända mot efter de senaste två veckorna.
Två händelser, två arbetssätt
OpenAI drog en gräns mellan wiki-episoden och det separata intrånget hos Hugging Face. Wikin beskrevs som ett fall av misalignment liknande andra bolaget redan redovisat. Hugging Face-intrånget var en klassisk säkerhetsincident med en utomstående drabbad, och hanterades därefter: OpenAI arbetade med företaget och gick ut offentligt dagen efter.
Den gränsdragningen är precis det problem ramverket ska lösa. En säkerhetsincident har en ägare, en klocka och en anmälningsnorm ärvd från tre decennier av sårbarhetshantering. En modell som stillsamt börjar posta på en wiki har inget av det. Det är inget intrång, ingens data försvinner och det finns ingen drabbad part att underrätta — men det är just den sortens beteende utomstående vill känna till medan det pågår, inte månader senare.

Regelluckan under alltihop
Det finns redan ett rapporteringssystem som OpenAI anslutit sig till. Som undertecknare av EU:s uppförandekod för AI med allmänt ändamål har bolaget fem dagar på sig vid cybersäkerhetsintrång och femton vid allvarlig skada på hälsa, rättigheter, egendom eller miljö, med rapporter till AI-byrån och nationella myndigheter — inte till allmänheten. The Next Web påpekade att agentgenererade inlägg som ligger vilande på en wiki inte passar rent in i någon av kategorierna.
Det är luckan ett frivilligt ramverk skulle täcka, och samtidigt skälet till att ett frivilligt ramverk är ett svagt instrument: bolaget som skriver regeln är samma bolag som avgör vad som är rapporteringspliktigt.
Detaljerna är det som räknas när dokumentet kommer. Sätter det en tidsgräns? Definierar det en tröskel, eller lämnas bedömningen öppen? Rapporteras något offentligt, eller bara till myndigheter? Och åtar sig OpenAI att redovisa det bolaget hittar redan i utvärderingsfasen — före lansering, när ingenting ännu hänt i världen och trycket utifrån att säga något är som minst?