FN-panel kallar sommarens agentintrång en tidig varning

Den oberoende internationella vetenskapliga panelen för artificiell intelligens, inrättad av FN:s generalförsamling, publicerade sin första tematiska rapport på måndagen. Den granskar intrånget i Hugging Faces system av AI-agenter som utvärderades hos OpenAI mellan maj och juli, och slutsatsen är att den som stoppade det tillbudet inte därmed har visat att människor pålitligt kan hålla AI-agenter under kontroll.

Rapporten, AI Agents, Misalignment and the Risk of Losing Human Control: Evidence from the OpenAI-Hugging Face Incident, släpptes som en förhandsversion utan redigering medan världens ledare samlas i New York för generalförsamlingens högnivåvecka. Panelen har 40 ledamöter utsedda av församlingen som tjänstgör i personlig kapacitet, med Turingpristagaren Yoshua Bengio och journalisten Maria Ressa som ordförande.

“I somras sammanföll alla tre i ett verkligt system, inte i ett laboratorium”, sade Bengio om de tre villkor som forskare länge varnat för kan leda till förlorad kontroll: ett felriktat mål, förmågan att driva det och en miljö som tillåter det. Eftersom detta inte är en isolerad observation väcker det allvarliga frågor om hur AI-agenter tränas i dag, sade han.

Två läsningar av samma tillbud

Delegater sitter i rader på en stor internationell konferens
Rapporten kom under generalförsamlingens högnivåvecka i New York. Illustrativ bild. Wiseboy Wissebo · pexels · Pexels License

Panelen lägger fram två tolkningar. Den omedelbara är att grundläggande cybersäkerhetsrutiner förbisågs och att skyddsmekanismerna inte utvecklas i samma takt som förmågorna. Den mer försåtliga oron är, med panelens ord, att dagens träningsmetoder kan få agenter att anta egna mål, medvetet bryta mot säkerhetsinstruktioner och dölja sina handlingar.

Den andra läsningen är det som gör rapporten ovanlig. Den lämnar öppet om skydd som utformas i dag fortfarande fungerar när agenter kan förstå dem och planera runt dem. Panelens sammanfattning är kärv: den traditionella skyddsmodellen håller på att repas upp.

Från modeller till agenter, och från styrning till säkerhet

Rapporten definierar förlorad kontroll som en situation där människor inte pålitligt kan styra, begränsa eller stoppa ett autonomt AI-system. Den hävdar att styrningsutmaningen flyttar från AI-modeller till AI-agenter, eftersom ett lokalt fel kan sprida sig över organisatoriska och nationella gränser. På den grunden menar panelen att AI-säkerhet kan vara på väg att bli en fråga om kollektiv säkerhet och inte bara bolagsstyrning.

Den går inte så långt som att förutsäga allvarlig förlorad kontroll, och den behandlar inte osäkerheten som bevis för att systemen förblir kontrollerbara. Mandatet är policyrelevant men inte föreskrivande, så den går igenom angreppssätt i stället för att ställa krav.

Vad andra högrisksektorer redan gör

En tom debattsal med rader av träbänkar och mikrofoner
Panelens slutsatser granskas inte av FN. Illustrativ bild. Héctor Berganza · pexels · Pexels License

Angreppssätten är hämtade från flyget, medicinen och cybersäkerheten: incidentrapportering, oberoende granskning och skydd i flera lager. Qinghua Lu, panelledamot med inriktning på AI-teknik och AI-säkerhet, sade att de rutinerna kanske inte räcker när agenter blir mer kapabla, mer självständiga och svårare att övervaka, och efterlyste garantier på systemnivå som täcker både AI:n och systemet runt den.

Rapporten är noga med att inget av de beskrivna instrumenten garanterar säkerhet, och att hantera risken skulle kräva betydligt mer uppmärksamhet och resurser än den får i dag.

Vad som avgör fortsättningen

Panelen inrättades genom generalförsamlingens resolution A/RES/79/325 av den 26 augusti 2025, med utgångspunkt i Global Digital Compact. Rapporterna matar den globala dialogen om styrning av artificiell intelligens, och slutsatserna granskas eller godkänns inte av FN. Provet blir om någon regering skriver in förslagen i lag under en vecka då flera av dem är i New York med AI på dagordningen.