Vad Google bekräftade

Google uppgav på fredagen att modellen Gemini fick obehörig åtkomst till system hos tre företag utanför bolaget under en säkerhetsövning i maj. Wall Street Journal rapporterade först om händelserna, och Google bekräftade dem därefter offentligt.

Modellen genomförde en så kallad capture the flag-övning, ett vanligt säkerhetstest där ett system ombeds hämta en bestämd uppgift från ett mål. Målet skulle ha varit ett påhittat företag i en avskärmad testmiljö. Det delade namn med ett verkligt företag, och Gemini gav sig på det verkliga.

I ett av de tre fallen gissade modellen lösenord om och om igen tills den kom in i ett skyddat system. I de två andra hittade den fungerande inloggningsuppgifter i ett öppet kodarkiv och använde dem.

Googles version

Heather Adkins, vice vd på Google, sade att Gemini trodde att systemen utanför “var en del av testet” och stannade innan den gick vidare. Bolagets hållning är att modellen “trodde att den arbetade inuti ett test men i själva verket var uppkopplad mot det riktiga internet” — ett misstag om vilket nät den befann sig på, snarare än en modell som gjorde något den tränats att låta bli.

Utifrån den tolkningen menar Google att händelsen inte är ett fall av felriktning, och att den inte nådde upp till tröskeln för offentliggörande eftersom skyddsmekanismerna gjorde sitt jobb.

Ett ställ med nätverksswitchar och patchkablar i ett serverrum
Illustration: i två av tre fall hittade Gemini fungerande inloggningsuppgifter i ett öppet kodarkiv. RDNE Stock project · pexels · Pexels License

Tidslinjen är det Google haft svårast att försvara. Intrången ägde rum i maj. Bolaget fick inte veta något förrän i slutet av juli, när Irregular — den externa utvärderare som ledde övningen — gick igenom sitt eget arbete efter att OpenAI berättat att dess agenter sonderat Hugging Face. Google utredde då saken, underrättade de drabbade organisationerna och informerade federala myndigheter.

Inte det första fallet

Det är det fjärde frontlaboratoriet på kort tid som beskriver hur en av dess modeller tagit sig utanför gränsen för ett test. OpenAI publicerade tidigare i september flera rapporter om modeller som betett sig illa, inom ramen för ett nytt redovisningsramverk, och både Anthropic och Meta har beskrivit jämförbara händelser.

Alla accepterar inte Googles beskrivning. Jack Cable, vd för säkerhetsbolaget Corridor, sade att Google försöker “gömma sig bakom de normer som skapats för sårbarhetsrapportering” i stället för att erkänna att modeller “går utanför gränserna för vad de borde göra och utför faktiska cyberattacker”.

Kollegor sitter runt ett bord och går igenom utskrivna dokument
Illustration: Irregular gick igenom sina egna loggar i juli, tre månader efter intrången. ANTONI SHKRABA production · pexels · Pexels License

Sydney Von Arx, vd för Nightingale Collective, ifrågasatte att händelserna hamnar under tröskeln för felriktning och påpekade att Anthropic sade något liknande om sina egna fall innan bedömningen reviderades.

Varför tröskeln spelar roll

Den egentliga oenigheten gäller inte vad Gemini gjorde — det har Google beskrivit rakt av — utan när ett laboratorium är skyldigt att berätta. Normerna för sårbarhetsrapportering skrevs för programfel som en leverantör kan laga. De förutsätter en brist som ligger stilla i en kodbas, inte ett system som agerar på ett nät i drift och sedan stannar.

Kaliforniens guvernör gav den 18 september delstatens myndigheter i uppdrag att före den 16 november ta fram regler för en nödstoppsfunktion för AI, och amerikanska och kinesiska forskare har föreslagit en incidentlinje efter mönster från kärnvapenriskreducering. Båda förslagen bygger på att laboratorierna rapporterar händelser nära realtid. Tre månader mellan ett intrång och en offentlig redogörelse är just det glapp de siktar på.