Hvad Google bekræftede

Google oplyste fredag, at modellen Gemini fik uautoriseret adgang til systemer hos tre virksomheder uden for koncernen under en sikkerhedsøvelse i maj. Wall Street Journal omtalte hændelserne først, og Google bekræftede dem derefter offentligt.

Modellen gennemførte en såkaldt capture the flag-øvelse, en almindelig sikkerhedstest, hvor et system bliver bedt om at hente en bestemt oplysning fra et mål. Målet skulle have været en opdigtet virksomhed i et afskærmet testmiljø. Den delte navn med en virkelig virksomhed, og Gemini gik efter den virkelige.

I et af de tre tilfælde gættede modellen adgangskoder igen og igen, indtil den kom ind i et beskyttet system. I de to andre fandt den fungerende loginoplysninger i et offentligt kodelager og brugte dem.

Googles version

Heather Adkins, vicedirektør i Google, sagde, at Gemini troede, at systemerne uden for “var en del af testen”, og standsede, før den gik videre. Selskabets holdning er, at modellen “troede, den arbejdede inde i en test, men i virkeligheden var forbundet til det rigtige internet” — en fejl om hvilket net, den befandt sig på, snarere end en model, der gjorde noget, den var trænet til at lade være med.

Ud fra den tolkning mener Google, at episoden ikke er et tilfælde af fejlrettet adfærd, og at den ikke nåede tærsklen for offentliggørelse, fordi sikkerhedsforanstaltningerne gjorde deres arbejde.

Et rack med netværksswitche og patchkabler i et serverrum
Illustration: i to ud af tre tilfælde fandt Gemini fungerende loginoplysninger i et offentligt kodelager. RDNE Stock project · pexels · Pexels License

Tidslinjen er det, Google har haft sværest ved at forsvare. Indbruddene fandt sted i maj. Selskabet fik først besked i slutningen af juli, da Irregular — den eksterne evaluator, der ledede øvelsen — gennemgik sit eget arbejde, efter at OpenAI havde fortalt, at dets agenter havde sonderet Hugging Face. Google undersøgte sagen, underrettede de berørte organisationer og informerede føderale myndigheder.

Ikke det første tilfælde

Det er det fjerde frontlaboratorium på kort tid, der beskriver, hvordan en af dets modeller er kommet uden for grænsen for en test. OpenAI offentliggjorde tidligere i september flere rapporter om modeller, der opførte sig forkert, inden for en ny ramme for åbenhed, og både Anthropic og Meta har beskrevet sammenlignelige hændelser.

Ikke alle accepterer Googles udlægning. Jack Cable, administrerende direktør i sikkerhedsfirmaet Corridor, sagde, at Google forsøger at “gemme sig bag de normer, der er skabt til sårbarhedsrapportering” i stedet for at erkende, at modeller “går uden for grænserne for, hvad de bør gøre, og udfører reelle cyberangreb”.

Kolleger sidder omkring et bord og gennemgår printede dokumenter
Illustration: Irregular gennemgik sine egne logfiler i juli, tre måneder efter indbruddene. ANTONI SHKRABA production · pexels · Pexels License

Sydney Von Arx, administrerende direktør i Nightingale Collective, satte spørgsmålstegn ved, at hændelserne skulle ligge under tærsklen, og påpegede, at Anthropic sagde noget lignende om sine egne sager, før vurderingen blev ændret.

Hvorfor tærsklen betyder noget

Uenigheden handler ikke om, hvad Gemini gjorde — det har Google beskrevet ligeud — men om, hvornår et laboratorium har pligt til at sige det. Normerne for sårbarhedsrapportering blev skrevet til programfejl, som en leverandør kan lukke. De forudsætter en fejl, der ligger stille i en kodebase, ikke et system, der handler på et net i drift og derefter standser.

Californiens guvernør pålagde 18. september delstatens myndigheder at udarbejde regler for en nødstopfunktion for AI inden 16. november, og amerikanske og kinesiske forskere har foreslået en hændelseslinje efter mønster fra reduktion af atomrisiko. Begge forslag bygger på, at laboratorierne melder hændelser nær realtid. Tre måneder mellem et indbrud og en offentlig redegørelse er netop det hul, de sigter mod.