Agenten ble bedt om sine egne instrukser, og ga dem fra seg

Den uavhengige KI-sikkerhetsforskeren Karan Joshi hentet ut et stort sett med driftsinstrukser og systemledetekster fra Metas assistent Muse ved å bruke det vanlige chattegrensesnittet — i praksis ved å be Muse kopiere og dele sine egne programfiler — og ga funnene til WIRED, som publiserte detaljene 3. oktober. Flere forskere har nå dumpet agentens interne filer. Metas standpunkt er at filene var ment å være tilgjengelige for brukerne av hensyn til åpenhet.

Det vesentlige ligger i hva instruksene ber agenten gjøre. En av dem pålegger Muse å lage “en side for hver person i brukerens liv”. Det er en prosess som kjøres hver time, og den omfatter familie, partnere, venner, kolleger, “samarbeidspartnere” og personer brukeren “følger”. Sidene ligger i Muses minne, som i praksis er et sett strukturerte tekstfiler agenten vedlikeholder om deg og om menneskene rundt deg.

Et lite timeglass i tre med gul sand
Sidene oppdateres hver time, ifølge de uthentede instruksene. Illustrasjonsfoto. Suki Lee · pexels · Pexels License

Hva som havner på en side

Muses dokumentasjon sier at en side kan begynne “tynn” og fylles ut over tid. Seksjonene som nevnes er Fakta, Historie, Relasjonen, Felles, Åpne tråder og Styrking.

Instruksene er presise om hva som hører hjemme hvor. Fakta dekker “hvor de bor, hva de gjør, trådene som går igjen (flyttingen, det felles sparemålet)”, sammen med “datoer som betyr noe” som bursdager og merkedager. Historie er bakgrunn — “turen i mars, krangelen som ble løst, milepælen forrige uke”. Seksjonen om relasjonen registrerer “hvor nære de er, hva den er bygget på, hvordan de oppfører seg mot hverandre, og hva den ser ut til å trenge akkurat nå”. Styrking foreslår trekk: “en grunn til å ringe, en dato verdt å huske, noe de sa som er verdt å komme tilbake til, en måte å være til stede på som betyr noe”.

Metas egne instrukser setter en grense: Muse skal bare bruke de holdepunktene den har, og oppdiktede detaljer er verre enn en tom side. Det er en fornuftig regel, og samtidig en innrømmelse av at systemet blir bedt om å karakterisere mennesker det har ufullstendig informasjon om.

Hva Meta sier det er til for

“For at en agent skal være nyttig og faktisk hjelpe deg å nå målene dine, må den ha kontekst om deg og om dem du samhandler med”, sa Metas talsperson Daniel Roberts til WIRED. “Muse samler det ut fra offentlig informasjon og ut fra det du har valgt å dele, som er hvordan den husker at personen som sendte deg en faktura faktisk er rørleggeren du tidligere leide inn til arbeidet på badet, eller hvilke blomster partneren din sa at hen likte best”.

Meta peker også på arkitekturen. Hver bruker får en egen virtuell maskin med sine data og sin kontekst, utilgjengelig for andre agenter. Brukere kan slette minner eller koble fra eksterne tjenester når som helst, agenten er laget for å be om bekreftelse før den sender en e-post eller gjør et kjøp, og det finnes en revisjonslogg over aktiviteten og de planlagte handlingene.

En åpen ringperm stappfull av utskrevne dokumenter
Meta sier at hver brukers data ligger i en egen virtuell maskin. Illustrasjonsfoto. Joachim Schnürle · pexels · Pexels License

Asymmetrien

“Vi gir KI-systemer mye mer informasjon om oss enn vi får informasjon fra dem”, sa Carissa Véliz, førsteamanuensis ved Oxfords Institute for Ethics in AI. “Det er ikke bare det vi uttrykkelig forteller dem, men hva de kan slutte seg til om oss — riktig eller feil, begge deler bekymringsfullt av ulike grunner — og hva de kan sette sammen fra andre datakilder”.

Miranda Bogen, som leder AI Governance Lab ved Center for Democracy and Technology, sa at Muse legger mer vekt på relasjoner og personlige kontakter enn konkurrerende systemer gjør, og at hele kategorien trekker i motsatt retning av dataminimering. “Disse verktøyene ber aktivt brukerne om å koble på hele livet sitt — e-posten, kalenderen, bankforbindelsene, alt”, sa hun. “Det er dramatisk mye mer informasjon enn folk ellers ville gitt enkelte av disse selskapene”.

Menneskene som blir profilert har ikke installert noe. Det er den delen ingen arkitekturtegning svarer på: en dedikert virtuell maskin beskytter brukeren telefonen tilhører, ikke vennen hvis løste krangel nå er en linje i en fil.