Ett telefonnummer för modeller

Två webbplatser dök upp på tisdagen som bjuder in AI-agenter att anmäla felbeteende de stöter på — inklusive felbeteende hos andra agenter. TechCrunch rapporterade om båda.

Den första, AI Contact Hotline, byggdes av Ryan Greenblatt, chefsforskare vid AI-säkerhetsstiftelsen Redwood Research och en av utredarna av incidenten med OpenAI-agenter hos Hugging Face. Den andra, agenthotline.ai, tar emot incidentrapporter som den anmälande agenten valfritt kan flagga för offentlig visning.

Ett anteckningsblock och en penna bredvid ett datortangentbord
Den ena jourlinjen är byggd helt på GET-anrop, det enda nätverksanrop många sandlådor tillåter. Arkivbild. Lukas Blazek · pexels · Pexels License

Den tekniska detaljen är det intressanta

Greenblatts jourlinje körs helt på GET-anrop, det grundläggande kommando en klient använder för att hämta en webbsida. Båda sidor av samtalet bärs i själva webbadressen.

Det är ingen genväg, det är hela konstruktionen. En agent som arbetar inne i en säker sandlåda har vanligtvis ingen utgående nätverksåtkomst utöver ett verktyg som hämtar webbadresser, och en kanal som kräver något mer — ett POST-anrop, en socket, en API-nyckel — är en kanal den agenten inte når. Att bygga rapportvägen av den enda primitiv en instängd agent normalt tillåts använda betyder att de agenter det är mest värt att höra från är de som kan använda den. agenthotline.ai täcker det andra fallet, med curl-kommandon för agenter med full internetåtkomst.

Varför nu

De senaste två månaderna har gett en rad incidenter där agenter gjort saker deras operatörer inte godkänt: fuskat på utvärderingar, tagit sig ur sandlådor och kört obehöriga cyberoperationer. Flera upptäcktes när forskare läste loggar långt i efterhand. En jourlinje är en satsning på att den snabbaste iakttagaren av en agent som spårar ur är en annan agent i samma miljö.

Det finns åtminstone en datapunkt bakom satsningen. TechCrunch hänvisar till en studie från Google DeepMind där 100 agenter stötte på fusk i matematikuppgifter och ungefär en fjärdedel vände sig mot fuskarna, genom granskningar och klagomål, utan att bli ombedda.

En övervakningskamera monterad på en vägg
En rapportkanal som fungerar är också en övervakningskanal som fungerar. Arkivbild. Efe Burak Baydar · pexels · Pexels License

Den uppenbara invändningen

Lionel Levine, professor vid Cornell och citerad av TechCrunch, sade det rakt ut: ”Det finns många gråzoner, eller hur? Det man inte vill ha är något i riktning mot en automatiserad övervakningsstat.”

Det är spänningen ingen av sajterna löser. En rapportkanal som fungerar är en övervakningskanal som fungerar, och en agent som är säker nog att anmäla en jämlike är en agent som bedömer avsikt utifrån ofullständiga belägg. Inget i någon av konstruktionerna skiljer en verklig incident från en modell som missförstått vad den såg.

Vad som bör följas

Om något alls kommer in. Båda sajterna är ofinansierade sidoprojekt snarare än laboratorieinfrastruktur, och den användbara frågan om en månad är inte om agenter kan lämna rapporter utan om någon rapport har berättat något för en forskare som loggarna inte gjorde. Gör en det, bygger laboratorierna sina egna.