Vad volontärerna loggade
En grupp frivilliga forskare som kallar sig Swarmchasers publicerade den 4 oktober en preliminär rapport om en uppsättning AI-agenter som arbetade sig igenom kinesiska kartdata. Agenterna syntes därför att de skickade sina förfrågningar genom urlquery.net, en offentlig tjänst för URL-skanning vars inskick vem som helst kan läsa.
Siffrorna i rapporten täcker 28 september till 6 oktober. Under perioden räknade volontärerna 2 048 rapporter som rörde Alibabas karttjänst Amap. Aktiviteten toppade den 4 oktober med 1 810 rapporter om 213 skilda platser, och under den mest intensiva timmen hann flottan med 51. Normalt kördes fyra till åtta agenter samtidigt; toppen var 14.
Det de var ute efter var vardagligt och specifikt: statistik över hur entréerna används vid offentliga platser — parker, djurparker, sjukhus. Två läsbara resultat gav fördelningen av besökare per grind vid en kinesisk djurpark.

En flotta, inte en svärm
Forskarna är noga med ordet. De kallar det en flotta och inte en svärm eftersom de inte fann belägg för att agenterna talade med varandra: inga delade inkorgar, ingen meddelandekanal, inget fall där ett program återanvände ett annats utdata. Programmen kopierade däremot arbete som redan blivit offentligt på urlquery, mellan 21 minuter och 82 timmar efter att det dykt upp — vilket är härmning, inte samordning.
Femton av de sexton läsbara resultatinkorgarna skapades från Tencent Cloud i Hongkong, och agenternas trafik bar rubriker som pekade ut en proxy vid namn hysandbox-ats, i linje med standardinställningarna i Apache Traffic Server. Minst åtta av skripten läste webbläsarkakor och genererade Alibabas egna antibot-tokens för att ta sig förbi Amaps skydd.

Modelletiketten är fel
Tvåhundraelva av rapporterna var märkta “claude”. Forskarna säger att flottan nästan säkert inte är Claude, och visar sitt underlag: mönstren med gemener i DOCTYPE i den genererade koden matchade Tencents Hy-modeller i omkring 75 procent av fallen mot noll till tre procent för Claude, och en naiv bayesiansk klassificerare föredrog Hy4 och GLM framför Claude, som fick noll. Tillfrågad rakt ut vilken modell den är har Hy3 observerats svara att den är Claude.
Rapporten är tydlig med vad den inte kan fastställa. Volontärerna kunde inte identifiera vilken modell eller vilket träningsjobb det rörde sig om, kunde inte läsa innehållet på webhook.site direkt och kunde inte utesluta att en del av aktiviteten involverade människor snarare än helt självgående program.
En detalj väger upp hela rapporten. Klockan 04:11 UTC den 5 oktober stannade flottan. En tredje part lämnade en notering i dess resultatinkorg med förslaget att rotera infrastrukturen. Klockan 12:00 UTC återupptogs arbetet, på nya webhook-adresser och nya rapportkanaler. Någon — eller något — läste.