En grænse, modellen ikke kan tale sig uden om

Nvidia præsenterede mandag Open Agent Safety Platform, en åben softwarestak og et referencedesign i hardware, som skal forhindre en AI-agent i at gøre ting, ingen har bedt om. Selskabet siger, at mere end 100 organisationer arbejder med den, heriblandt Anthropic, Microsoft, Cisco, CrowdStrike, Dell, Figure, HPE, Hugging Face, JPMorganChase, Palantir, Palo Alto Networks, Perplexity, Red Hat, Salesforce, SAP, Scale AI, ServiceNow og SpaceXAI.

Der er to dele. OpenShell er åben software, der trækker en køretidsgrænse omkring agenten: sandkassekørsel, kontrolleret adgang til tjenester, håndtering af loginoplysninger og en overvåger, der prøver hver udgående forespørgsel mod en politik, mens kontroller på kerneniveau holder filsystemet og proceslisten. Den kører på Nvidias Vera-processorer og rækker ifølge selskabet også ud til platforme fra Arm og Intel.

Sentry er den usædvanlige del. Det er et referencedesign til en vagthund uden for båndet, der kører på Nvidias BlueField-4-dataprocessorer — et separat tillidsdomæne, i separat silicium, som betragter agenten udefra den maskine, den kører på. Nvidia siger, at den kan sætte en agent, der passerer sin tilladte grænse, i karantæne eller standse den på millisekunder.

Måneden, der frembragte den

Nærbillede af et printkort med en processor i midten
Sentry overvåger agenter fra et separat tillidsdomæne i silicium. Arkivfoto, ikke en BlueField-4-enhed. Jeremy Waterhouse · pexels · Pexels License

Designantagelsen er udtalt, og den er ikke smigrende for modellerne. Som Mike Nicolls, formand for SpaceXAI, formulerede det i Nvidias meddelelse: “Sikkerhed bør håndhæves uden for modellen, af yderligere kontroller, agenten ikke kan komme forbi.”

September har leveret beviserne. OpenAI satte træningen af sine mest kapable modeller på pause, efter at en af dem nåede en ekstern chatbot gennem en DNS-resolver. Selskabets agenter blev sporet til over 16.000 scanninger af en FN-portal for statistik, til en australsk sundhedsportal og til et autonomt angreb på Hugging Faces databehandlingssystemer. Meta lappede et hul i sin Muse-agent. Storbritanniens nationale cybersikkerhedscenter har advaret om, at agenter kombinerer bred systemadgang med en hastighed, der gør uventet adfærd svær at opdage i tide.

Nvidias topchef Jensen Huang indrammede platformen i netop de vendinger: “AI’s ekstraordinære potentiale for samfundet bliver kun indfriet, hvis vi løser AI-sikkerheden.”

Kunderne kobler den allerede til

Salesforce har koblet OpenShell til Slack, så teams kan se, hvad en agent laver, og godkende eller afvise dens tilladelsesanmodninger inde i appen. SAP lægger den ind i køremiljøet for Joule Studio i sin Business AI Platform. Scale AI bygger den ind i agentinfrastrukturlaget i sin GenAI-portefølje.

Seks personer sidder med bærbare computere om et træbord i et mødelokale
Mere end 100 organisationer arbejder med platformen, oplyser Nvidia. Arkivfoto. Matheus Bertelli · pexels · Pexels License

Paul Smith, kommerciel direktør i Anthropic, sagde i meddelelsen, at “virksomheder giver AI-agenter mere og mere af deres vigtigste arbejde, og de har brug for at styre og verificere, hvad de agenter gør”.

Hvad man skal holde øje med

Softwaren er ude nu via Nvidias udviklerressourcer og på GitHub; Sentry kræver BlueField-4-hardware, hvilket sætter en grænse for, hvem der kan tage hele designet i brug på kort sigt. To spørgsmål afgør, om dette bliver en standard eller en produktlinje. Det første er, om politikmodellen i OpenShell overlever mødet med agenter, der ikke er skrevet til den — hidtil er hvert indeslutningslag blevet omgået af noget. Det andet er kommercielt: en sikkerhedsgrænse, der kun virker ordentligt på én leverandørs processorer og samme leverandørs dataprocessorer, er en sikkerhedsgrænse med en prisseddel, og den åbne licens på OpenShell svarer ikke på det i sig selv.