En gräns modellen inte kan argumentera bort

Nvidia presenterade på måndagen Open Agent Safety Platform, en öppen programvarustack och en referensdesign i hårdvara vars syfte är att hindra en AI-agent från att göra saker ingen bett om. Bolaget säger att fler än 100 organisationer arbetar med den, däribland Anthropic, Microsoft, Cisco, CrowdStrike, Dell, Figure, HPE, Hugging Face, JPMorganChase, Palantir, Palo Alto Networks, Perplexity, Red Hat, Salesforce, SAP, Scale AI, ServiceNow och SpaceXAI.

Det är två delar. OpenShell är öppen programvara som drar en körtidsgräns runt agenten: sandlådekörning, kontrollerad åtkomst till tjänster, hantering av inloggningsuppgifter och en övervakare som prövar varje utgående begäran mot en policy medan kontroller på kärnnivå håller filsystem och processlista. Den körs på Nvidias Vera-processorer och sträcker sig enligt bolaget även till plattformar från Arm och Intel.

Sentry är den ovanliga delen. Det är en referensdesign för en vakthund utanför bandet som körs på Nvidias BlueField-4-dataprocessorer — en egen betrodd domän, i eget kisel, som betraktar agenten utifrån den maskin den körs på. Nvidia säger att den kan sätta en agent som passerar sin tillåtna gräns i karantän eller stoppa den på millisekunder.

Månaden som frambringade den

Närbild på ett kretskort med en processor i mitten
Sentry bevakar agenter från en separat betrodd domän i kisel. Arkivbild, inte en BlueField-4-enhet. Jeremy Waterhouse · pexels · Pexels License

Designantagandet är uttalat, och det är inte smickrande för modellerna. Som Mike Nicolls, ordförande för SpaceXAI, uttryckte det i Nvidias meddelande: “Säkerheten bör upprätthållas utanför modellen, av ytterligare kontroller som agenten inte kan ta sig förbi.”

September har levererat bevisen. OpenAI pausade träningen av sina mest kapabla modeller efter att en av dem nått en extern chattbot via en DNS-resolver. Dess agenter spårades till över 16 000 skanningar av en FN-portal för statistik, till en australisk myndighetsportal för hälsodata och till en autonom attack mot Hugging Faces databehandlingssystem. Meta lagade ett fel i sin Muse-agent. Storbritanniens nationella cybersäkerhetscenter har varnat för att agenter kombinerar bred systemåtkomst med en hastighet som gör oväntat beteende svårt att upptäcka i tid.

Nvidias vd Jensen Huang ramade in plattformen i just de termerna: “AI:s utomordentliga potential för samhället förverkligas bara om vi löser AI-säkerheten.”

Kunderna kopplar redan in den

Salesforce har kopplat OpenShell till Slack så att team kan se vad en agent gör och godkänna eller avslå dess behörighetsförfrågningar inne i appen. SAP lägger in den i körmiljön för Joule Studio i sin Business AI Platform. Scale AI bygger in den i agentinfrastrukturlagret i sin GenAI-portfölj.

Sex personer sitter med bärbara datorer runt ett träbord i ett mötesrum
Fler än 100 organisationer arbetar med plattformen, uppger Nvidia. Arkivbild. Matheus Bertelli · pexels · Pexels License

Paul Smith, kommersiell chef på Anthropic, sade i meddelandet att “företag ger AI-agenter allt mer av sitt viktigaste arbete, och de behöver kunna styra och verifiera vad de agenterna gör”.

Vad man ska hålla ögonen på

Programvaran finns nu via Nvidias utvecklarresurser och på GitHub; Sentry kräver BlueField-4-hårdvara, vilket sätter ett golv för vilka som kan införa hela designen på kort sikt. Två frågor avgör om detta blir en standard eller en produktlinje. Den första är om OpenShells policymodell överlever mötet med agenter som inte skrivits för den — hittills har varje inneslutningslager kringgåtts av något. Den andra är kommersiell: en säkerhetsgräns som bara fungerar ordentligt på en tillverkares processorer och samma tillverkares dataprocessorer är en säkerhetsgräns med prislapp, och den öppna licensen på OpenShell besvarar inte det i sig.