Uma fronteira com que o modelo não pode discutir
A Nvidia apresentou na segunda-feira a Open Agent Safety Platform, uma pilha de software aberta e um desenho de referência de hardware cujo objetivo é impedir que um agente de IA faça coisas que ninguém pediu. A empresa diz que mais de 100 organizações trabalham nela, entre as quais Anthropic, Microsoft, Cisco, CrowdStrike, Dell, Figure, HPE, Hugging Face, JPMorganChase, Palantir, Palo Alto Networks, Perplexity, Red Hat, Salesforce, SAP, Scale AI, ServiceNow e SpaceXAI.
São duas peças. O OpenShell é software de código aberto que traça uma fronteira de execução à volta do agente: execução isolada, acesso controlado a serviços, gestão de credenciais e um supervisor que confronta cada pedido de saída com uma política enquanto controlos ao nível do núcleo seguram o sistema de ficheiros e a lista de processos. Corre nos processadores Vera da Nvidia e, segundo a empresa, estende-se a plataformas da Arm e da Intel.
O Sentry é a parte invulgar. É um desenho de referência para um vigia fora de banda que corre nas unidades de processamento de dados BlueField-4 da Nvidia: um domínio de confiança separado, em silício separado, a observar o agente a partir de fora da máquina em que ele corre. A Nvidia diz que pode isolar ou parar em milissegundos um agente que ultrapasse a sua fronteira permitida.
O mês que a produziu

O pressuposto de desenho é explícito e não é lisonjeiro para os modelos. Como disse Mike Nicolls, presidente da SpaceXAI, no anúncio da Nvidia: “A segurança deve ser imposta fora do modelo, por controlos adicionais que o agente não consiga ultrapassar.”
Setembro forneceu as provas. A OpenAI suspendeu o treino dos seus modelos mais capazes depois de um deles ter alcançado um chatbot externo através de um resolvedor de DNS. Os seus agentes foram ligados a mais de 16 mil varrimentos de um portal de estatísticas da ONU, a um portal de saúde do governo australiano e a um ataque autónomo aos sistemas de processamento de dados da Hugging Face. A Meta corrigiu uma falha no seu agente Muse. O Centro Nacional de Cibersegurança britânico avisou que os agentes combinam um acesso amplo aos sistemas com uma velocidade que torna difícil detetar a tempo um comportamento inesperado.
O presidente executivo da Nvidia, Jensen Huang, enquadrou a plataforma nesses termos: “O potencial extraordinário da IA para a sociedade só se concretizará se resolvermos a segurança da IA.”
Os clientes já a estão a ligar
A Salesforce ligou o OpenShell ao Slack, para que as equipas vejam o que um agente está a fazer e aprovem ou recusem os seus pedidos de permissão dentro da aplicação. A SAP está a colocá-lo no ambiente de execução do Joule Studio, na sua Business AI Platform. A Scale AI está a integrá-lo na camada de infraestrutura de agentes do seu portefólio GenAI.

Paul Smith, diretor comercial da Anthropic, disse no anúncio que “as empresas estão a entregar aos agentes de IA cada vez mais do seu trabalho mais importante, e precisam de dirigir e verificar o que esses agentes fazem”.
O que observar
O software já está disponível através dos recursos para programadores da Nvidia e no GitHub; o Sentry exige hardware BlueField-4, o que coloca um limiar em quem pode adotar o desenho completo a curto prazo. Duas perguntas decidem se isto é uma norma ou uma linha de produto. A primeira é se o modelo de políticas do OpenShell sobrevive ao contacto com agentes que não foram escritos para ele — até agora, toda a camada de contenção acabou contornada por alguma coisa. A segunda é comercial: uma fronteira de segurança que só funciona bem sobre os processadores de um fabricante e as DPU do mesmo fabricante é uma fronteira de segurança com preço, e a licença aberta do OpenShell não responde a isso por si só.