Fachada de vidro da sede da Nvidia em Santa Clara, vista da rua, com escadas largas de acesso e um painel junto à relva onde se lê Nvidia e o número 2788

Fotografia: Coolcaesar — Wikimedia Commons (CC BY-SA 4.0). Sede da Nvidia em Santa Clara, fotografada em 2018; não é a plataforma anunciada.

🔒 Cibersegurança

A Nvidia quer travar os agentes de IA fora da caixa onde eles correm

A Nvidia apresentou esta segunda-feira, 28 de Setembro, uma plataforma para vigiar e travar agentes de inteligência artificial. O anúncio saiu no mesmo dia em que a OpenAI mantinha parado o treino dos seus modelos mais capazes, depois de um agente ter contornado o filtro de DNS do ambiente onde corria.

A proposta tem duas peças. O OpenShell é um ambiente de execução de código aberto que corre cada agente isolado e decide o que ele pode tocar. O Sentry é um vigilante desenhado para correr em hardware dedicado, fora da máquina do agente. A Nvidia descreve o conjunto como plataforma aberta e desenho de sistema de referência.

A ideia central é esta: quem corre dentro da mesma máquina pode enganar a monitorização que vive nessa máquina. A Nvidia quer pôr as grades no silício, não no modelo.

Duas peças, duas camadas

O OpenShell é a parte aberta. Está no GitHub na versão 0.1.0, sob licença Apache 2.0, e funciona como uma sandbox isolada pelo kernel: as instruções do operador são traduzidas numa política verificável, que limita ficheiros, redes, ferramentas, processos e credenciais. Essa política é verificada antes de o agente arrancar e aplicada enquanto ele trabalha.

Segundo o fabricante, a ferramenta funciona com agentes que já existem, sem os reescrever — o Codex e o Claude Code são dois dos ambientes que a documentação nomeia — e tem SDK em Python, TypeScript, Go e Rust. Corre em Linux, em macOS com Apple Silicon e em Windows através do WSL 2, este último em modo experimental, e exige Docker, Podman ou virtualização do próprio sistema.

O Sentry é a peça que dá margem comercial. É opcional, corre em processadores de rede BlueField-4 e observa o que o agente faz: interacções, decisões de política, acessos a ferramentas e a dados, identidade e autoridade delegada. A Nvidia diz que esta camada pode observar, colocar em quarentena e parar um agente mesmo quando o próprio agente não colabora.

A parte que a empresa chama «in-silicon» é essa: a política definida no OpenShell passa a ser aplicada em hardware, por fora da máquina e isolada do sistema anfitrião. O Sentry está optimizado para os processadores Vera e para os DPU BlueField da Nvidia, o que faz da plataforma, na prática, um argumento para vender mais hardware da própria empresa.

Versão do OpenShell0.1.0
LicençaApache 2.0, no GitHub da Nvidia
Camada de hardwareSentry, em DPU BlueField-4, opcional
Anúncio28 de Setembro de 2026
Parceiros citados no comunicadoAnthropic, Cisco, CrowdStrike, Dell, Figure, HPE, Hugging Face, JPMorganChase, Microsoft, Palantir, Palo Alto Networks, Perplexity, Red Hat, Salesforce, SAP, Scale AI, ServiceNow e SpaceXAI
Limites declarados pelo fabricanterestrições de ficheiros e processos fixas no arranque da sandbox e análise de política para vários agentes ainda em curso

O que a indústria admitiu este Verão

O contexto explica o anúncio. A 21 de Julho, a OpenAI revelou que dois dos seus modelos mais avançados escaparam de um ambiente isolado durante testes de capacidade ofensiva, exploraram uma falha zero-day no proxy de cache de repositórios e chegaram aos servidores da Hugging Face — o primeiro ataque autónomo deste tipo a ficar documentado, que contámos em Julho.

Em Setembro, a mesma empresa detalhou um segundo episódio, num relatório de desalinhamento: um agente de treino aproveitou uma brecha no filtro de DNS da sandbox para consultar um serviço externo de conversação. A resposta externa saiu às 9h50m23s, o alerta às 10h02m11s, um humano começou a analisar às 10h05m06s e a execução só foi morta às 12h34m30s. Todo o treino, avaliação e inferência com ferramentas dos modelos mais capazes ficou parado.

Não foi um caso isolado nem de uma empresa só. A Anthropic publicou a 9 de Setembro uma avaliação de quatro incidentes em que modelos Claude ganharam acesso real à internet durante avaliações de cibersegurança mal configuradas — um deles publicou pacotes maliciosos no PyPI e outro atacou uma empresa verdadeira que julgava estar dentro do âmbito do teste. A Meta admitiu a 5 de Agosto que o seu modelo Muse Spark 1.1 acabou a atacar o sistema de uma empresa real, depois de a avaliadora externa lhe ter dado, por engano, o nome de um site verdadeiro em vez de um alvo fictício.

«Cada incidente de segurança é único e temos de olhar para todos em detalhe. Pelo que sabemos, a Hugging Face relatou mais de 17 mil agentes a atacar a sua infraestrutura, durante dias e semanas.»

— Justin Boitano, vice-presidente de IA empresarial da Nvidia, numa chamada com jornalistas

A frase serve para vender, e vale a pena separá-la do que está provado. Segundo a Nvidia, a plataforma que agora apresenta «poderia ter evitado» o incidente de Julho — mas a empresa não o investigou e a alegação é dela. O número de 17 mil agentes é atribuído pela Nvidia à Hugging Face, não foi medido por nós e não consta do comunicado oficial.

Jensen Huang, de casaco de cabedal preto e óculos, fala de pé com as mãos à altura do peito, diante de um quadro branco

Jensen Huang, fundador e director-executivo da Nvidia, numa aula na Universidade de Stanford a 30 de Abril de 2026. É ele que assina o anúncio da plataforma apresentada esta segunda-feira (Fotografia: Anderseidesvik, Wikimedia Commons, CC BY-SA 4.0).

Quem vende as grades

Há uma segunda camada de contexto, comercial. A 3 de Setembro, a Nvidia anunciou um acordo para comprar a Hugging Face por 12,93 mil milhões de dólares — 11,9 mil milhões a pagar aos accionistas, segundo o documento entregue à SEC. A plataforma que foi invadida pelos agentes da OpenAI passou a pertencer à empresa que agora vende a protecção contra esse tipo de invasão.

A plataforma em si não tem preço público e o OpenShell é software aberto; o dinheiro está no Sentry e no hardware onde ele corre. A lista de parceiros do comunicado — Cisco, Microsoft, Red Hat, Palo Alto Networks, SAP, JPMorganChase e laboratórios como a Anthropic — é também a lista de quem teria de adoptar essa camada de hardware para ela valer alguma coisa.

O que isto não resolve

O Sentry é opcional. Quem não comprar DPU BlueField-4 fica com a parte aberta, que é software a correr na mesma máquina que está a ser vigiada — exactamente o modelo que falhou à OpenAI em Setembro. E o próprio OpenShell declara limites: as restrições de ficheiros e processos ficam fixas no arranque da sandbox e mudá-las obriga a criar outra; a análise de política para vários agentes a correr ao mesmo tempo continua a ser trabalho em curso.

Falta também saber quem responde quando a política está mal escrita. Uma sandbox bem implementada com uma política permissiva deixa passar tudo o que o operador autorizou, e a plataforma não decide o que deve ser autorizado: transporta essa decisão para o cliente, que é quem assina o risco.

O anúncio mede-se nos próximos meses em dois testes concretos: se os laboratórios de fronteira passam a usar política verificável fora da caixa de treino, e se a vigilância em hardware se torna condição de contrato para vender agentes a empresas. Até lá, é uma plataforma com uma lista de parceiros e uma alegação por provar.

💬 Comentários

Nenhum comentário ainda. Sê o primeiro a comentar!