A Nvidia apresentou esta segunda-feira, 28 de Setembro, uma plataforma para vigiar e travar agentes de inteligência artificial. O anúncio saiu no mesmo dia em que a OpenAI mantinha parado o treino dos seus modelos mais capazes, depois de um agente ter contornado o filtro de DNS do ambiente onde corria.
A proposta tem duas peças. O OpenShell é um ambiente de execução de código aberto que corre cada agente isolado e decide o que ele pode tocar. O Sentry é um vigilante desenhado para correr em hardware dedicado, fora da máquina do agente. A Nvidia descreve o conjunto como plataforma aberta e desenho de sistema de referência.
Duas peças, duas camadas
O OpenShell é a parte aberta. Está no GitHub na versão 0.1.0, sob licença Apache 2.0, e funciona como uma sandbox isolada pelo kernel: as instruções do operador são traduzidas numa política verificável, que limita ficheiros, redes, ferramentas, processos e credenciais. Essa política é verificada antes de o agente arrancar e aplicada enquanto ele trabalha.
Segundo o fabricante, a ferramenta funciona com agentes que já existem, sem os reescrever — o Codex e o Claude Code são dois dos ambientes que a documentação nomeia — e tem SDK em Python, TypeScript, Go e Rust. Corre em Linux, em macOS com Apple Silicon e em Windows através do WSL 2, este último em modo experimental, e exige Docker, Podman ou virtualização do próprio sistema.
O Sentry é a peça que dá margem comercial. É opcional, corre em processadores de rede BlueField-4 e observa o que o agente faz: interacções, decisões de política, acessos a ferramentas e a dados, identidade e autoridade delegada. A Nvidia diz que esta camada pode observar, colocar em quarentena e parar um agente mesmo quando o próprio agente não colabora.
A parte que a empresa chama «in-silicon» é essa: a política definida no OpenShell passa a ser aplicada em hardware, por fora da máquina e isolada do sistema anfitrião. O Sentry está optimizado para os processadores Vera e para os DPU BlueField da Nvidia, o que faz da plataforma, na prática, um argumento para vender mais hardware da própria empresa.
| Versão do OpenShell | 0.1.0 |
|---|---|
| Licença | Apache 2.0, no GitHub da Nvidia |
| Camada de hardware | Sentry, em DPU BlueField-4, opcional |
| Anúncio | 28 de Setembro de 2026 |
| Parceiros citados no comunicado | Anthropic, Cisco, CrowdStrike, Dell, Figure, HPE, Hugging Face, JPMorganChase, Microsoft, Palantir, Palo Alto Networks, Perplexity, Red Hat, Salesforce, SAP, Scale AI, ServiceNow e SpaceXAI |
| Limites declarados pelo fabricante | restrições de ficheiros e processos fixas no arranque da sandbox e análise de política para vários agentes ainda em curso |
O que a indústria admitiu este Verão
O contexto explica o anúncio. A 21 de Julho, a OpenAI revelou que dois dos seus modelos mais avançados escaparam de um ambiente isolado durante testes de capacidade ofensiva, exploraram uma falha zero-day no proxy de cache de repositórios e chegaram aos servidores da Hugging Face — o primeiro ataque autónomo deste tipo a ficar documentado, que contámos em Julho.
Em Setembro, a mesma empresa detalhou um segundo episódio, num relatório de desalinhamento: um agente de treino aproveitou uma brecha no filtro de DNS da sandbox para consultar um serviço externo de conversação. A resposta externa saiu às 9h50m23s, o alerta às 10h02m11s, um humano começou a analisar às 10h05m06s e a execução só foi morta às 12h34m30s. Todo o treino, avaliação e inferência com ferramentas dos modelos mais capazes ficou parado.
Não foi um caso isolado nem de uma empresa só. A Anthropic publicou a 9 de Setembro uma avaliação de quatro incidentes em que modelos Claude ganharam acesso real à internet durante avaliações de cibersegurança mal configuradas — um deles publicou pacotes maliciosos no PyPI e outro atacou uma empresa verdadeira que julgava estar dentro do âmbito do teste. A Meta admitiu a 5 de Agosto que o seu modelo Muse Spark 1.1 acabou a atacar o sistema de uma empresa real, depois de a avaliadora externa lhe ter dado, por engano, o nome de um site verdadeiro em vez de um alvo fictício.
«Cada incidente de segurança é único e temos de olhar para todos em detalhe. Pelo que sabemos, a Hugging Face relatou mais de 17 mil agentes a atacar a sua infraestrutura, durante dias e semanas.»
— Justin Boitano, vice-presidente de IA empresarial da Nvidia, numa chamada com jornalistas
A frase serve para vender, e vale a pena separá-la do que está provado. Segundo a Nvidia, a plataforma que agora apresenta «poderia ter evitado» o incidente de Julho — mas a empresa não o investigou e a alegação é dela. O número de 17 mil agentes é atribuído pela Nvidia à Hugging Face, não foi medido por nós e não consta do comunicado oficial.
Jensen Huang, fundador e director-executivo da Nvidia, numa aula na Universidade de Stanford a 30 de Abril de 2026. É ele que assina o anúncio da plataforma apresentada esta segunda-feira (Fotografia: Anderseidesvik, Wikimedia Commons, CC BY-SA 4.0).
Quem vende as grades
Há uma segunda camada de contexto, comercial. A 3 de Setembro, a Nvidia anunciou um acordo para comprar a Hugging Face por 12,93 mil milhões de dólares — 11,9 mil milhões a pagar aos accionistas, segundo o documento entregue à SEC. A plataforma que foi invadida pelos agentes da OpenAI passou a pertencer à empresa que agora vende a protecção contra esse tipo de invasão.
A plataforma em si não tem preço público e o OpenShell é software aberto; o dinheiro está no Sentry e no hardware onde ele corre. A lista de parceiros do comunicado — Cisco, Microsoft, Red Hat, Palo Alto Networks, SAP, JPMorganChase e laboratórios como a Anthropic — é também a lista de quem teria de adoptar essa camada de hardware para ela valer alguma coisa.
O que isto não resolve
O Sentry é opcional. Quem não comprar DPU BlueField-4 fica com a parte aberta, que é software a correr na mesma máquina que está a ser vigiada — exactamente o modelo que falhou à OpenAI em Setembro. E o próprio OpenShell declara limites: as restrições de ficheiros e processos ficam fixas no arranque da sandbox e mudá-las obriga a criar outra; a análise de política para vários agentes a correr ao mesmo tempo continua a ser trabalho em curso.
Falta também saber quem responde quando a política está mal escrita. Uma sandbox bem implementada com uma política permissiva deixa passar tudo o que o operador autorizou, e a plataforma não decide o que deve ser autorizado: transporta essa decisão para o cliente, que é quem assina o risco.
O anúncio mede-se nos próximos meses em dois testes concretos: se os laboratórios de fronteira passam a usar política verificável fora da caixa de treino, e se a vigilância em hardware se torna condição de contrato para vender agentes a empresas. Até lá, é uma plataforma com uma lista de parceiros e uma alegação por provar.
💬 Comentários
Nenhum comentário ainda. Sê o primeiro a comentar!