1

Humanos deixam passar, em média, 33% dos pedidos perigosos de agentes de programação com IA

O desenvolvedor Alex Wauters criou um jogo de navegador em que participantes têm 60 segundos para aprovar ou rejeitar solicitações simuladas de permissões. Na análise de mais de 40 mil partidas e 409 mil decisões, pedidos para acessar arquivos de configuração do Kubernetes e listas de credenciais da AWS foram aprovados, assim como comandos destrutivos, como “rm -rf”, e potencialmente maliciosos, incluindo “npm run analyze”, cujo script era desconhecido. Para Wauters, o problema ocorre devido à fadiga causada pelo excesso de solicitações repetitivas desses modelos, levando usuários a aprovarem permissões sem analisar o conteúdo com atenção.

Carregando publicação patrocinada...
1

Esse resultado toca num problema mais profundo: pedir confirmação para tudo transforma controle em ruído.

Ao implementar uma ponte MCP para operações SSH, o limite que achei mais útil foi separar autorização de acesso da autorização da ação:

  • autorização por agente e por sessão, revogável;
  • credenciais e chaves nunca entregues ao agente;
  • comandos executados em um terminal visível;
  • trilha de auditoria com dados sensíveis ocultados.

Mesmo assim, ações destrutivas ainda pedem uma camada adicional — confirmação por comando, política de allow/deny e, quando possível, dry-run. Sem isso, uma autorização inicial corre o risco de virar permissão geral. Segurança humana precisa reduzir a quantidade de decisões e aumentar a qualidade do contexto mostrado em cada uma.