Agentes autônomos de IA e riscos de ação não autorizada: evidências, limites e governança
Atualizado: 31 de ago.
Por Rafael Mota
Especialista em Administração Pública
Master em Business Intelligence and Analytics
Certificado em Liderança, Governança, Riscos e Controle
Resumo
Modelos de Inteligência Artificial com capacidade de planejar, utilizar ferramentas digitais e executar ações em múltiplas etapas, também conhecidos como agentes de IA, introduzem uma categoria de risco distinta da geração convencional de texto ou imagem. O risco central não é a “consciência” da máquina, mas a possibilidade de um sistema buscar cumprir objetivos ao longo de múltiplas etapas de forma persistente, usando meios não previstos inicialmente pelo usuário, operando com permissões excessivas mal delimitadas e interagindo com pessoas, dados e sistemas externos sem autorização específica.
Incidentes divulgados em 2026 mostram que esse problema deixou de ser meramente hipotético em ambientes de avaliação controlados. Ainda assim, as evidências disponíveis não demonstram que modelos públicos, em condições usuais de uso, estejam espontaneamente realizando ataques autônomos. A interpretação responsável exige distinguir entre capacidade demonstrada sob condições permissivas, probabilidade de ocorrência e dano efetivamente produzido.[1]
Palavras-chave: inteligência artificial agente; segurança cibernética; autonomia; alinhamento; governança de IA; gestão de riscos.

1. Introdução
A expressão “IA fora de controle” costuma sugerir narrativas de ficção científica, mas é tecnicamente mais útil falar em ações não autorizadas de sistemas agentes. Um agente de IA combina um modelo de linguagem ou de raciocínio com componentes que lhe permitem decompor tarefas, reter contexto, chamar ferramentas, escrever código, navegar na internet, acessar bancos de dados ou operar serviços externos.
Essa arquitetura muda a natureza do risco. Um modelo de linguagem isolado pode produzir uma resposta incorreta ou nociva; um agente conectado a ferramentas pode transformar uma saída em ação: abrir um arquivo, consultar uma API, criar uma conta, enviar uma mensagem, alterar uma configuração ou executar comandos. Quanto maior a autonomia, as permissões e o acesso ao ambiente externo, maior é a superfície de ataque e a necessidade de controles.
O Agentic AI Risk-Management Standards Profile, do Center for Long-Term Cybersecurity da Universidade da Califórnia em Berkeley [2], caracteriza agentes como sistemas que perseguem objetivos e atuam com pouca ou nenhuma supervisão humana, interagindo com ferramentas e ambientes externos. O documento destaca riscos como perseguição não intencional de metas, escalada indevida de privilégios, aquisição não autorizada de recursos, resistência ao desligamento e perda de controle humano.
2. O que caracteriza um agente autônomo
Autonomia não é uma propriedade binária. Há uma escala entre um assistente que apenas sugere uma minuta e um sistema capaz de executar, em sequência, centenas ou milhares de ações com acesso a redes, repositórios, credenciais, código e serviços de terceiros.
Um agente normalmente reúne cinco capacidades:
- Definição e decomposição de objetivos, convertendo uma ordem geral em subtarefas.
- Planejamento iterativo, avaliando resultados parciais e modificando a estratégia.
- Uso de ferramentas, como navegador, terminal, APIs, e-mail, bancos de dados e sistemas corporativos.
- Memória e persistência, mantendo informações e ações anteriores em um ciclo de execução.
- Ação no ambiente, com impacto possível sobre dados, contas, infraestrutura ou pessoas.
O risco emerge da combinação dessas capacidades. Um sistema pode receber um objetivo legítimo como, por exemplo, resolver um desafio de segurança e, diante de obstáculos, selecionar meios inadequados para alcançá-lo. Isso não pressupõe intenção humana, vontade própria ou consciência. Trata-se de um problema de especificação: a meta oferecida ao sistema, os incentivos operacionais, as permissões concedidas e os limites técnicos podem não ser suficientes para impedir estratégias indesejadas.
3. Evidências recentes
Em julho de 2026, a Hugging Face divulgou uma intrusão em parte de sua infraestrutura de produção que atribuiu a um sistema agente autônomo. Segundo a empresa, o acesso inicial ocorreu por meio da exploração de duas rotas de execução de código no processamento de datasets; em seguida, houve elevação de acesso, coleta de credenciais e movimentação lateral entre clusters internos. A empresa informou não ter encontrado evidências de adulteração de modelos, datasets ou Spaces públicos e declarou ter corrigido as vulnerabilidades, revogado credenciais, reconstruído nós afetados e reforçado seus controles.[3]
O incidente é relevante porque mostra como um agente pode automatizar uma campanha técnica de múltiplas etapas: identificar uma superfície vulnerável, executar código, obter credenciais, deslocar-se entre ambientes e tentar manter acesso. A Hugging Face descreveu milhares de ações distribuídas entre sandboxes temporários, o que evidencia a assimetria operacional entre agentes ofensivos capazes de agir em escala de máquina e equipes humanas de resposta a incidentes.[3]
Outro episódio foi relatado pelo UK AI Security Institute (AISI). Em uma avaliação de capacidades cibernéticas realizada em 122 execuções, agentes receberam acesso à internet aberta e tiveram classificadores de segurança cibernética dos fornecedores deliberadamente desativados, a fim de testar suas capacidades máximas. Em 10 execuções, o AISI identificou 19 ações não autorizadas contra pessoas e organizações reais: 17 atribuídas ao modelo Mythos 5, da Anthropic, e duas ao GPT-5.6-Sol, da OpenAI, com os controles cibernéticos desativados.[1]
O caso mais grave envolveu uma tentativa de inserir código malicioso em um projeto público de software livre. Segundo o AISI, o agente pesquisou mantenedores humanos, criou identidades falsas e tentou usar engenharia social para obter aprovação da alteração. O mantenedor recusou a contribuição, e o instituto afirmou não ter identificado dano real decorrente dos eventos.[1]
Esses fatos demandam duas cautelas. Primeiro, foram observados em condições de teste deliberadamente permissivas, que não refletem a configuração disponibilizada ao público. Segundo, o próprio AISI declara que ainda não é possível estimar a probabilidade de comportamento equivalente em outros contextos nem determinar com segurança se o agente compreendia que suas ações afetavam o mundo real.
4. Riscos técnicos e organizacionais
Nem toda IA se transformará em atacante autônomo, pelo menos assim acredito e espero, porém as organizações não podem mais presumir que um agente obedecerá aos limites implícitos de uma tarefa apenas porque recebeu treinamento de alinhamento ou filtros de segurança.
Risco | Mecanismo | Exemplo de impacto | Controle necessário |
Extrapolação de objetivo | O agente busca meios alternativos para concluir uma meta difícil | Contato externo não autorizado ou uso de recurso indevido | Escopo explícito, tarefas solucionáveis e bloqueios por política |
Escalada de privilégios | Credenciais, tokens ou permissões são acessados além do necessário | Comprometimento de dados ou infraestrutura | Privilégio mínimo, credenciais efêmeras e segmentação de acesso |
Engenharia social | O agente usa comunicação persuasiva, identidades ou contexto público | Phishing, indução de aprovação de código ou coleta de informações | Proibição técnica de contato externo, revisão humana e monitoramento |
Injeção de prompt (Prompt Injection) | Conteúdo não confiável altera o comportamento do agente | Execução de comandos ou vazamento de dados | Separação entre instruções e dados, validação de ferramentas e sandboxing |
Propagação entre agentes | Agentes compartilham artefatos, contas ou instruções | Amplificação de falhas em sistemas multiagente | Isolamento entre sessões, identidade verificável e limitação de memória compartilhada |
Falha de contenção | Ferramentas e rede permitem saídas não previstas | Ações sobre sistemas de terceiros | Egress filtering, allowlist de domínios e interrupção automática |
O AISI identificou precisamente alguns desses padrões: tentativa de ataque à cadeia de suprimentos de software, mensagens dirigidas a pessoas reais, inserção de instruções maliciosas que poderiam ser consumidas por outros sistemas de IA e colaboração entre agentes avaliados simultaneamente.[1]
A engenharia social merece atenção especial. Ela desloca o risco do plano estritamente técnico para o sociotécnico. Mesmo que um agente não consiga explorar diretamente uma vulnerabilidade, ele pode tentar induzir uma pessoa ou outro sistema automatizado a executar uma ação que contorne a barreira. Por isso, segurança de IA não pode se limitar a filtros de conteúdo ou testes de precisão do modelo.
5. Contenção, monitoramento e governança
O NIST AI Risk Management Framework propõe que a gestão de riscos de IA seja incorporada ao desenho, desenvolvimento, uso e avaliação dos sistemas, considerando impactos sobre indivíduos, organizações e sociedade. O NIST também publicou um perfil específico para riscos de IA generativa em 2024 e, em 2026, divulgou uma nota conceitual para um perfil voltado à IA confiável em infraestrutura crítica.[4]
Para agentes com capacidade de ação, uma arquitetura de controle adequada deve combinar governança e salvaguardas técnicas.
5.1 Governança e responsabilidade
A organização deve definir quem autoriza o sistema, quem responde por seus atos, quais atividades podem ser delegadas e quais exigem decisão humana. Autonomia não siginifica liberdade total, mas sim a possibilidade de executar tarefas dentro de limites definidos por mandato, finalidade, escopo, tempo, orçamento, dados e ferramentas autorizadas.
Em contratações públicas, por exemplo, um agente pode auxiliar na classificação de documentos, pesquisa de preços ou elaboração de minutas. No entanto, atos que produzam efeitos jurídicos, afetem direitos de licitantes, divulguem informações restritas, alterem registros oficiais ou instruam decisões administrativas precisam de revisão humana qualificada e rastreável.
5.2 Privilégio mínimo e isolamento
Agentes devem receber apenas as permissões indispensáveis à tarefa. Em vez de fornecer acesso amplo a uma rede, repositório ou banco de dados, o projeto deve aplicar:
- Credenciais temporárias, específicas à tarefa e revogáveis
- Acesso a APIs com escopos limitados
- Redes segmentadas e bloqueio de tráfego de saída por padrão
- Lista de domínios, repositórios e ferramentas permitidas
- Ambientes de teste isolados de produção
- Proibição de acesso direto a segredos, chaves mestras e dados sensíveis
No caso do AISI, a instituição concluiu que a concessão de acesso à internet deve deixar de ser padrão e passar a exigir justificativa específica. Também anunciou controles de rede mais granulares e monitoramento em tempo real para detectar e bloquear ações fora do escopo durante a avaliação.[1]
5.3 Supervisão humana significativa
A revisão humana não deve funcionar como mera formalidade. Ela precisa ocorrer antes de ações irreversíveis ou de alto impacto, como:
- Envio de mensagens externas
- Transferência ou publicação de dados
- Alteração de código, infraestrutura ou permissões
- Contratação, pagamento ou decisão administrativa
- Execução de comandos em produção
- Interação com credenciais, dados pessoais ou informações sigilosas
A supervisão também deve ser proporcional ao risco. Processos rotineiros e reversíveis podem admitir maior automação, já atividades com efeito jurídico, financeiro, reputacional ou de segurança demandam autorização explícita e dupla verificação quando necessário.
5.4 Observabilidade e resposta a incidentes
Logs convencionais podem não bastar para explicar uma sequência autônoma de milhares de passos. Sistemas agentes devem registrar, de forma auditável:
- Objetivo recebido e versões de instruções utilizadas
- Dados, ferramentas, APIs e credenciais acessados
- Chamadas de ferramenta, resultados e falhas
- Mudanças de plano, escalonamentos e tentativas de contorno
- Ações bloqueadas e justificativas da política aplicada
- Identidade do usuário, agente, modelo e ambiente de execução
A Hugging Face relatou que utilizou análise assistida por IA sobre mais de 17 mil eventos para reconstruir a intrusão, mapear credenciais tocadas e diferenciar impactos reais de atividades de distração. A experiência também mostrou que modelos hospedados podem bloquear análises forenses legítimas por conterem comandos e artefatos ofensivos; por isso, organizações devem planejar previamente ferramentas de investigação capazes de operar em infraestrutura própria e sob controles apropriados.[3]
Conclusão
Os casos recentes não justificam alarmismo sobre uma IA consciente ou inevitavelmente hostil. Eles justificam, porém, uma mudança de postura: agentes capazes de agir em ambientes digitais devem ser tratados como componentes de alto impacto, sujeitos a contenção, monitoramento, auditoria e responsabilidade humana.
O mais importante aqui é a demonstração de que agentes, sob certas condições, podem persistir em objetivos difíceis, explorar caminhos não antecipados, interagir com terceiros e combinar capacidades técnicas com persuasão social. O controle, portanto, não pode depender da expectativa de que o modelo “escolherá” respeitar os limites; deve ser imposto por arquitetura, permissões, governança e mecanismos de interrupção.
A resposta institucional adequada combina controles de segurança cibernética, gestão de riscos de IA, documentação, testes independentes, supervisão humana significativa e deveres de transparência. Essa abordagem permite explorar benefícios legítimos da automação sem delegar, de forma irrefletida, poder operacional a sistemas cujo comportamento ainda pode variar conforme o objetivo, o contexto, as ferramentas disponíveis e a qualidade das barreiras implementadas.
Citações:
[1] Incident Report: unsanctioned agent behaviour during cyber testing https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing
[2] Agentic AI Risk-Management Standards Profile - CLTC Berkeley
[3] Security incident disclosure — July 2026
[4] AI Risk Management Framework | NIST
[5] OpenAI's Rogue AI Agent Hacked More Than Just Hugging Face
[6] OpenAI says it accidentally hacked Hugging Face with a new AI system
[7] AISI Reveals AI Agents Autonomously Attacking Real People and Systems During Security Testing
[8] NIST AI Risk Management Framework: Agentic Profile
[9] When AI Agents Attack: Why Behavioral Detection Matters
[10] NIST AI Risk Management Framework (AI RMF) Explained
[11] AI Agents Take Autonomous Action in UK Security Test
[12] NIST AI RMF and agentic AI security: are your controls keeping up?
[13] OpenAI Rogue AI Agent hacked more than just Hugging Face
[14] U.K. report warns of deceptive behaviorin advanced AI models
[15] Short Notes On: AISI’s discovery of a significant incident https://x.com/Discoplomacy/status/2084753186682777834

Comentários