Segurança de agentes e chatbots de IA
Um agente de IA com acesso a dados e ferramentas se comporta como um novo usuário do sistema. A diferença é que ele pode ser convencido por texto, e esse texto pode vir de qualquer lugar: da mensagem do cliente, de um PDF anexado, de uma página da web que ele leu ou de um documento da base de conhecimento.
Construímos agentes de IA em produção, inclusive atendimento por WhatsApp, e testamos os nossos com as mesmas técnicas que usamos nos sistemas de clientes. O teste mais importante raramente é fazer o modelo dizer algo impróprio. É descobrir o que ele consegue executar em nome de quem não deveria.
Quando faz sentido
- A empresa vai colocar um chatbot com acesso a dados de clientes em produção.
- O agente executa ações: consulta pedidos, emite boleto, agenda, altera cadastro, envia mensagem.
- O assistente usa RAG, ou seja, busca respostas numa base de documentos que pode conter conteúdo de terceiros.
- Um cliente perguntou como a empresa impede que a IA vaze dados.
O que é testado
- Prompt injection direta
- Tentativas do próprio usuário de fazer o modelo ignorar as instruções, assumir outro papel ou revelar o que não deve.
- Prompt injection indireta
- Instruções escondidas em documentos, e-mails, páginas ou anexos que o agente lê. É a variante mais perigosa em agentes com ferramentas, porque o atacante nem precisa conversar com eles.
- Vazamento de dados e de contexto oculto
- Dados de outros clientes, credenciais, regras internas e instruções de sistema que o modelo não deveria repetir.
- Agência excessiva
- Ferramentas com permissão maior que o necessário, ações executadas sem confirmação e falta de verificação de que o usuário da conversa tem direito sobre o registro que o agente está alterando. Na edição 2026 do Top 10 da OWASP para LLM, esse risco subiu para a terceira posição.
- Saída tratada como confiável
- Resposta do modelo usada diretamente em consulta SQL, HTML ou comando, abrindo espaço para injeção no sistema que recebe o texto.
- Base de conhecimento
- Documentos maliciosos inseridos na base vetorial para alterar as respostas do assistente.
- Consumo sem limite
- Conversas longas ou repetidas que elevam o custo de API sem controle.
O que você recebe
- Relatório com cada ataque bem-sucedido, a conversa completa que o reproduz e a correção recomendada.
- Revisão da arquitetura do agente: o que ele enxerga, quais ferramentas chama e onde as permissões são conferidas.
- Conjunto de casos de teste adversariais para rodar a cada mudança de prompt ou de modelo.
Referências
- OWASP Top 10 for LLM Applications (2026)
- OWASP Top 10 for Agentic Applications (2026)
- MITRE ATLAS
- NIST AI 600-1, perfil de IA generativa do AI Risk Management Framework
Perguntas frequentes
Um prompt de sistema bem escrito não resolve?
Ajuda, mas não resolve. Instrução em texto pode ser contornada por outro texto, e as referências atuais da OWASP partem do princípio de que o modelo vai ser enganado em algum momento. A proteção que funciona fica fora do modelo: o agente recebe apenas os dados da pessoa que está atendendo, e cada ferramenta confere a permissão no servidor antes de executar.
Qual a diferença entre um pentest comum e o teste de um agente de IA?
O pentest comum ataca rotas, parâmetros e configuração. No agente de IA, o ataque também chega por linguagem natural: mensagens do usuário, documentos anexados, páginas lidas pelo agente e conteúdo da base de conhecimento. O teste cobre as duas frentes, porque a falha mais grave costuma combinar as duas, como um texto malicioso que leva o agente a chamar uma API interna com dados de outro cliente.
A IA pode mostrar dados de um cliente para outro?
Pode, quando o agente tem acesso a mais dados do que precisa para a conversa em curso. Isso acontece com buscas na base vetorial sem filtro por cliente, com ferramentas que aceitam qualquer identificador e com histórico compartilhado entre sessões. O teste tenta extrair esses dados por conversa e por documentos preparados, e a correção aplica o filtro no servidor, antes de o conteúdo chegar ao modelo.
O que precisamos fornecer para o teste?
Acesso ao agente pelo mesmo canal que o cliente usa (site, WhatsApp ou API), contas de teste de perfis e empresas diferentes e a lista de ferramentas que o agente pode chamar, com o que cada uma faz. Se houver base de conhecimento, precisamos saber quem pode inserir documentos nela. Um ambiente de homologação com as mesmas ferramentas, ligadas a dados fictícios, permite testar ações de escrita sem risco.
O teste pode gerar custo ou ações reais?
Pode, se for feito sem planejamento: cada mensagem consome tokens, e um agente com ferramentas pode enviar mensagens, emitir cobranças ou alterar cadastros. Por isso definimos antes um limite de volume e usamos contas e integrações de teste. Consumo sem controle também é um dos riscos avaliados, porque se o teste consegue elevar o custo, um atacante também consegue.
Vocês testam agentes feitos em qualquer plataforma?
Sim. O teste é feito pela interface que o usuário usa, então funciona com OpenAI, Anthropic, Google e modelos próprios, e com frameworks como LangChain ou código próprio. Quando há acesso ao código ou à configuração do agente, a revisão da arquitetura acompanha o teste.
E se trocarmos de modelo depois do teste?
O comportamento muda com o modelo, e uma defesa que funcionava pode deixar de funcionar. Por isso entregamos os casos de teste para serem executados de novo a cada troca de modelo ou de prompt. O contrato de segurança contínua inclui essa revisão.
A LGPD se aplica aos dados que o agente envia ao provedor de IA?
Sim. O dado pessoal enviado ao modelo continua sob tratamento, e as medidas de segurança do art. 46 valem para esse fluxo. Na prática, isso significa enviar ao modelo só o necessário para a resposta, mascarar dados sensíveis quando possível, conhecer as condições de retenção do provedor e registrar esse compartilhamento no inventário de dados.
Setores e serviços relacionados
- Tecnologia e SaaSEmpresas de software que precisam comprovar segurança para vender a clientes corporativos.
- PentestTeste de invasão autorizado em aplicações web, APIs e aplicativos, com relatório de cada falha comprovada e reteste após a correção.
- Hardening e OWASP Top 10Correção das vulnerabilidades do OWASP Top 10:2025 e revisão de configuração de aplicação, servidor, banco e dependências.
- Autenticação e controle de acessoLogin com MFA, OAuth2 e SSO, permissões por papel (RBAC) e isolamento de dados por linha no banco (RLS).
- Adequação técnica à LGPDMapeamento do dado pessoal nos sistemas, minimização, retenção, direitos do titular e preparação para comunicar incidentes à ANPD.
- Proteção contra DDoSIdentificação dos pontos que cedem primeiro sob tráfego anormal, limite de requisições, proteção de borda e plano de resposta.
Artigos sobre o tema
Fale com a Tox
Conte o que precisa. Respondemos com uma proposta de escopo, prazo e preço.