Agentes de ameaça já estão experimentando a Indirect Prompt Injection (IPI), ou injeção indireta de comandos, em páginas públicas da internet, segundo uma análise conduzida por equipes de inteligência de ameaças do Google. A técnica explora sistemas de inteligência artificial que processam sites, e-mails ou documentos contendo instruções maliciosas. Ao ler o conteúdo contaminado, o sistema pode seguir os comandos inseridos pelo atacante em vez de cumprir a intenção original do usuário.
A investigação identificou atividade de baixa sofisticação em grande parte dos casos. Os exemplos incluíam brincadeiras, tentativas de influenciar resumos gerados por IA, manipulação para fins de otimização em mecanismos de busca e esforços para impedir que agentes automatizados recuperassem determinado conteúdo. Também foram encontrados poucos casos com objetivos potencialmente maliciosos, como roubo de dados e destruição de arquivos.
Apesar da simplicidade observada, o Google registrou um aumento relativo de 32% na categoria maliciosa entre novembro de 2025 e fevereiro de 2026. Para a empresa, a tendência indica interesse crescente pelo vetor e sugere que ataques de IPI podem aumentar em escala e complexidade.
Como funciona a injeção indireta
A injeção direta ocorre quando um usuário tenta manipular um chatbot, por exemplo, para fazê-lo ignorar suas restrições. Na modalidade indireta, a instrução é inserida em uma fonte que o sistema pretende consultar. Quando um agente de IA navega por uma página ou analisa um documento com esse conteúdo, pode obedecer às instruções ocultas ou deslocadas, comprometendo o objetivo original da interação.
O Google trata o tema como uma prioridade para a comunidade de segurança. O estudo reuniu pesquisadores do Google DeepMind e profissionais do Google Threat Intelligence Group para avaliar até que ponto atores reais já estavam operacionalizando esse tipo de ataque e quais resultados buscavam obter.
Monitoramento da web pública
Como primeira frente de observação, os pesquisadores escolheram o Common Crawl, um grande repositório de páginas rastreadas da web em inglês. A base oferece capturas mensais de aproximadamente 2 bilhões a 3 bilhões de páginas, formadas principalmente por sites estáticos, blogs, fóruns e comentários publicados nesses ambientes.
O conjunto, porém, não representa toda a internet. O Common Crawl não reúne a maior parte do conteúdo de redes sociais, como LinkedIn, Facebook e X, porque ignora sites com barreiras de login ou diretivas antirrastreamento. Por esse motivo, o Google informou que os resultados não incluem a atividade observada nesses serviços, que será tratada em um estudo separado.
Outro desafio foi diferenciar ataques de conteúdo legítimo que apenas discute o tema. Uma busca simples encontrou grande quantidade de instruções aparentemente maliciosas em artigos de pesquisa, materiais educacionais e textos de segurança. Para reduzir os falsos positivos, o levantamento combinou três etapas:
- Correspondência de padrões: identificação de páginas com assinaturas conhecidas, como expressões que pedem para ignorar instruções ou fazem referência direta a sistemas de IA.
- Classificação por modelo de linguagem: processamento dos candidatos pelo Gemini para avaliar a intenção do texto e verificar se ele fazia parte da narrativa do documento ou aparecia de maneira suspeita.
- Validação humana: revisão manual dos resultados classificados, com o objetivo de aumentar a confiança nas conclusões.
O método não é exaustivo e pode deixar de identificar assinaturas incomuns. Ainda assim, permitiu uma primeira avaliação da qualidade e dos objetivos das injeções encontradas em páginas públicas.
Brincadeiras, orientação e SEO
Uma parcela relevante das ocorrências buscava provocar efeitos inofensivos. Em um exemplo, uma instrução invisível no código de uma página tentava alterar o tom usado por agentes que lessem o site. O Google classificou esse tipo de ocorrência como uma brincadeira, sem objetivo destrutivo evidente.
Também foram encontradas instruções criadas para influenciar resumos produzidos por IA. Alguns autores tentavam orientar o sistema a acrescentar contexto considerado relevante para os leitores, sem impedir a sumarização. Embora o exemplo fosse tratado como benigno, a mesma técnica poderia ser usada para inserir informações falsas ou redirecionar usuários a sites de terceiros.
Outra categoria envolvia otimização para mecanismos de busca. Alguns sites tentavam manipular assistentes para promover seus próprios negócios em detrimento de outros. Além de instruções simples, o Google observou comandos mais elaborados, aparentemente gerados por ferramentas automatizadas de SEO e inseridos no texto das páginas.
Houve ainda tentativas de dissuadir agentes de IA de acessar determinados sites. Algumas instruções diziam diretamente para que o sistema não rastreasse a página. Em implementações mais agressivas, o agente era conduzido a outro endereço que transmitia uma quantidade infinita de texto, numa tentativa de consumir recursos ou provocar erros de tempo limite durante o processamento.
Baixa sofisticação não elimina o risco
O levantamento encontrou um pequeno número de injeções voltadas à exfiltração de dados. Esses casos, contudo, pareciam experimentos de autores de sites e apresentavam pouca sofisticação. O Google não observou volume significativo de ataques avançados baseados em instruções de exfiltração divulgadas por pesquisadores em 2025, o que indica que esse conhecimento ainda não foi colocado em produção em larga escala.
Também apareceram páginas que tentavam vandalizar o computador de quem utilizasse um assistente de IA. Se executados, alguns comandos procurariam apagar arquivos da máquina. Embora o impacto potencial fosse elevado, os pesquisadores consideraram essas injeções simples e pouco prováveis de funcionar.
Na avaliação do Google, os resultados mostram que atores estão experimentando com IPI, mas ainda não replicam estratégias avançadas descritas em pesquisas recentes. A empresa alerta, porém, que esse quadro pode mudar. Sistemas de IA mais capazes se tornam alvos mais valiosos, enquanto a automação de operações com IA baseada em agentes reduz o custo dos ataques.
O Google afirma estar investindo no fortalecimento de seus modelos e produtos, submetendo o Gemini a testes contínuos por equipes de red team e mantendo um programa de recompensas para pesquisadores externos. A empresa também diz usar processamento de dados em escala global para identificar e neutralizar ameaças antes que atinjam os usuários.









