DeServ LabsNOVO

O Diagnóstico e Avaliação de Conformidade da DeServ é um serviço estratégico que analisa o nível de aderência da sua empresa às principais normas, leis e boas práticas de segurança da informação, privacidade e governança.

Prepare sua empresa para a certificação ISO 27001 e fortaleça a conformidade com a LGPD.

A DeServ identifica gaps, orienta a implementação dos requisitos de Segurança da Informação, realiza avaliações de conformidade e acompanha sua organização até o processo de certificação por organismo independente.

A solução de Implementação de Políticas e Controles de Segurança da DeServ apoia empresas na criação, estruturação e aplicação prática de políticas, normas e controles que sustentam a segurança da informação, a privacidade de dados e a governança corporativa.

A solução de Treinamento e Cultura de Segurança da DeServ tem como objetivo capacitar colaboradores e lideranças para atuarem de forma consciente, responsável e alinhada às boas práticas de segurança da informação e proteção de dados.

Proteja endpoints, redes e servidores >

Produtividade, nuvem e colaboração >

Garanta backup, recuperação segura >

Monitore comportamentos e previna-se >

Infraestrutura robusta para o seu negócio >

Comunicação, suporte remoto e colaboração >

Visibilidade total. Segurança especializada >

Descubra, classifique e proteja dados >

Proteção de dados, backup e recovery >

Google detecta aumento de 32% em tentativas maliciosas de prompt injection indireto

6 min de leitura

Agentes de ameaça já estão experimentando a Indirect Prompt Injection (IPI), ou injeção indireta de comandos, em páginas públicas da internet, segundo uma análise conduzida por equipes de inteligência de ameaças do Google. A técnica explora sistemas de inteligência artificial que processam sites, e-mails ou documentos contendo instruções maliciosas. Ao ler o conteúdo contaminado, o sistema pode seguir os comandos inseridos pelo atacante em vez de cumprir a intenção original do usuário.

A investigação identificou atividade de baixa sofisticação em grande parte dos casos. Os exemplos incluíam brincadeiras, tentativas de influenciar resumos gerados por IA, manipulação para fins de otimização em mecanismos de busca e esforços para impedir que agentes automatizados recuperassem determinado conteúdo. Também foram encontrados poucos casos com objetivos potencialmente maliciosos, como roubo de dados e destruição de arquivos.

Apesar da simplicidade observada, o Google registrou um aumento relativo de 32% na categoria maliciosa entre novembro de 2025 e fevereiro de 2026. Para a empresa, a tendência indica interesse crescente pelo vetor e sugere que ataques de IPI podem aumentar em escala e complexidade.

Como funciona a injeção indireta

A injeção direta ocorre quando um usuário tenta manipular um chatbot, por exemplo, para fazê-lo ignorar suas restrições. Na modalidade indireta, a instrução é inserida em uma fonte que o sistema pretende consultar. Quando um agente de IA navega por uma página ou analisa um documento com esse conteúdo, pode obedecer às instruções ocultas ou deslocadas, comprometendo o objetivo original da interação.

O Google trata o tema como uma prioridade para a comunidade de segurança. O estudo reuniu pesquisadores do Google DeepMind e profissionais do Google Threat Intelligence Group para avaliar até que ponto atores reais já estavam operacionalizando esse tipo de ataque e quais resultados buscavam obter.

Monitoramento da web pública

Como primeira frente de observação, os pesquisadores escolheram o Common Crawl, um grande repositório de páginas rastreadas da web em inglês. A base oferece capturas mensais de aproximadamente 2 bilhões a 3 bilhões de páginas, formadas principalmente por sites estáticos, blogs, fóruns e comentários publicados nesses ambientes.

O conjunto, porém, não representa toda a internet. O Common Crawl não reúne a maior parte do conteúdo de redes sociais, como LinkedIn, Facebook e X, porque ignora sites com barreiras de login ou diretivas antirrastreamento. Por esse motivo, o Google informou que os resultados não incluem a atividade observada nesses serviços, que será tratada em um estudo separado.

Outro desafio foi diferenciar ataques de conteúdo legítimo que apenas discute o tema. Uma busca simples encontrou grande quantidade de instruções aparentemente maliciosas em artigos de pesquisa, materiais educacionais e textos de segurança. Para reduzir os falsos positivos, o levantamento combinou três etapas:

  • Correspondência de padrões: identificação de páginas com assinaturas conhecidas, como expressões que pedem para ignorar instruções ou fazem referência direta a sistemas de IA.
  • Classificação por modelo de linguagem: processamento dos candidatos pelo Gemini para avaliar a intenção do texto e verificar se ele fazia parte da narrativa do documento ou aparecia de maneira suspeita.
  • Validação humana: revisão manual dos resultados classificados, com o objetivo de aumentar a confiança nas conclusões.

O método não é exaustivo e pode deixar de identificar assinaturas incomuns. Ainda assim, permitiu uma primeira avaliação da qualidade e dos objetivos das injeções encontradas em páginas públicas.

Brincadeiras, orientação e SEO

Uma parcela relevante das ocorrências buscava provocar efeitos inofensivos. Em um exemplo, uma instrução invisível no código de uma página tentava alterar o tom usado por agentes que lessem o site. O Google classificou esse tipo de ocorrência como uma brincadeira, sem objetivo destrutivo evidente.

Também foram encontradas instruções criadas para influenciar resumos produzidos por IA. Alguns autores tentavam orientar o sistema a acrescentar contexto considerado relevante para os leitores, sem impedir a sumarização. Embora o exemplo fosse tratado como benigno, a mesma técnica poderia ser usada para inserir informações falsas ou redirecionar usuários a sites de terceiros.

Outra categoria envolvia otimização para mecanismos de busca. Alguns sites tentavam manipular assistentes para promover seus próprios negócios em detrimento de outros. Além de instruções simples, o Google observou comandos mais elaborados, aparentemente gerados por ferramentas automatizadas de SEO e inseridos no texto das páginas.

Houve ainda tentativas de dissuadir agentes de IA de acessar determinados sites. Algumas instruções diziam diretamente para que o sistema não rastreasse a página. Em implementações mais agressivas, o agente era conduzido a outro endereço que transmitia uma quantidade infinita de texto, numa tentativa de consumir recursos ou provocar erros de tempo limite durante o processamento.

Baixa sofisticação não elimina o risco

O levantamento encontrou um pequeno número de injeções voltadas à exfiltração de dados. Esses casos, contudo, pareciam experimentos de autores de sites e apresentavam pouca sofisticação. O Google não observou volume significativo de ataques avançados baseados em instruções de exfiltração divulgadas por pesquisadores em 2025, o que indica que esse conhecimento ainda não foi colocado em produção em larga escala.

Também apareceram páginas que tentavam vandalizar o computador de quem utilizasse um assistente de IA. Se executados, alguns comandos procurariam apagar arquivos da máquina. Embora o impacto potencial fosse elevado, os pesquisadores consideraram essas injeções simples e pouco prováveis de funcionar.

Na avaliação do Google, os resultados mostram que atores estão experimentando com IPI, mas ainda não replicam estratégias avançadas descritas em pesquisas recentes. A empresa alerta, porém, que esse quadro pode mudar. Sistemas de IA mais capazes se tornam alvos mais valiosos, enquanto a automação de operações com IA baseada em agentes reduz o custo dos ataques.

O Google afirma estar investindo no fortalecimento de seus modelos e produtos, submetendo o Gemini a testes contínuos por equipes de red team e mantendo um programa de recompensas para pesquisadores externos. A empresa também diz usar processamento de dados em escala global para identificar e neutralizar ameaças antes que atinjam os usuários.

Fonte

Google Online Security Blog

Mais resultados...

Generic selectors
Exact matches only
Search in title
Search in content
Post Type Selectors

Índice

DeServ LabsNOVO
Acessar o conteúdo