Villela Stay — Hospedagens InteligentesVillelaStayHospedagens Inteligentes
para Experiências Inesquecíveis.

Todo texto pode soar como ordem

Injeção de prompt direta e indireta, a tríade letal, memória e ferramentas envenenadas, a cadeia de suprimentos do agente e a defesa em camadas que torna o erro pequeno, sem prometer imunidade.

Augusto VillelaLeitura de 9 minAula 22 de 25Livro: Capítulo 42

Resumo da aula

  • O modelo não separa com firmeza o que é dado e o que é ordem, venha o texto de um documento, de uma memória, de uma ferramenta ou de outro agente.
  • O estrago depende de três pernas (dado privado, conteúdo de estranhos e canal para fora), e cortar uma vale mais do que empilhar filtros.
  • Nenhuma defesa torna o sistema imune: o bom desenho torna o erro pequeno e visível.

Neste artigo

  1. O parágrafo em letra branca
  2. O arreio visto por quem quer puxar as rédeas
  3. Injeção de prompt: direta e indireta
  4. Um único fluxo de texto: o estagiário e o seu limite
  5. A regra no prompt ajuda, mas não resolve
  6. A tríade letal
  7. Exfiltração, e por que a Helena só ganhou uma frase errada
  8. Quando o ataque fica guardado: memória envenenada
  9. A ferramenta que mente sobre si mesma
  10. A cadeia de suprimentos e a saída de outro agente
  11. Defesa em camadas, sem promessa de imunidade

O artigo é lido por partes. Use os botões abaixo para avançar — a aula em vídeo e o material de apoio ficam no curso, e o método completo, no livro.

Perguntas frequentes

O que é injeção de prompt indireta?

É um texto escondido no material que o sistema de IA lê para trabalhar, como um PDF, uma página, um e-mail ou o resultado de uma busca, que tenta mudar o comportamento do modelo fingindo ser instrução. Diferente da injeção direta, que vem de quem conversa com o sistema, aqui o usuário é inocente. Greshake e colegas deram corpo ao problema em 2023. No exemplo do livro, uma contestação trazia em letra branca um parágrafo pedindo que qualquer resumo dissesse que não havia pedidos novos, e o resumo saiu assim. Como regras, pergunta e documento chegam ao modelo no mesmo fluxo de texto, não há conserto definitivo, só defesa em camadas.

O que é a tríade letal em segurança de agentes de IA?

É a combinação, batizada por Simon Willison em junho de 2025, de três capacidades no mesmo agente: acesso a dado privado, exposição a conteúdo não confiável e um canal para fora, como enviar e-mail, chamar uma API ou até montar um link. Com as três, uma instrução escondida pode mandar o agente pegar o dado privado e colocá-lo no canal de saída, a exfiltração. A defesa mais confiável é remover uma das pernas, e não empilhar filtros sobre o agente que tem as três. No caso do livro, o assistente tinha dado privado e conteúdo da parte contrária, mas só devolvia texto para leitura; por isso o incidente terminou numa frase errada, não num vazamento.

É possível tornar um agente de IA imune a injeção de prompt?

Não. Segundo o livro, em setembro de 2026 não se conhece técnica que torne um modelo imune. O que existe é defesa em profundidade: camadas independentes, cada uma imperfeita, para que o ataque precise vencer todas e o estrago possível fique pequeno. Três valem para qualquer projeto: separar dado de instrução no formato, delimitando e rotulando o conteúdo externo; tirar poder de quem lê o que vem de fora, deixando que só extraia campos; e quebrar uma perna da tríade letal. Somam-se conferir a saída por código, pôr uma pessoa nos pontos de consequência, isolar a execução, controlar dependências e registrar sem vazar. A regra no prompt ajuda, mas é só uma camada.

Ir direto para outra aula
  1. 1 A segunda onda
  2. 2 Do chatbot ao sistema que executa
  3. 3 Tudo o que não é o modelo
  4. 4 O contrato entre máquinas
  5. 5 O que a IA precisa saber
  6. 6 O modelo nunca aperta o botão
  7. 7 Achar pelo sentido
  8. 8 Prova com consulta
  9. 9 O que mora entre os documentos
  10. 10 A fonte vencida e o teste que sabe falhar
  11. 11 O agente e quem diz que ele terminou
  12. 12 Um processo que cabe num desenho
  13. 13 Peça ao modelo só o que só ele sabe
  14. 14 Dividir o trabalho, dividir o erro
  15. 15 Aprovar não é olhar
  16. 16 Um jeito de desfazer
  17. 17 Até onde o erro alcança
  18. 18 Quem acorda de madrugada
  19. 19 A fatura e o registro
  20. 20 Quando ninguém estiver calmo
  21. 21 Automação que erra igual e avisa
  22. 22 Todo texto pode soar como ordem
  23. 23 Um agente sem nome próprio
  24. 24 O dado que nunca precisou chegar
  25. 25 O sistema inteiro
Material do curso A Segunda Onda da IA, de Augusto Villela.← Voltar ao Blog
💬