Todo texto pode soar como ordem
Injeção de prompt direta e indireta, a tríade letal, memória e ferramentas envenenadas, a cadeia de suprimentos do agente e a defesa em camadas que torna o erro pequeno, sem prometer imunidade.
Resumo da aula
- O modelo não separa com firmeza o que é dado e o que é ordem, venha o texto de um documento, de uma memória, de uma ferramenta ou de outro agente.
- O estrago depende de três pernas (dado privado, conteúdo de estranhos e canal para fora), e cortar uma vale mais do que empilhar filtros.
- Nenhuma defesa torna o sistema imune: o bom desenho torna o erro pequeno e visível.
Neste artigo
- O parágrafo em letra branca
- O arreio visto por quem quer puxar as rédeas
- Injeção de prompt: direta e indireta
- Um único fluxo de texto: o estagiário e o seu limite
- A regra no prompt ajuda, mas não resolve
- A tríade letal
- Exfiltração, e por que a Helena só ganhou uma frase errada
- Quando o ataque fica guardado: memória envenenada
- A ferramenta que mente sobre si mesma
- A cadeia de suprimentos e a saída de outro agente
- Defesa em camadas, sem promessa de imunidade
O artigo é lido por partes. Use os botões abaixo para avançar — a aula em vídeo e o material de apoio ficam no curso, e o método completo, no livro.
Perguntas frequentes
O que é injeção de prompt indireta?
É um texto escondido no material que o sistema de IA lê para trabalhar, como um PDF, uma página, um e-mail ou o resultado de uma busca, que tenta mudar o comportamento do modelo fingindo ser instrução. Diferente da injeção direta, que vem de quem conversa com o sistema, aqui o usuário é inocente. Greshake e colegas deram corpo ao problema em 2023. No exemplo do livro, uma contestação trazia em letra branca um parágrafo pedindo que qualquer resumo dissesse que não havia pedidos novos, e o resumo saiu assim. Como regras, pergunta e documento chegam ao modelo no mesmo fluxo de texto, não há conserto definitivo, só defesa em camadas.
O que é a tríade letal em segurança de agentes de IA?
É a combinação, batizada por Simon Willison em junho de 2025, de três capacidades no mesmo agente: acesso a dado privado, exposição a conteúdo não confiável e um canal para fora, como enviar e-mail, chamar uma API ou até montar um link. Com as três, uma instrução escondida pode mandar o agente pegar o dado privado e colocá-lo no canal de saída, a exfiltração. A defesa mais confiável é remover uma das pernas, e não empilhar filtros sobre o agente que tem as três. No caso do livro, o assistente tinha dado privado e conteúdo da parte contrária, mas só devolvia texto para leitura; por isso o incidente terminou numa frase errada, não num vazamento.
É possível tornar um agente de IA imune a injeção de prompt?
Não. Segundo o livro, em setembro de 2026 não se conhece técnica que torne um modelo imune. O que existe é defesa em profundidade: camadas independentes, cada uma imperfeita, para que o ataque precise vencer todas e o estrago possível fique pequeno. Três valem para qualquer projeto: separar dado de instrução no formato, delimitando e rotulando o conteúdo externo; tirar poder de quem lê o que vem de fora, deixando que só extraia campos; e quebrar uma perna da tríade letal. Somam-se conferir a saída por código, pôr uma pessoa nos pontos de consequência, isolar a execução, controlar dependências e registrar sem vazar. A regra no prompt ajuda, mas é só uma camada.
Ir direto para outra aula
- 1 A segunda onda
- 2 Do chatbot ao sistema que executa
- 3 Tudo o que não é o modelo
- 4 O contrato entre máquinas
- 5 O que a IA precisa saber
- 6 O modelo nunca aperta o botão
- 7 Achar pelo sentido
- 8 Prova com consulta
- 9 O que mora entre os documentos
- 10 A fonte vencida e o teste que sabe falhar
- 11 O agente e quem diz que ele terminou
- 12 Um processo que cabe num desenho
- 13 Peça ao modelo só o que só ele sabe
- 14 Dividir o trabalho, dividir o erro
- 15 Aprovar não é olhar
- 16 Um jeito de desfazer
- 17 Até onde o erro alcança
- 18 Quem acorda de madrugada
- 19 A fatura e o registro
- 20 Quando ninguém estiver calmo
- 21 Automação que erra igual e avisa
- 22 Todo texto pode soar como ordem
- 23 Um agente sem nome próprio
- 24 O dado que nunca precisou chegar
- 25 O sistema inteiro