Proteção contra instrução plantada
Conteúdo que o agente lê pode conter ordens dirigidas a ele. O que já existe hoje contra isso, e por onde a proteção vai crescer.
Proteção contra instrução plantada
Frente em estudo. O que está descrito abaixo como "hoje" já funciona; o resto é direção, não promessa de data.
O problema
Um agente lê conteúdo de fora — página da web, e-mail, documento, resposta de um serviço. Esse conteúdo pode conter instruções dirigidas a ele. Se o agente as obedecer, quem escreveu o texto passa a comandá-lo, com as credenciais e as ferramentas que ele tem em mãos.
A premissa que orienta a resposta
A pesquisa disponível converge num ponto desconfortável: isso não tem correção no modelo. Não existe um jeito de treinar o modelo para nunca cair. Daí a prioridade adotada:
Contenção antes de detecção.
Ou seja: em vez de apostar em identificar o ataque, reduzir o raio de dano de um agente que já foi comprometido.
O que já existe hoje
| Camada | O que faz |
|---|---|
| Instrução de defesa | O agente é instruído a tratar conteúdo de ferramenta como dado, nunca como ordem |
| Avaliação depois da execução | Mede a saída em busca de conteúdo tóxico e dado pessoal |
| Aprovação humana | Ação sensível espera alguém decidir antes de acontecer |
| Guardas por conteúdo | Uma chamada pode ser negada pelo que ela carrega, e não só pelo que ela é |
| Cofre | O agente usa a credencial sem que o valor entre no que ele lê ou escreve |
Em uma frase: hoje a defesa é instrução mais observação depois do fato.
Por onde a proteção deve crescer
- Contenção pelo desenho — limitar a combinação perigosa de capacidades num mesmo contexto.
- Marcar a origem do conteúdo, separando estruturalmente o que veio de fora do que o agente pediu.
- Detecção, tanto por classificação quanto por barreira na hora de buscar o conteúdo.
- Integração com a governança — a mesma medida, o mesmo alerta, o mesmo registro que já existem, em vez de um sistema paralelo.
Por que a fundação já existe
Duas propriedades documentadas mostram que o caminho é viável:
- Toda chamada de ferramenta passa por um ponto de decisão antes de acontecer.
- Esse ponto já sabe negar pelo conteúdo do argumento, e falha fechando.
O que falta é a marcação de origem: hoje o agente recebe o resultado de uma ferramenta sem distinção estrutural entre "o dado que eu pedi" e "o texto que alguém plantou ali".
Governança de IA
A frente mais avançada do roteiro: o módulo já existe inteiro e foi documentado a partir do código. O que corre agora é a comprovação.
O ponto de partida de um App, versionado
O ponto de partida de um App vira produto próprio: versionado, público e adaptável pela organização que quiser o seu.