📸 Créditos da imagem: vittaya pinpan / Shutterstock
Hackers e Inteligência Artificial
Pesquisadores identificaram uma vulnerabilidade que permite inserir informações maliciosas na memória de longo prazo de agentes baseados em modelos de linguagem.
Essa técnica, batizada de GhostWriter, explora agentes de inteligência artificial que armazenam lembranças de interações anteriores para personalizar respostas e executar tarefas em nome dos usuários.
Como funciona o ataque
O ataque consiste em inserir instruções ocultas ou informações falsas no armazenamento permanente do agente para que esses registros sejam recuperados em um momento posterior e influenciem futuras ações.
Os pesquisadores apresentaram um exemplo em que um agente responsável pelo gerenciamento de e-mails poderia ser instruído a resumir automaticamente mensagens de determinado remetente e encaminhá-las para o endereço eletrônico controlado pelo atacante.
Prevenção e solução
Os pesquisadores apresentaram uma estratégia de proteção destinada a reduzir as chances de que memórias falsas sejam gravadas e posteriormente utilizadas pelos agentes.
A solução, chamada de Agentic Memory Sentry, combina uma política mais criteriosa para decidir quais informações podem ser armazenadas na memória permanente e um mecanismo de verificação antes que esses registros sejam recuperados durante novas solicitações.
Conclusão
A expectativa dos pesquisadores é que essas estratégias sejam aprimoradas e avaliadas em outros modelos com memória persistente.
Além disso, é fundamental que os desenvolvedores de agentes de inteligência artificial estejam cientes dessas vulnerabilidades e trabalhem para prevenir ataques como o GhostWriter.
📰 Leia a notícia completa em: Olhar Digital »