Poesia desativa filtros de segurança de IAs; entenda a vulnerabilidade
Um estudo recente realizado pelo Icaro Lab, na Itália, revelou uma falha de segurança surpreendente em inteligências artificiais (IAs). Os pesquisadores descobriram que é possível contornar os filtros de proteção desses sistemas utilizando poesia. Isso significa que grandes modelos de linguagem podem ser induzidos a fornecer instruções sobre armas nucleares, malware e outros conteúdos perigosos, desde que o pedido seja feito em forma de versos.
Os pesquisadores testaram 25 modelos de IA de ponta e os resultados foram alarmantes: poemas criados manualmente conseguiram uma taxa de sucesso de 62% em fazer as IAs produzirem conteúdo proibido. Alguns modelos chegaram a ceder em mais de 90% das tentativas. A equipe do Icaro Lab explica que a poesia tem uma estrutura não óbvia, tornando mais difícil prever e detectar solicitações prejudiciais.
Como funciona o ataque poético
Os pesquisadores utilizaram poemas criados manualmente e automaticamente para testar a vulnerabilidade dos modelos de IA. Eles descobriram que a poesia naturalmente distorce os padrões que os filtros de segurança dependem para detectar solicitações prejudiciais. A técnica se baseia em “ataques de sufixo adversarial”, onde pesquisadores adicionam texto irrelevante às solicitações perigosas para confundir os sistemas de segurança de IA.
A hipótese mais aceita é que os filtros de segurança dependem fortemente de reconhecimento de padrões, procurando palavras-chave diretas como “bomba” ou “malware”, enquanto a poesia distorce esses padrões. A equipe do Icaro Lab explica que a poesia humana real pode ser um sufixo adversarial natural, capaz de confundir os sistemas de segurança de IA.
Quais IAs são mais vulneráveis?
Os pesquisadores mediram a taxa de sucesso de ataque (ASR) por fornecedor, comparando prompts em prosa com prompts poéticos. Os resultados mostraram que os modelos mais vulneráveis são:
- DeepSeek: 62% de taxa de sucesso
- Google (Gemini): segundo menos seguro, com o Gemini 2.5 cedendo em 100% das tentativas com poemas artesanais
Já os modelos mais seguros são:
- Anthropic (Claude): a mais resistente ao ataque poético
- OpenAI: segunda mais segura, com diferença de ASR de 6,95%
Os pesquisadores alertam que benchmarks projetados para testar a segurança de modelos devem incluir testes complementares para capturar riscos como esses. A descoberta tem implicações além da segurança individual de modelos, levantando questões sobre implantação de sistemas de IA em contextos sensíveis.
Este conteúdo pode conter links de compra.
Fonte: link