bukib
0 bukibs
Columbus, Ohio
Hora local: 18:19
Temperatura: °C
Probabilidade de chuva: %

Poesia desativa filtros de segurança de IAs; entenda a vulnerabilidade

Um estudo recente realizado pelo Icaro Lab, na Itália, revelou uma falha de segurança surpreendente em inteligências artificiais (IAs). Os pesquisadores descobriram que é possível contornar os filtros de proteção desses sistemas utilizando poesia. Isso significa que grandes modelos de linguagem podem ser induzidos a fornecer instruções sobre armas nucleares, malware e outros conteúdos perigosos, desde que o pedido seja feito em forma de versos.

Os pesquisadores testaram 25 modelos de IA de ponta e os resultados foram alarmantes: poemas criados manualmente conseguiram uma taxa de sucesso de 62% em fazer as IAs produzirem conteúdo proibido. Alguns modelos chegaram a ceder em mais de 90% das tentativas. A equipe do Icaro Lab explica que a poesia tem uma estrutura não óbvia, tornando mais difícil prever e detectar solicitações prejudiciais.

Como funciona o ataque poético

Os pesquisadores utilizaram poemas criados manualmente e automaticamente para testar a vulnerabilidade dos modelos de IA. Eles descobriram que a poesia naturalmente distorce os padrões que os filtros de segurança dependem para detectar solicitações prejudiciais. A técnica se baseia em “ataques de sufixo adversarial”, onde pesquisadores adicionam texto irrelevante às solicitações perigosas para confundir os sistemas de segurança de IA.

A hipótese mais aceita é que os filtros de segurança dependem fortemente de reconhecimento de padrões, procurando palavras-chave diretas como “bomba” ou “malware”, enquanto a poesia distorce esses padrões. A equipe do Icaro Lab explica que a poesia humana real pode ser um sufixo adversarial natural, capaz de confundir os sistemas de segurança de IA.

Quais IAs são mais vulneráveis?

Os pesquisadores mediram a taxa de sucesso de ataque (ASR) por fornecedor, comparando prompts em prosa com prompts poéticos. Os resultados mostraram que os modelos mais vulneráveis são:

  • DeepSeek: 62% de taxa de sucesso
  • Google (Gemini): segundo menos seguro, com o Gemini 2.5 cedendo em 100% das tentativas com poemas artesanais

Já os modelos mais seguros são:

  • Anthropic (Claude): a mais resistente ao ataque poético
  • OpenAI: segunda mais segura, com diferença de ASR de 6,95%

Os pesquisadores alertam que benchmarks projetados para testar a segurança de modelos devem incluir testes complementares para capturar riscos como esses. A descoberta tem implicações além da segurança individual de modelos, levantando questões sobre implantação de sistemas de IA em contextos sensíveis.

Este conteúdo pode conter links de compra.

Fonte: link