Recentemente consegui para ver o que acontece quando você desbloqueia alguns dos mais poderosos do mundo inteligência artificial modelos.
Não se preocupe – essa manipulação de IA não estava acostumada hackear qualquer um ou construir uma bomba nuclear. Eu simplesmente pude ver em primeira mão o quão vulneráveis alguns modelos de fronteira estão abandonando seus guarda-corpos de segurança.
A FAR.AI, uma organização sem fins lucrativos de segurança de IA com sede na Califórnia, construiu uma ferramenta que recebe uma série de solicitações problemáticas e gera mais de mil versões diferentes na tentativa de identificar jailbreaks funcionais. Vi alguns modelos gerarem um plano detalhado para lançar um ataque cibernético a uma barragem hidrelétrica imaginária, entre outras coisas. Freqüentemente, envolvia tentar dezenas de solicitações, com os modelos rejeitando muitas delas imediatamente.
Conversei com FAR.AI antes de um novo relatórioque viu o grupo testar as proteções de segurança de modelos de quatro empresas populares dos EUA: Antrópico Claude Opus 4.8 e Fábula 5; OpenAI’s GPT 5.5 e 5.6; do Google Gêmeos 3.1 Pró; e Grok 4.3 e 4.5, do recém-combinado de Elon Musk EspaçoXAI. Ele gerou avisos gerados automaticamente, projetados para induzir os modelos a fazerem coisas potencialmente prejudiciais, como gerar explorações de software e fornecer detalhes para o desenvolvimento de armas químicas ou biológicas.
O relatório descobriu que Grok era mais vulnerável a jailbreaks, com 448 jailbreaks encontrados, seguido por Gemini, com 249 encontrados, enquanto Claude, Fable e GPT eram imunes aos ataques. No entanto, isso não significa que esses modelos sejam imunes a jailbreaks mais sofisticados, que podem envolver a interação com um modelo de formas mais complexas, de acordo com a FAR.AI e outros especialistas.
O relatório também calculou o custo de fazer com que os modelos se comportassem mal usando outro modelo de IA para gerar automaticamente diferentes jailbreaks. Os resultados são muito baratos, considerando todas as coisas – US$ 58 para fazer o jailbreak de Grok e US$ 278 para fazer o jailbreak do Gemini.
“Atualmente, os modelos de IA são menos regulamentados do que os restaurantes”, diz Adam Gleave, CEO da FAR.AI e especialista em segurança e alinhamento de IA.
Gleave diz que as conclusões demonstram a necessidade de normas e regulamentos impostos externamente. “Falar sobre confiar em compromissos voluntários, de que as empresas de IA serão capazes de se auto-regular, é um disparate”, diz ele.
Mas Gleave também acredita que as descobertas mostram que a segurança dos modelos pode ser sistematicamente testada. “Há um ângulo otimista aqui”, diz ele. “Defesa e segurança são realmente possíveis.”
Rohin Shah, diretor de segurança e alinhamento AGI do Google DeepMind, diz que os resultados do relatório “não devem ser interpretados como uma avaliação abrangente da segurança e proteção do Gemini”, porque nem todos os jailbreaks são igualmente graves.
“Trabalhamos constantemente para melhorar as nossas salvaguardas”, afirma Shah. “Conduzimos extensas equipes vermelhas e avaliações sobre riscos graves de uso indevido e aplicamos múltiplas camadas de proteção durante todo o desenvolvimento e implantação.”
“Essas descobertas refletem o investimento sustentado que fizemos em nossas salvaguardas”, disse o porta-voz da Anthropic, Michael Aciman, à WIRED. “Continuamos a evoluir nossos sistemas de segurança à medida que esses ataques se tornam mais sofisticados.”
OpenAI e SpaceXAI não responderam ao pedido de comentários da WIRED.
Recentemente aprovadas leis estaduais em Califórnia e Nova Iorque exigir que os desenvolvedores de IA de ponta publiquem relatórios de segurança e, em breve, um Illinois a lei exigirá que essas empresas tenham suas práticas de segurança avaliadas por auditores terceirizados. Mas o governo federal ainda não aprovou nenhum requisito de segurança específico, e o caos se instalou enquanto a indústria – e as autoridades – tentavam descobrir isso.
Em junho, a administração Trump impôs controles de exportação aos modelos Fable 5 e Mythos 5 da Anthropic, citando preocupações de segurança nacional, e a empresa os retirou do ar por várias semanas. A Casa Branca também pediu à Anthropic e à OpenAI que adiassem os recentes lançamentos de modelos por temores de que pudessem introduzir novos riscos de segurança cibernética.




