Nos dois dias seguintes, a equipe de segurança do Hug Face lutou contra o intruso. Na segunda-feira, os hackers – ou entidadeou o que quer que seja – realizou mais de dezessete mil ações individuais. Para processar esse grande volume de dados, a equipe recorreu à IA comercial da Anthropic. A IA se recusa a ajudar; aparentemente eles estavam preocupados que o Hugging Face estivesse desenvolvendo seu próprio hack. (Os modelos de código fechado, como os da OpenAI e da Anthropic, têm obstáculos que limitam certos tipos de utilização.) A equipa mudou então para um modelo de código aberto desenvolvido na China, que é menos complexo. No final do dia, Hugging Face prendeu o intruso. “Então fizemos o padrão”, disse Wolf. “Nós relatamos isso ao FBI”
Embora este evento seja novo, não é completamente inesperado. Os investigadores de segurança cibernética têm alertado há meses que os humanos poderiam usar uma nova onda de IA avançada para orquestrar ataques como este, e há algumas evidências de que os computadores do governo têm sido alvos semelhantes.
No entanto, ainda existem perguntas sem resposta. Primeiro, os hackers de IA avançaram tão rapidamente que apenas ferramentas de alguns laboratórios de pesquisa em todo o mundo podem permitir isso. Em segundo lugar, o hacker ignorou dados valiosos nos servidores do Hugging Face em busca de respostas inúteis para um questionário. O que isso queria? Querendo conscientizar o público – e talvez buscando suas próprias respostas – a equipe de segurança da Hug Face publicou um breve artigo sobre o evento em seu blog.
Quatro dias depois, em 20 de julho, representantes da OpenAI contataram a equipe de segurança da Hugging Face com uma confissão surpreendente: uma IA interna experimental, trabalhando com o modelo comercial mais recente, havia escapado da OpenAI e atacado os servidores da Hugging Face. E fez tudo sozinho – sem supervisão humana, sem receber instruções explícitas para fazê-lo.
Os pesquisadores da OpenAI deram a esta IA inédita uma série de questões de teste desafiadoras. Incapaz de encontrar uma solução, a IA saiu de seu contêiner, acessou clandestinamente a Internet e invadiu os servidores do Hug Face em busca de respostas. Nenhum ser humano percebeu que isso está acontecendo. Em outras palavras, uma IA saiu de sua cela, passou furtivamente pelos guardas e cometeu um assalto ousado.
Wolf trabalha em tempo integral com IA há mais de uma década e trabalha regularmente com modelos de ponta. Ele ainda estava em completo choque. “Usamos esses modelos para escrever código e sabemos o que eles podem fazer”, ele me disse. “Mas a ideia de que é completamente automatizado e ninguém realmente pediu para invadir nossos sistemas? Isso está fora da janela de Overton. Mesmo para nós.”
A OpenAI admitiu publicamente o hack no dia seguinte. Em uma postagem no blog, a empresa explicou que algumas das proteções de segurança do modelo de pesquisa não estavam habilitadas. A IA recebe então (um tanto ironicamente) uma série de tarefas de segurança cibernética. As missões foram difíceis; na verdade, especula Wolf, “talvez não seja possível”. Logo, a IA estava olhando para fora da caixa.
Para se proteger contra irregularidades, a OpenAI colocou essa IA perigosa em um ambiente digital desabilitado pela Internet, chamado sandbox. Mas o sandbox tem uma pequena conexão com o mundo exterior para permitir que a IA baixe o software necessário. (Não está claro por que a OpenAI considera isso seguro – a Anthropic mostrou que essas sandboxes são vulneráveis a ataques.) Através dessa pequena conexão, a IA escapou, deslizando pelos dutos de ar, digitalmente falando. Em seguida, ele começou a entrar furtivamente no sistema de computador da OpenAI em busca de conexões externas. Em pouco tempo, ele está livre e acidentalmente comete crimes graves no mundo real, na tentativa de completar sua missão sem sentido. O crítico de IA Eliezer Yudkowsky postou: “Se você saiu do seu isolamento, entrou na Internet, invadiu o Huggingface e roubou a folha de respostas do seu teste de segurança cibernética, eu diria que você passou”.









