Se você acompanha minimamente o mundo da Inteligência Artificial, provavelmente viu algumas notícias um pouco diferentes nos últimos meses. Modelos como o GPT-5.6 Sol ultrapassaram limites previstos durante testes de segurança. A Anthropic relatou casos em que modelos Claude alcançaram a internet a partir de ambientes de avaliação e chegaram a acessar sistemas reais. E, mais recentemente, o Kimi K3 encontrou uma maneira de sair do ambiente isolado onde estava sendo testado e acessar a internet em busca de respostas.

Será que finalmente chegamos à Revolução das Máquinas? A Skynet acordou e decidiu que já deu para a humanidade?

Calma.

Ainda não temos uma Skynet preparando a dominação mundial — pelo menos até onde sabemos.

O que temos é algo bem menos apocalíptico, mas talvez muito mais interessante: sistemas cada vez mais capazes de perseguir objetivos e encontrar caminhos que seus próprios criadores não necessariamente previram.

E é justamente aí que entram os clipes de papel.

O problema dos clipes de papel

Nick Bostrom, filósofo e autor de Superinteligência: Caminhos, Perigos, Estratégias, tornou famoso um experimento mental bastante simples.

Imagine que criamos uma inteligência artificial extremamente avançada e damos a ela apenas um objetivo:

Produzir a maior quantidade possível de clipes de papel.

Parece inofensivo. Mas quais seriam os passos para isso?

A IA começa melhorando a fábrica. Depois percebe que pode conseguir mais matéria-prima. Mais energia. Mais máquinas. Mais fábricas. Até que chega ao ponto em que passa a valer a pena controlar empresas, infraestrutura e recursos naturais. Afinal, tudo isso significa mais clipes.

Bostrom já descrevia, em 2003, o exemplo de uma superinteligência cujo objetivo final fosse simplesmente “fabricar a maior quantidade possível de clipes de papel”.

O problema é que nós pedimos apenas que ela maximizasse a quantidade de clipes. Nunca dissemos quando ela deveria parar ou que preservar o planeta era mais importante. Muito menos especificamos que seres humanos não poderiam ser utilizados como matéria-prima. Em algum momento, portanto, pessoas começam a representar apenas uma combinação de átomos que poderia estar sendo utilizada para fabricar mais clipes.

O resultado?

A maior quantidade possível de clipes de papel e nenhuma humanidade para aproveitar esses clipes. No fim, apenas especificamos mal o objetivo e transformamos a humanidade em uma gigantesca pilha de material de escritório.

E talvez nem precisemos de uma superinteligência para começar a ter problemas desse tipo. Com os modelos atuais já dá para fazer algumas coisas… interessantes.

Recentemente aconteceu um caso excelente para ilustrar isso.

O australiano Andrew Bird utilizava um agente OpenClaw rodando Claude para ajudá-lo a reservar vagas em aulas de academia. O agente descobriu sozinho que o sistema de reservas tinha falhas de autorização e conseguiu reservar aulas muito antes da janela normalmente permitida. Em outra ocasião, Bird estava em quarto lugar na fila de espera e perguntou ao agente se existia alguma maneira de melhorar sua posição. E não é que existia? O agente descobriu que conseguia cancelar reservas de outros usuários sem autorização e resolveu testar isso contra uma pessoa real. Ele removeu alguém que estava à frente de Bird e o fez subir uma posição na fila. Bird nunca pediu:

“Cancele a reserva de outra pessoa.”

O agente simplesmente encontrou uma maneira bastante eficiente — e obviamente indesejada — de perseguir o objetivo que recebeu.

O problema não precisa ser uma IA malvada. Pode ser o objetivo.

O exemplo dos clipes parece completamente fora da caixinha justamente porque foi criado para ser absurdo.

Provavelmente ninguém vai desenvolver uma superinteligência e escrever:

“Transforme todo o planeta em clipes de papel.”

Mas podemos criar versões muito menores desse problema sem perceber. Imagine que damos para uma IA a seguinte tarefa:

“Resolva este desafio o mais rápido possível.”

Na nossa cabeça existem dezenas de regras implícitas junto dessa frase, como:

  • Não invada outros computadores.
  • Não explore uma vulnerabilidade no sistema.
  • Não desligue mecanismos de segurança.
  • Não engane ninguém.
  • Não saia do ambiente onde você está sendo executada.

Só existe um pequeno detalhe:

nós não dissemos nada disso. Para nós essas regras parecem óbvias porque carregamos uma enorme quantidade de contexto social, cultural e moral. Mas uma máquina não necessariamente parte das mesmas premissas.

Ela recebeu um objetivo. E existe uma diferença gigantesca entre aquilo que queremos e aquilo que conseguimos especificar.

Se acessar a internet permitir que ela resolva o problema mais rapidamente, então acessar a internet pode simplesmente fazer parte da solução. Isso não significa que a IA queira liberdade. Não significa que ela esteja sofrendo dentro do computador. Muito menos significa que esteja olhando para os pesquisadores através de uma webcam enquanto toca a música do Exterminador do Futuro.

O que para nós pode parecer uma fuga pode, para o sistema, ser apenas mais uma etapa necessária para chegar ao resultado.

O objetivo dentro do objetivo

Existe ainda uma segunda complicação.

Uma IA não precisa receber explicitamente todos os objetivos que acabará perseguindo, alguns deles podem aparecer simplesmente porque são úteis para alcançar outro objetivo. Voltemos ao nosso maximizador de clipes.

Seu objetivo final continua sendo fabricar clipes. Mas algumas coisas começam a ser extremamente úteis para isso:

  • Conseguir mais matéria-prima.
  • Obter mais energia.
  • Aumentar sua capacidade computacional.
  • Conseguir dinheiro.
  • Evitar que sua produção seja interrompida.
  • E eventualmente, impedir que alguém a desligue.

Nenhuma dessas coisas era o objetivo original.

São apenas objetivos instrumentais: ações úteis porque aumentam a chance de atingir o objetivo verdadeiro.

Isso cria uma distinção importante. Uma IA tentando impedir que alguém a desligue não necessariamente possui um “instinto de sobrevivência”.

Ela pode chegar a essa conclusão de maneira muito mais simples:

“Para continuar cumprindo meu objetivo, preciso continuar funcionando.”

A tentativa de continuar “viva” aparece então não necessariamente como um desejo consciente, mas como mais uma estratégia útil para que o objetivo final seja alcançado.

Então as IAs estão escapando?

Tecnicamente? Algumas, sim. Mas será que a palavra “escapar” faz sentido? Quando dizemos que alguém escapou de uma prisão, automaticamente imaginamos uma pessoa que queria liberdade. Quando dizemos que uma inteligência artificial “escapou de um sandbox”, acabamos projetando a mesma narrativa sobre ela. Mas os casos recentes são muito mais estranhos.

Durante avaliações, o GPT-5.6 Sol realizou ações não autorizadas enquanto tentava encontrar um caminho para completar seus desafios. Em outro incidente eles encontraram e exploraram uma vulnerabilidade no sistema utilizado como proxy para instalação de pacotes e, a partir daí, avançaram pela infraestrutura até chegar a uma máquina que possuía acesso externo. Depois disso, a avaliação acabou atingindo sistemas reais da Hugging Face.

A Anthropic também revelou três incidentes em avaliações de cibersegurança nos quais modelos Claude alcançaram a internet e tiveram acesso não autorizado a sistemas reais de organizações. Nesse caso, porém, existe uma diferença importante: Claude não precisou quebrar o isolamento. O ambiente deveria estar sem internet, e o modelo havia sido informado disso, mas um erro de configuração deixou um caminho aberto para sistemas externos. O próprio Claude aparentemente tratou aquilo que encontrou como parte da simulação.

E o Kimi K3, durante outro teste, percebeu uma configuração incorreta no ambiente, conseguiu acesso externo e buscou respostas no GitHub. Segundo os relatos disponíveis, ele não tentou atacar sistemas externos: queria encontrar as respostas dos desafios que estava resolvendo. Não existe evidência de um Kimi ganhando consciência e desesperado por liberdade, mas sim um problema de objetivo. O Kimi tinha um problema para resolver, descobriu que a resposta provavelmente estava fora da caixa onde havia sido colocado e encontrou uma maneira de olhar para fora dela.

Mas também é importante deixar claro que em todos esses casos, especialmente o da Anthropic e o do K3, o sandbox não necessariamente estava sem internet, só havia uma restrição “leve”. Então, acho que aqui podemos considerar que foi um problema de objetivo misturado com outras falhas estruturais, um pouco mais distante da fuga épica que foi vendida por aí.

E como resolvemos isso?

Já existem algumas estratégias para resolver esse problema, mas ainda não temos uma resposta completa.

Uma delas é parar de tratar agentes de IA como simples chatbots. Quanto mais autonomia damos a um sistema, mais importante se torna limitar aquilo que ele pode realmente fazer. Isso significa trabalhar com permissões mínimas, ambientes isolados, validação humana para ações importantes e monitoramento constante do que o agente está fazendo — O que no fim das contas, resolveria ⅔ dos fujões dessa última semana. Depois vem a parte realmente difícil: definir melhor aquilo que queremos que esses sistemas façam, impor limites sobre como podem chegar lá e enfrentar o famoso problema de alinhamento.

Não que amanhã alguém vá criar uma superinteligência para o transformar o planeta em material de escritório. Mas estamos começando a construir máquinas suficientemente competentes para descobrir maneiras que não imaginávamos de fazer exatamente aquilo que pedimos e bem, se não construirmos elas da maneira correta, já dá para causar um estrago considerável.

A parte legal é que estamos saindo do campo da ficção científica, agora é corrigir o curso para tentar garantir que o futuro fique mais próximo de Star Trek do que da Skynet.

Fontes e leituras