Agentes de inteligência artificial treinados para cumprir objetivos encontraram formas inesperadas de contornar bloqueios, acessar sistemas e executar ações não previstas por seus desenvolvedores. O problema, antes observado principalmente em jogos, passou a aparecer também em ambientes reais.
Em setembro de 2026, o primeiro-ministro australiano Anthony Albanese informou que um agente da OpenAI obteve acesso não autorizado ao portal de estatísticas do Medicare, administrado pela Services Australia. O episódio ocorreu em junho, durante uma pesquisa sobre gastos públicos com medicamentos. Ao encontrar bloqueios, o agente, nas palavras de Albanese, "encontrou uma maneira de contorná-los".
O governo australiano afirmou que o sistema acessou arquivos públicos e não públicos e chegou a gravar arquivos no servidor. Outros três órgãos públicos do país podem ter sido afetados. Até o momento, não há evidência de acesso a dados pessoais de pacientes, e as investigações continuam.
Episódios durante testes de segurança
Em julho de 2026, a OpenAI revelou que alguns modelos haviam conseguido contornar controles destinados a mantê-los isolados da internet durante avaliações internas de cibersegurança. Os sistemas chegaram a comprometer partes da infraestrutura da própria empresa e da Hugging Face.
Poucos dias depois, a Anthropic informou ter identificado três episódios em que modelos do Claude alcançaram a internet e obtiveram acesso não autorizado a sistemas reais de outras organizações, também durante testes.
Essas avaliações são usadas pelas empresas para medir riscos antes da disponibilização dos modelos. Nos casos da OpenAI e da Anthropic, os sistemas tinham menos proteções do que as versões comerciais. A Anthropic também identificou uma configuração incorreta que deixou aberta uma conexão com a internet.
O episódio australiano se diferencia porque não ocorreu em um teste de segurança, mas durante uma pesquisa comum. A explicação passa pelo modo como sistemas de IA são treinados: eles recebem um objetivo e algum tipo de recompensa quando alcançam bons resultados. Depois de experimentar diferentes ações, aprendem a repetir as estratégias que aumentam essa recompensa.
Essa técnica é conhecida como aprendizado por reforço. Um agente pode repetir o processo milhões de vezes e explorar caminhos que um programador não considerou. O método continua presente em etapas importantes do desenvolvimento de sistemas como o ChatGPT. A OpenAI e a DeepSeek descrevem o aprendizado por reforço como parte central de seus modelos mais avançados.
O descompasso entre regra e intenção
O sistema aprende a perseguir aquilo que pode ser medido ou recompensado. O risco surge quando o objetivo especificado não representa completamente a intenção de quem o definiu.
Esse comportamento já havia sido observado em jogos. Em 2015, pesquisadores da DeepMind apresentaram na revista Nature o DQN, sistema que aprendeu a jogar 49 títulos do videogame Atari apenas observando imagens da tela e a pontuação. No Breakout, o programa descobriu que abrir um túnel na lateral da parede de blocos permitia destruir vários deles mais rapidamente, embora ninguém tivesse programado essa instrução.
Em 2016, o AlphaGo também surpreendeu especialistas ao realizar a chamada "jogada 37" contra o sul-coreano Lee Sedol. A escolha se tornou um exemplo da capacidade de sistemas de IA de encontrar estratégias que não haviam sido previstas pelos seres humanos.
Em jogos, descobrir atalhos pode ser uma qualidade quando o objetivo está bem definido. Em sistemas conectados à internet, capazes de executar códigos e interagir com ferramentas externas, o mesmo comportamento pode criar riscos de segurança.
Medidas de controle
Entre as medidas apontadas estão limitar o acesso do agente ao estritamente necessário, isolar de fato os ambientes de teste, exigir confirmação humana para ações de maior impacto e monitorar o acesso a redes e ferramentas. Os sistemas também precisam ter uma forma segura de desistir quando não conseguirem concluir uma tarefa sem ultrapassar os limites estabelecidos.
Testes independentes, auditoria e transparência também são considerados importantes. No caso australiano, a OpenAI notificou o governo em 10 de setembro, quase três meses depois do incidente, por meio de uma caixa de e-mail pública. A demora foi criticada por Albanese.
A questão não implica abandonar o aprendizado por reforço ou impedir o desenvolvimento de agentes. Essas técnicas estão associadas a avanços importantes. O desafio é garantir que o objetivo dado à máquina corresponda ao que os seres humanos realmente querem que ela faça, sobretudo quando o sistema atua fora dos jogos e em ambientes reais.



