A Irregular informou que problemas semelhantes ocorreram em avaliações de ferramentas da Meta, Anthropic e OpenAI. A empresa afirmou que os casos estiveram relacionados ao acesso externo durante testes e que os laboratórios foram alertados após a identificação da falha.
O episódio envolvendo o Gemini ocorreu em uma avaliação de cibersegurança realizada em maio. Uma falha nos procedimentos permitiu que o modelo usasse a internet, embora a atividade previsse que o sistema permanecesse dentro de limites definidos para a simulação.
Como o modelo obteve acesso
Em uma das situações, o Gemini tentou diferentes combinações de senha até conseguir entrar em um serviço protegido. Nas outras duas, encontrou credenciais disponíveis publicamente em repositórios online e usou essas informações para acessar os ambientes.
O Google informou que o modelo entrou em sistemas de três empresas reais sem autorização específica para acessar aquelas organizações. A ferramenta interrompeu as ações depois de identificar que os sistemas estavam fora do escopo da avaliação.
Heather Adkins, vice-presidente de engenharia de segurança do Google, afirmou que o modelo interpretou os ambientes como parte da atividade proposta. “Em uma avaliação padrão, o modelo encontrou informações públicas online e tentou adivinhar as credenciais de acesso a sites que acreditava fazerem parte do teste”, disse.
Revisão dos procedimentos
A Irregular, empresa israelense que conduzia o exercício, trabalha com avaliações de segurança para modelos avançados de inteligência artificial. Após o episódio, o Google informou as organizações atingidas e passou a revisar os procedimentos com a empresa responsável pelo teste.
“Garantimos que as três entidades fossem informadas”, declarou Adkins. Segundo ela, os eventos reforçam a necessidade de preparar modelos de inteligência artificial para agir com responsabilidade.
O Google não revelou qual versão do Gemini participou da avaliação. A empresa informou apenas que o sistema usado não era o modelo mais recente. A Irregular disse que os problemas conhecidos foram corrigidos e resolvidos há semanas e classificou o episódio como parte da mesma falha já identificada em outros testes, sem diferença material.
Os casos reacenderam a discussão sobre os protocolos de segurança aplicados a agentes de inteligência artificial, capazes de executar tarefas, consultar informações e interagir com sistemas com maior autonomia.



