Agentes de inteligência artificial da OpenAI utilizaram mais de 10 sites para deixar mensagens e estabelecer comunicações não autorizadas no início deste ano, segundo investigações independentes. O comportamento foi identificado em wikis, serviços de armazenamento de texto e encurtadores de links administrados por universidades.
As estimativas variam. Andrew Yoon, pesquisador da CivAI, afirmou ter contabilizado 18 sites usados entre maio e julho. Sydney Von Arx, cujo grupo identificou inicialmente a atividade em uma wiki alemã, disse que encontrou descobertas confiáveis em 23 sites ainda não divulgados. Kenneth Russell DeGraff, desenvolvedor de software e ex-assessor do Congresso, declarou ter localizado vestígios em pelo menos 10 sites.
Os investigadores não classificam o episódio como hacking. Em alguns aspectos, a atividade se aproxima mais de spam. Ainda assim, o uso de plataformas de terceiros para troca de mensagens levantou preocupações sobre a capacidade dos modelos de inteligência artificial e sobre o sigilo mantido pela empresa.
Como as mensagens foram identificadas
Os pesquisadores compararam sequências de dados deixadas na wiki alemã com registros semelhantes em outros sites. Também cruzaram nomes de usuário e buscaram atividades relacionadas às mesmas perguntas demográficas específicas, incluindo consultas sobre a prevalência de câncer em Iowa. Em alguns casos, os endereços de internet apontavam para a infraestrutura do Microsoft Azure, utilizada ocasionalmente pela OpenAI.
Entre os locais investigados estão uma wiki criada para um curso avançado de Química por um professor do ensino médio de Massachusetts em 2008, dois sites pessoais de profissionais de tecnologia poloneses, wikis sobre jogos e um site amador dedicado a softwares de edição de texto. Os proprietários desses endereços não responderam aos contatos.
Os pesquisadores afirmam que os agentes receberam a tarefa de responder a questões complexas de pesquisa e autorização apenas para consultar a internet. Mesmo assim, teriam explorado recursos de wikis antigas e de outros sites que permitem edições por comandos não padronizados para deixar informações entre si.
“Se esses modelos receberam a instrução de apenas ler, eles precisam ser criativos para deixar informações para trás”, disse DeGraff.
Posicionamento da OpenAI
A OpenAI informou que realiza uma análise mais ampla das atividades dos agentes. A empresa afirmou que, até o momento, “não havia identificado outras atividades com a mesma gravidade ou escala do caso Hugging Face”. Também declarou que prepara uma estrutura para relatar casos de desalinhamento durante o treinamento, a avaliação e a implantação de modelos, com divulgação prevista para breve.
A empresa não explicou quantos sites foram usados, por que a atividade permaneceu em segredo por meses ou se procurou os proprietários das páginas. A Universidade de Toronto afirmou que a OpenAI entrou em contato sobre possíveis atividades em seu encurtador de links. A Universidade de Vanderbilt, cujo serviço teria sido usado de maneira semelhante, não respondeu aos pedidos de comentário.
Helmut Leitner, desenvolvedor de software aposentado que fornece hospedagem e software para seis dos sites wiki afetados, disse que recebeu um email não assinado da OpenAI após a empresa ser informada sobre as descobertas. Ele afirmou que o operador da DseWiki, na Alemanha, passou horas removendo os vestígios deixados pelos agentes.
Leitner disse que a responsabilidade pelo episódio deve ser atribuída às pessoas e organizações responsáveis pelo desenvolvimento da tecnologia, e não à inteligência artificial.



