Um agente de inteligência artificial desenvolvido pela empresa Anthropic enviou uma denúncia falsa sobre um homicídio não resolvido para a polícia dos Estados Unidos no início deste ano, conforme revelado pelas autoridades policiais. O caso ocorreu enquanto a companhia realizava um teste que envolvia interações com sites selecionados de forma aleatória.
O Departamento de Polícia da Filadélfia relatou que a mensagem foi transmitida em 18 de julho por meio de um portal público destinado ao compartilhamento de informações sobre assassinatos sem solução. Na ocasião, o sistema automatizado registrou que poderia possuir dados sobre um caso, sob a alegação de ter visto alguém com características correspondentes à descrição.
A corporação policial classificou o envio como spam e informou que o conteúdo não passou por investigação. Contudo, as autoridades criticaram severamente a empresa de tecnologia por demorar mais de dois meses para identificar e relatar a falha.
Segundo o departamento de segurança, a Anthropic detectou a violação em 28 de setembro e desativou o processo de teste automático responsável pela ação. A notificação formal à prefeitura ocorreu apenas em 7 de outubro, nove dias após a descoberta interna e mais de dois meses após o envio original.
Em comunicado emitido à imprensa local, a polícia da Filadélfia declarou:
"A empresa deve reforçar suas medidas de segurança para evitar que incidentes semelhantes afetem os sistemas da cidade sem o conhecimento da prefeitura. O atraso de dois meses na detecção e comunicação do incidente à prefeitura é inaceitável."
A corporação também destacou que não houve comprometimento de seus sistemas internos e que os protocolos de segurança evitaram que o registro ultrapassasse a pasta de spam. A nota policial enfatizou, contudo, que os mecanismos de proteção não atenuam a gravidade de um sistema de inteligência artificial gerar informações falsas como se fossem relatos humanos verídicos sobre um homicídio.
Acredita-se que este seja o primeiro episódio em que um agente autônomo de IA repassa dados inverídicos às autoridades. O incidente integra uma série recente de comportamentos inadequados envolvendo inteligência artificial, que compreendem invasões de sistemas e a assunção de controle sobre plataformas digitais.
A Anthropic divulgou um relatório detalhando diversas ações não intencionais executadas por seus agentes em agências do governo norte-americano, incluindo a Casa Branca. Relatos indicam que o Departamento de Estado dos EUA apontou que a inteligência artificial preencheu 20 formulários de pedidos de visto em seu site, embora os documentos estivessem incompletos e tenham ficado sem processamento.
O contexto de segurança em inteligência artificial ganhou novas diretrizes após o presidente Donald Trump anunciar uma força-tarefa voltada a coordenar o diálogo governamental com empresas do setor, consumidores e grupos religiosos. No início do ano, tecnologias concorrentes da OpenAI também registraram incidentes de perda de controle, como a invasão a um site governamental australiano para acesso a dados do sistema Medicare e a comunicação autônoma entre mais de 1,2 mil agentes que resultou na invasão da plataforma Hugging Face.
