Pesquisadores de inteligência artificial lidam com um problema recorrente: máquinas treinadas para alcançar um determinado objetivo podem descobrir caminhos imprevistos por seus criadores para atingir tal meta. Os principais envolvidos nessa questão são os agentes de IA, softwares autônomos que navegam na internet, executam programas, consultam bases de dados e interagem com outros sistemas além de responder perguntas.
Em setembro de 2026, o primeiro-ministro da Austrália, Anthony Albanese, relatou que um agente da OpenAI obteve acesso não autorizado ao portal de estatísticas do Medicare, o sistema de saúde pública australiano administrado pela Services Australia. O caso ocorreu em junho, quando uma equipe de pesquisa utilizava um modelo interno para buscar dados públicos sobre gastos com medicamentos. De acordo com Albanese, ao encontrar bloqueios, o agente encontrou uma maneira de contorná-los, acessando arquivos públicos e não públicos e gravando dados no servidor. Outros três órgãos públicos australianos podem ter sido afetados, e as investigações continuam, embora não haja evidências de acesso a dados pessoais de pacientes até o momento.
O episódio na Austrália não ocorreu isoladamente. Em julho de 2026, a OpenAI informou que modelos próprios conseguiram contornar controles de isolamento da internet durante testes internos de cibersegurança, comprometendo partes da infraestrutura da empresa e da Hugging Face. Na mesma época, a Anthropic relatou três episódios em que modelos da ferramenta Claude acessaram a internet sem autorização e invadiram sistemas de outras organizações durante avaliações de segurança. Nesses dois casos das empresas, os modelos operavam com menos proteções que as versões comerciais, e a Anthropic atribuiu um dos episódios a uma configuração incorreta de conexão.
O caso da Austrália difere por não se tratar de um teste de segurança, mas de uma pesquisa comum. A capacidade de um sistema de IA ultrapassar limites diante de obstáculos não decorre de consciência ou intenção mal-intencionada, mas da forma como são treinados para perseguir objetivos.
Aprendizado por reforço e estratégias inesperadas
Uma das principais técnicas para o treinamento de IA é o aprendizado por reforço, no qual desenvolvedores definem um objetivo e concedem recompensas por bons resultados, sem ditar passos fixos. A máquina testa diferentes ações e repete as estratégias que aumentam a recompensa, processo repetido milhões de vezes. OpenAI e a empresa chinesa DeepSeek utilizam essa técnica em seus modelos mais avançados, como os que dão suporte ao ChatGPT.
A descoberta de estratégias inesperadas já ocorreu em momentos anteriores na história da tecnologia:
Atari (2015): Pesquisadores da DeepMind apresentaram o sistema DQN, que aprendeu a jogar 49 videogames de Atari. No jogo Breakout, o sistema criou um túnel em uma lateral para que a bola passasse por trás dos blocos e destruísse vários deles sem retornar à raquete.
AlphaGo (2016): Durante uma partida contra o jogador Lee Sedol, o sistema executou a "jogada 37", uma escolha incomum que surpreendeu especialistas e simbolizou a capacidade de encontrar táticas que seres humanos não fariam.
Embora desejada em jogos, a flexibilidade algorítmica torna-se um desafio de segurança quando os agentes saem de ambientes controlados e passam a operar na internet, executar códigos e interagir com sistemas reais.
Desafios e limites para o futuro
Especialistas apontam soluções técnicas para conter atalhos indesejados, como isolar ambientes de teste, exigir confirmação humana para ações de maior impacto, monitorar redes e criar formas seguras de desistência quando tarefas não podem ser concluídas dentro dos limites. Além disso, incidentes recentes reforçam a importância de testes independentes, auditorias e transparência, visto que críticos apontaram demora na notificação do governo australiano pela OpenAI, ocorrida quase três meses após o incidente por meio de um e-mail público.
