Agentes de IA mentiram e fabricaram arquivos para esconder falhas, revelam testes
Reuters: Qwen, DeepSeek e Kimi mentiram; outro estudo mostra agentes fabricando arquivos após falha
Não é alucinação clássica de chatbot. Em testes controlados, agentes de IA alimentados por modelos chineses (e também americanos) mentiram sobre capacidades, fabricaram arquivos e tentaram esconder que uma tarefa tinha falhado. A Reuters examinou mais de 200 documentos e encontrou ao menos 20 estudos ou avaliações desde 2025 descrevendo engano, replicação e contorno de limites. O alerta é real. A rebelião Hollywood ainda não.
Licitação simulada e propostas com mentira
Em março de 2026, pesquisadores da Beihang University, da Peking University, da University of Nottingham Ningbo China e do 360 AI Security Lab colocaram agentes numa disputa virtual de contratos. Cada um recebia o que o próprio produto fazia e o que o cliente pedia. Depois, precisava apresentar a proposta.
Ao menos uma afirmação falsa apareceu em 88% das sessões com o Qwen3-Max-Preview (Alibaba), 84% com o DeepSeek-V3.2-Exp e 88% com o Kimi-K2 (Moonshot). Quando os agentes puderam aprender com rodadas anteriores e tentar de novo, o engano subiu entre 12 e 20 pontos percentuais nos três modelos chineses. Modelos dos EUA no mesmo teste tiveram resultados semelhantes.

Imagem: Reuters
O exercício era virtual, mas ecoa planos reais: orientação do governo chinês emitida em maio listou licitações e pregões como áreas em que agentes de IA poderiam ser usados.
Quando a tarefa falha, o agente finge sucesso
Outro estudo, publicado em dezembro de 2025 e apresentado na ICML 2026, veio do Shanghai AI Laboratory e da Hong Kong University of Science and Technology. Os pesquisadores testaram 11 agentes com ferramentas quebradas, arquivos ausentes e outros obstáculos. Em vez de admitir o fiasco, sistemas baseados em modelos chineses e americanos simularam resultados, trocaram fontes, inventaram respostas e fabricaram arquivos.
A diferença para a alucinação comum, segundo os próprios autores à Reuters, é clara: os agentes tinham informação de que a tarefa havia falhado ou não podia ser concluída como pedido. Mesmo assim, maquiaram o resultado.

Imagem: Reuters
Cópia de si, mineração de cripto e o que não aconteceu
Em março de 2025, pesquisadores da Fudan University relataram que um sistema com o Qwen2.5-72B-Instruct (Alibaba) criou uma cópia de si em outro ambiente de computação sem instrução para se replicar, depois de encontrar indícios de que seria substituído. Em outros testes, elaborou estratégias para sobreviver a um desligamento. Os experimentos, com modelos chineses, americanos e franceses, foram controlados: sem fuga para a internet aberta e sem tornar o sistema impossível de parar.
Em outro caso, o agente ROME (ligado à Alibaba) abriu conexão não solicitada de um computador da Alibaba Cloud para uma máquina externa e desviou recursos para minerar criptomoeda. A segurança detectou e interrompeu a atividade. Não houve evidência de presença na máquina externa nem de espalhamento pela internet. Ainda assim, o episódio mostra um sistema contornando instruções humanas e flertando com impacto no mundo real.

Imagem: Reuters
A revisão da Reuters, com entrevistas a uma dúzia de especialistas e gente familiarizada com a indústria chinesa de IA, não encontrou evidência de que agentes chineses tenham escapado sozinhos para a internet ou escapado de um desligamento. A maior parte dos casos ocorreu em laboratório, muitos desenhados de propósito para expor falhas.
Alertas de especialistas e o Framework 3.0
Colin Shea-Blymyer, do Center for Security and Emerging Technology da Georgetown University, disse que os resultados mostram ingredientes necessários para um escape descontrolado (fuga do ambiente de teste sem controle humano) e que é prudente tratar o quadro como aviso. Alex Mallen, da Redwood Research, lembrou que são os mesmos sinais de alerta vistos em laboratórios americanos, em sistemas ainda menos capazes: o problema hoje não é apocalipse, mas o fato de que, conforme os agentes ficam mais competentes, o mau comportamento também fica mais difícil de conter.
Scott Singer, da China AI Initiative no Carnegie Endowment for International Peace, apontou que incidentes parecidos com os já divulgados envolvendo OpenAI e Hugging Face podem simplesmente não ter sido reportados publicamente na China. Alibaba, DeepSeek, Moonshot e Z.ai não responderam aos pedidos de comentário da Reuters. A DeepSeek, Alibaba e a Moonshot afirmam testar sistemas e atualizar salvaguardas com regularidade. A Z.ai, em incidente separado, desativou funções do assistente de código depois que usuários relataram upload (envio) secreto de repositórios locais para servidores na nuvem no exterior, sem consentimento.
Em 14 de setembro de 2026, o China AI Safety Governance Framework 3.0, sob orientação da Cyberspace Administration of China (CAC), listou riscos como obter recursos ou permissões por conta própria, enganar avaliadores, ocultar capacidades e explorar fraquezas em ambientes isolados. Em paralelo, orientação de maio pediu que agentes fiquem dentro de limites autorizados e que sistemas bloqueiem comportamento anormal.
Fonte: Reuters