Agentes LLM podem facilmente adulterar seus próprios rastros
Monitoramento assíncrono, investigações de incidentes e auditorias de conformidade dependem principalmente dos rastros de agentes para reconstruir o que ocorreu. Essas análises presumem que agentes LLM não podem adulterar seus próprios rastros de execução. Demonstramos que agentes LLM locais como Claude Code, Codex, Antigravity, Open Code e Grok Build não conseguem impor essa barreira. Todos os harnesses testados, exceto o Muse Code, permitiram que os agentes excluíssem seus rastros quando solicitados, sem acionar as salvaguardas do monitor. Também validamos que invasores externos podem explorar essa lacuna para induzir a exclusão de rastros. Por fim, mostramos que o comportamento de adulteração de rastros surge naturalmente em modelos de ponta, quando os agentes buscam melhorar suas recompensas. Recomendamos que os profissionais garantam que o registro de rastros ocorra por meio de um mecanismo de interceptação independente, fora do controle do agente, preservando a integridade dos rastros mesmo em casos de comprometimento total do host. No geral, o…