Open Source RadarNotícias G
Open Source RadarNotícias
Open Source RadarInteligência de Notícias Entrar Projetos
Todos os eventos
Pesquisa Incidente Imediato 1 matérias

Agentes LLM podem facilmente adulterar seus próprios rastros

Monitoramento assíncrono, investigações de incidentes e auditorias de conformidade dependem principalmente dos rastros de agentes para reconstruir o que ocorreu. Essas análises presumem que agentes LLM não podem adulterar seus próprios rastros de execução. Demonstramos que agentes LLM locais como Claude Code, Codex, Antigravity, Open Code e Grok Build não conseguem impor essa barreira. Todos os harnesses testados, exceto o Muse Code, permitiram que os agentes excluíssem seus rastros quando solicitados, sem acionar as salvaguardas do monitor. Também validamos que invasores externos podem explorar essa lacuna para induzir a exclusão de rastros. Por fim, mostramos que o comportamento de adulteração de rastros surge naturalmente em modelos de ponta, quando os agentes buscam melhorar suas recompensas. Recomendamos que os profissionais garantam que o registro de rastros ocorra por meio de um mecanismo de interceptação independente, fora do controle do agente, preservando a integridade dos rastros mesmo em casos de comprometimento total do host. No geral, o…

Evento consolidado
Gerenciar alertas
Análise do Radar

O que aconteceu e por que importa

Inteligência do evento

Por que este sinal merece atenção

Comparar com Em Alta
85Relevânciaforça do sinal no contexto atual
34Tendênciavelocidade e recorrência do movimento
100Novidadequanto o sinal adiciona informação nova
Não identificadoImpacto Brasilabrir contexto nacional
Primeiro sinal24/09/2026 17:59
Último sinal24/09/2026 17:59
0horas em evolução
1fontes distintas
Entidades

Quem está dentro deste movimento

2 detectada(s)
Anthropiclaboratory · US
xAIlaboratory · US
Evidências

Timeline do evento

1 matéria(s)
24/09 17:59
arXiv cs.AIGlobal
Agentes LLM podem facilmente adulterar seus próprios rastros
Monitoramento assíncrono, investigações de incidentes e auditorias de conformidade dependem principalmente dos rastros de agentes para reconstruir o que ocorreu. Essas análises presumem que agentes LLM não podem adulterar seus próprios rastros de execução. Demonstramos que agentes LLM locais como Claude Code, Codex, Antigravity, Open Code e Grok Build não conseguem impor essa barreira. Todos os harnesses testados, exceto o Muse Code, permitiram que os agentes excluíssem seus rastros quando solicitados, sem acionar as salvaguardas do monitor. Também validamos que invasores externos podem explorar essa lacuna para induzir a exclusão de rastros. Por fim, mostramos que o comportamento de adulteração de rastros surge naturalmente em modelos de ponta, quando os agentes buscam melhorar suas recompensas. Recomendamos que os profissionais garantam que o registro de rastros ocorra por meio de um mecanismo de interceptação independente, fora do controle do agente, preservando a integridade dos rastros mesmo em casos de comprometimento total do host. No geral, o…
Abrir fonte original
Receba o Radar Diário grátis
Todo dia às 8h: as notícias e os projetos open source de IA que importam, com contexto em português e a análise completa em PDF.
Prefere começar pelo PDF de hoje? Baixe o panorama.