Inversão de Gradiente Temporal para Reconstrução Privada de Trajetórias em Aprendizado por Reforço Incorporado
Aprendizado distribuído em agentes de aprendizado por reforço incorporado oferece um grau de privacidade ao manter os dados brutos dos sensores no dispositivo e transmitir apenas gradientes de política ao servidor. Contudo, a estrutura temporal pode amplificar esse vazamento além de ataques de quadro único. Introduzimos o Temporal Reconstruction Attack on Consecutive Encodings (TRACE), um ataque amortizado de inversão de gradiente temporal que reconstrói autoregressivamente a sequência de trajetórias privadas de observação‑ação a partir dos gradientes de aprendizado de política por passo. O ataque explora dois sinais estruturais ignorados por métodos de quadro único anteriores: (i) correlação intertemporal entre gradientes incorporados sucessivos, que formalizamos por meio de um limite de informação mútua condicional, e (ii) recuperação em forma fechada de ações a partir da estrutura de gradiente da cabeça de política, que provamos ser exata quando a regularização de entropia padrão é suficientemente pequena. Em dados reservados …