PoEM: Predizendo Resultados de RL a partir de Políticas Existentes
Modelos fundacionais são pós-treinados com reinforcement learning (RL) para maximizar recompensas específicas, como alinhamento humano, correção ou seguimento de instruções. Esse processo de pós‑treinamento é computacionalmente intensivo, às vezes instável, e precisa ser reiniciado do zero sempre que o modelo de recompensa muda ou quando queremos combinar múltiplas recompensas. Assim, perguntamos: dado uma nova função de recompensa, é possível prever os resultados de RL sem realmente executar RL sobre ela? Respondemos afirmativamente ao introduzir o PoEM, uma estrutura para prever as saídas de RL em uma nova função de recompensa usando um conjunto de modelos já pós‑treinados em outras recompensas. Primeiro, demonstramos que se a nova função de recompensa pode ser escrita como uma combinação linear das existentes, então a nova política em log‑space pode ser escrita como uma combinação linear das políticas log‑existentes. Surpreendentemente, mesmo em casos onde a re…