Open Source RadarNotícias G
Open Source RadarNotícias
Open Source RadarInteligência de Notícias Entrar Projetos
Todos os eventos
Pesquisa Pesquisa Médio prazo 1 matérias

PoEM: Predizendo Resultados de RL a partir de Políticas Existentes

Modelos fundacionais são pós-treinados com reinforcement learning (RL) para maximizar recompensas específicas, como alinhamento humano, correção ou seguimento de instruções. Esse processo de pós‑treinamento é computacionalmente intensivo, às vezes instável, e precisa ser reiniciado do zero sempre que o modelo de recompensa muda ou quando queremos combinar múltiplas recompensas. Assim, perguntamos: dado uma nova função de recompensa, é possível prever os resultados de RL sem realmente executar RL sobre ela? Respondemos afirmativamente ao introduzir o PoEM, uma estrutura para prever as saídas de RL em uma nova função de recompensa usando um conjunto de modelos já pós‑treinados em outras recompensas. Primeiro, demonstramos que se a nova função de recompensa pode ser escrita como uma combinação linear das existentes, então a nova política em log‑space pode ser escrita como uma combinação linear das políticas log‑existentes. Surpreendentemente, mesmo em casos onde a re…

Evento consolidado
Gerenciar alertas
Análise do Radar

O que aconteceu e por que importa

Inteligência do evento

Por que este sinal merece atenção

Comparar com Em Alta
85Relevânciaforça do sinal no contexto atual
34Tendênciavelocidade e recorrência do movimento
100Novidadequanto o sinal adiciona informação nova
Não identificadoImpacto Brasilabrir contexto nacional
Primeiro sinal24/09/2026 17:50
Último sinal24/09/2026 17:50
0horas em evolução
1fontes distintas
Evidências

Timeline do evento

1 matéria(s)
24/09 17:50
arXiv cs.CLGlobal
PoEM: Predizendo Resultados de RL a partir de Políticas Existentes
Modelos fundacionais são pós-treinados com reinforcement learning (RL) para maximizar recompensas específicas, como alinhamento humano, correção ou seguimento de instruções. Esse processo de pós‑treinamento é computacionalmente intensivo, às vezes instável, e precisa ser reiniciado do zero sempre que o modelo de recompensa muda ou quando queremos combinar múltiplas recompensas. Assim, perguntamos: dado uma nova função de recompensa, é possível prever os resultados de RL sem realmente executar RL sobre ela? Respondemos afirmativamente ao introduzir o PoEM, uma estrutura para prever as saídas de RL em uma nova função de recompensa usando um conjunto de modelos já pós‑treinados em outras recompensas. Primeiro, demonstramos que se a nova função de recompensa pode ser escrita como uma combinação linear das existentes, então a nova política em log‑space pode ser escrita como uma combinação linear das políticas log‑existentes. Surpreendentemente, mesmo em casos onde a re…
Abrir fonte original
Receba o Radar Diário grátis
Todo dia às 8h: as notícias e os projetos open source de IA que importam, com contexto em português e a análise completa em PDF.
Prefere começar pelo PDF de hoje? Baixe o panorama.