Direcionamento Minimante Invasivo de Modelos de Linguagem
Direcionamento pré‑logit adapta um modelo de linguagem congelado a uma recompensa no momento do teste ao adicionar vetores aos seus estados ocultos finais. A otimização de recompensa não regularizada pode alterar substancialmente a distribuição de saída e degradar a qualidade da geração. Propomos o Minimally Invasive Steering Vector Optimization (MISVO), que penaliza intervenções usando a geometria KL local da distribuição de tokens induzida. O quadrático de Fisher resultante mede a sensibilidade distributiva e admite um gradiente analítico computado por meio de produtos matriz‑vetor com a cabeça do modelo de linguagem congelado. Derivamos uma decomposição exata do gradiente KL ao nível de sequência em um termo Fisher analítico e um termo de função‑pontuação de sufixo. Para um horizonte de geração fixo, mostramos que o termo de sufixo é de segunda ordem na magnitude do direcionamento e que três substitutos de Fisher concordam com o gradiente KL completo na primeira ordem. O MISVO usa o …