PRISM: Un Nuovo Quadro per l'Apprendimento per Rinforzo Multi-Reward nei LLM
Un nuovo quadro chiamato PRISM è stato sviluppato da ricercatori per migliorare l'apprendimento per rinforzo (RL) multi-reward nei modelli linguistici di grandi dimensioni (LLM). Questo quadro affronta il problema della tassa di allineamento, che deriva da obiettivi contrastanti che portano a processi di post-addestramento instabili e inefficienti. Invece di fondere i reward, PRISM separa lo spazio delle politiche in politiche positive distinte e una singola politica negativa, riducendo i conflitti di ottimizzazione e facilitando un migliore controllo durante l'inferenza. La metodologia è dettagliata in un articolo disponibile su arXiv (2607.29246) e ha il potenziale per migliorare l'adattabilità dei LLM a vari valori umani e applicazioni.
Fatti principali
- PRISM è un nuovo quadro RL multi-reward per LLM.
- Utilizza la decomposizione e composizione dello spazio delle politiche.
- Ottimizza politiche positive indipendenti e una politica negativa globale.
- Questo approccio riduce i conflitti durante l'ottimizzazione multi-reward.
- Consente la controllabilità durante l'inferenza.
- L'articolo è disponibile su arXiv con ID 2607.29246.
- Il quadro affronta il problema della tassa di allineamento nel RL multi-reward.
- È progettato per LLM per adattarsi a diversi valori umani e casi d'uso.
Entità
Istituzioni
- arXiv