ARTFEED — Contemporary Art Intelligence

PRISM: Un Nuovo Quadro per l'Apprendimento per Rinforzo Multi-Reward nei LLM

ai-technology · 2026-08-03

Un nuovo quadro chiamato PRISM è stato sviluppato da ricercatori per migliorare l'apprendimento per rinforzo (RL) multi-reward nei modelli linguistici di grandi dimensioni (LLM). Questo quadro affronta il problema della tassa di allineamento, che deriva da obiettivi contrastanti che portano a processi di post-addestramento instabili e inefficienti. Invece di fondere i reward, PRISM separa lo spazio delle politiche in politiche positive distinte e una singola politica negativa, riducendo i conflitti di ottimizzazione e facilitando un migliore controllo durante l'inferenza. La metodologia è dettagliata in un articolo disponibile su arXiv (2607.29246) e ha il potenziale per migliorare l'adattabilità dei LLM a vari valori umani e applicazioni.

Fatti principali

  • PRISM è un nuovo quadro RL multi-reward per LLM.
  • Utilizza la decomposizione e composizione dello spazio delle politiche.
  • Ottimizza politiche positive indipendenti e una politica negativa globale.
  • Questo approccio riduce i conflitti durante l'ottimizzazione multi-reward.
  • Consente la controllabilità durante l'inferenza.
  • L'articolo è disponibile su arXiv con ID 2607.29246.
  • Il quadro affronta il problema della tassa di allineamento nel RL multi-reward.
  • È progettato per LLM per adattarsi a diversi valori umani e casi d'uso.

Entità

Istituzioni

  • arXiv

Fonti