ARTFEED — Contemporary Art Intelligence

MNPO: Ottimizzazione delle Preferenze di Nash Multiplayer per l'Allineamento dei LLM

ai-technology · 2026-08-13

Un nuovo approccio noto come Ottimizzazione delle Preferenze di Nash Multiplayer (MNPO) è stato sviluppato per superare le carenze delle attuali tecniche di apprendimento per rinforzo dal feedback umano (RLHF). Mentre RLHF serve come metodo convenzionale per allineare i modelli linguistici di grandi dimensioni (LLM) con le preferenze umane, le strategie basate su ricompensa che si fondano sull'assunzione di Bradley-Terry spesso non riescono a rappresentare adeguatamente la nontransitività e la diversità delle preferenze reali. Ricerche recenti hanno reinterpretato l'allineamento come un gioco di Nash a due giocatori, portando all'apprendimento di Nash dal feedback umano (NLHF). Sebbene algoritmi come INPO, ONPO e EGPO forniscano un solido supporto teorico ed empirico, sono limitati a scenari a due giocatori, creando un pregiudizio da avversario singolo. MNPO estende NLHF a un contesto multiplayer, inquadrando l'allineamento come un gioco a n giocatori, dove ogni partecipante riflette una preferenza unica. Questa struttura cerca di rappresentare più accuratamente le complessità dei sistemi di preferenza del mondo reale. L'articolo è disponibile su arXiv con l'identificatore 2509.23102, categorizzato sotto il tipo di annuncio 'replace'.

Fatti principali

  • MNPO generalizza NLHF a contesti multiplayer.
  • RLHF è il paradigma standard per allineare i LLM con le preferenze umane.
  • L'assunzione di Bradley-Terry non riesce a catturare la nontransitività e l'eterogeneità.
  • NLHF riformula l'allineamento come un gioco di Nash a due giocatori.
  • INPO, ONPO e EGPO sono algoritmi NLHF esistenti.
  • MNPO formula l'allineamento come un gioco a n giocatori.
  • L'articolo è su arXiv con ID 2509.23102.
  • Il tipo di annuncio è 'replace'.

Entità

Istituzioni

  • arXiv

Fonti