MT-GRPO: Bilanciare il ragionamento multi-task dei LLM
Un nuovo algoritmo chiamato Multi-Task GRPO (MT-GRPO) è stato sviluppato dai ricercatori per migliorare l'affidabilità dei grandi modelli linguistici (LLM) in vari compiti di ragionamento. I metodi convenzionali di apprendimento per rinforzo che utilizzano GRPO spesso portano a prestazioni disomogenee, dove alcuni compiti prevalgono su altri, causando stagnazione. Inoltre, la frequenza con cui i prompt non producono vantaggi può distorcere l'efficacia del segnale di ottimizzazione. MT-GRPO affronta queste sfide regolando dinamicamente i pesi dei compiti per migliorare le prestazioni del compito peggiore e garantire un progresso equilibrato. Impiega inoltre un campionatore che preserva i rapporti per allineare i gradienti delle politiche specifiche dei compiti con questi pesi regolati. Gli esperimenti condotti in scenari a 3 e 9 compiti dimostrano che MT-GRPO supera costantemente gli approcci di base esistenti. L'articolo di ricerca è disponibile su arXiv con l'identificatore 2602.05547.
Fatti principali
- MT-GRPO è un nuovo algoritmo per l'apprendimento per rinforzo multi-task nei LLM.
- Adatta dinamicamente i pesi dei compiti per ottimizzare le prestazioni del compito peggiore.
- Introduce un campionatore che preserva i rapporti per i gradienti delle politiche specifiche dei compiti.
- Gli esperimenti sono stati condotti in contesti a 3 e 9 compiti.
- MT-GRPO supera costantemente i metodi di base.
- L'articolo è disponibile su arXiv (2602.05547).
- L'algoritmo affronta gli esiti sbilanciati nel GRPO multi-task.
- Gestisce tassi di zero-vantaggio variabili tra i compiti.
Entità
Istituzioni
- arXiv