ARTFEED — Contemporary Art Intelligence

MT-GRPO: Bilanciare il ragionamento multi-task dei LLM

ai-technology · 2026-08-06

Un nuovo algoritmo chiamato Multi-Task GRPO (MT-GRPO) è stato sviluppato dai ricercatori per migliorare l'affidabilità dei grandi modelli linguistici (LLM) in vari compiti di ragionamento. I metodi convenzionali di apprendimento per rinforzo che utilizzano GRPO spesso portano a prestazioni disomogenee, dove alcuni compiti prevalgono su altri, causando stagnazione. Inoltre, la frequenza con cui i prompt non producono vantaggi può distorcere l'efficacia del segnale di ottimizzazione. MT-GRPO affronta queste sfide regolando dinamicamente i pesi dei compiti per migliorare le prestazioni del compito peggiore e garantire un progresso equilibrato. Impiega inoltre un campionatore che preserva i rapporti per allineare i gradienti delle politiche specifiche dei compiti con questi pesi regolati. Gli esperimenti condotti in scenari a 3 e 9 compiti dimostrano che MT-GRPO supera costantemente gli approcci di base esistenti. L'articolo di ricerca è disponibile su arXiv con l'identificatore 2602.05547.

Fatti principali

  • MT-GRPO è un nuovo algoritmo per l'apprendimento per rinforzo multi-task nei LLM.
  • Adatta dinamicamente i pesi dei compiti per ottimizzare le prestazioni del compito peggiore.
  • Introduce un campionatore che preserva i rapporti per i gradienti delle politiche specifiche dei compiti.
  • Gli esperimenti sono stati condotti in contesti a 3 e 9 compiti.
  • MT-GRPO supera costantemente i metodi di base.
  • L'articolo è disponibile su arXiv (2602.05547).
  • L'algoritmo affronta gli esiti sbilanciati nel GRPO multi-task.
  • Gestisce tassi di zero-vantaggio variabili tra i compiti.

Entità

Istituzioni

  • arXiv

Fonti