Il Metodo ReCo Mitiga la Concentrazione Distribuzionale di GRPO nell'Addestramento dei LLM
Uno studio recente pubblicato su arXiv (2607.26862) evidenzia una debolezza nell'Optimizzazione Politica Relativa di Gruppo (GRPO), una tecnica comune di apprendimento per rinforzo utilizzata per il post-addestramento dei modelli linguistici. I ricercatori hanno scoperto che GRPO riduce le capacità di ragionamento del modello base e ha prestazioni scadenti in Pass@k quando k è grande, suggerendo una diminuzione della copertura dei percorsi di ragionamento. Questo problema sorge perché GRPO si concentra sulle risposte che il modello base genera con alta probabilità. Due fattori contribuiscono a ciò: a livello di risposta, le risposte ad alta probabilità che si verificano frequentemente distorcono il gradiente di gruppo; a livello di token, il rapporto di importanza di GRPO amplifica i gradienti, favorendo i token più probabili secondo la politica corrente. Per contrastare ciò, gli autori introducono ReCo, una strategia di ripesatura che normalizza i contributi delle risposte in base alla loro frequenza attesa all'interno del gruppo di rollout, affrontando il rapporto di importanza a livello di token. L'articolo è una sottomissione incrociata volta a migliorare la diversità e la copertura dei percorsi di ragionamento nel post-addestramento dei LLM.
Fatti principali
- L'articolo arXiv 2607.26862 identifica la concentrazione distribuzionale in GRPO.
- GRPO può ridurre la capacità di ragionamento del modello base e avere prestazioni inferiori in Pass@k per k grandi.
- La concentrazione si verifica sulle risposte ad alta probabilità del modello base.
- Due meccanismi: occorrenza ripetuta a livello di risposta e scalatura del rapporto di importanza a livello di token.
- ReCo normalizza i contributi delle risposte in base all'occorrenza attesa all'interno del gruppo di rollout.
- ReCo affronta anche il rapporto di importanza a livello di token.
- L'articolo è una sottomissione incrociata.
- ReCo mira a migliorare la copertura dei percorsi di ragionamento.
Entità
Istituzioni
- arXiv