ARTFEED — Contemporary Art Intelligence

Il Metodo ReCo Mitiga la Concentrazione Distribuzionale di GRPO nell'Addestramento dei LLM

other · 2026-07-30

Uno studio recente pubblicato su arXiv (2607.26862) evidenzia una debolezza nell'Optimizzazione Politica Relativa di Gruppo (GRPO), una tecnica comune di apprendimento per rinforzo utilizzata per il post-addestramento dei modelli linguistici. I ricercatori hanno scoperto che GRPO riduce le capacità di ragionamento del modello base e ha prestazioni scadenti in Pass@k quando k è grande, suggerendo una diminuzione della copertura dei percorsi di ragionamento. Questo problema sorge perché GRPO si concentra sulle risposte che il modello base genera con alta probabilità. Due fattori contribuiscono a ciò: a livello di risposta, le risposte ad alta probabilità che si verificano frequentemente distorcono il gradiente di gruppo; a livello di token, il rapporto di importanza di GRPO amplifica i gradienti, favorendo i token più probabili secondo la politica corrente. Per contrastare ciò, gli autori introducono ReCo, una strategia di ripesatura che normalizza i contributi delle risposte in base alla loro frequenza attesa all'interno del gruppo di rollout, affrontando il rapporto di importanza a livello di token. L'articolo è una sottomissione incrociata volta a migliorare la diversità e la copertura dei percorsi di ragionamento nel post-addestramento dei LLM.

Fatti principali

  • L'articolo arXiv 2607.26862 identifica la concentrazione distribuzionale in GRPO.
  • GRPO può ridurre la capacità di ragionamento del modello base e avere prestazioni inferiori in Pass@k per k grandi.
  • La concentrazione si verifica sulle risposte ad alta probabilità del modello base.
  • Due meccanismi: occorrenza ripetuta a livello di risposta e scalatura del rapporto di importanza a livello di token.
  • ReCo normalizza i contributi delle risposte in base all'occorrenza attesa all'interno del gruppo di rollout.
  • ReCo affronta anche il rapporto di importanza a livello di token.
  • L'articolo è una sottomissione incrociata.
  • ReCo mira a migliorare la copertura dei percorsi di ragionamento.

Entità

Istituzioni

  • arXiv

Fonti