ABC-GRPO: Clipping Limitato per un Apprendimento per Rinforzo Stabile degli LLM
È stato proposto un nuovo algoritmo di apprendimento per rinforzo, All-Quadrant Bounded Clipping GRPO (ABC-GRPO), per affrontare un difetto critico nella Group Relative Policy Optimization (GRPO), un metodo popolare per l'addestramento di grandi modelli linguistici (LLM). La ricerca, dettagliata nell'articolo arXiv 2601.03895, identifica che GRPO, che eredita il clipping a livello di token di PPO ma utilizza vantaggi a livello di sequenza, lascia un quadrante dello spazio (rapporto di verosimiglianza, vantaggio) strutturalmente illimitato. In particolare, nel caso di vantaggio negativo combinato con un rapporto di verosimiglianza aumentato (Q4), alcuni token con rapporto elevato possono ricevere aggiornamenti soppressivi molto grandi, portando a un collasso dell'entropia e a confini di ragionamento ristretti. ABC-GRPO applica un clipping incondizionato in tutti e quattro i quadranti utilizzando confini dipendenti dal segno, tagliando il rapporto di verosimiglianza prima della moltiplicazione per il vantaggio. Questo aggiunge un limite di regione di fiducia in Q2 e un tetto in Q4, garantendo un addestramento stabile e generalizzabile. L'articolo è disponibile su arXiv ed è stato annunciato come un aggiornamento di tipo replace-cross.
Fatti principali
- ABC-GRPO è un nuovo algoritmo per l'apprendimento per rinforzo con LLM.
- Affronta un quadrante illimitato nel meccanismo di clipping di GRPO.
- Il quadrante illimitato è Q4: vantaggio negativo con rapporto di verosimiglianza aumentato.
- ABC-GRPO applica un clipping incondizionato in tutti e quattro i quadranti.
- Utilizza confini dipendenti dal segno per il clipping.
- Il metodo taglia il rapporto di verosimiglianza prima di moltiplicarlo per il vantaggio.
- Aggiunge un limite di regione di fiducia in Q2 e un tetto in Q4.
- L'articolo è arXiv:2601.03895, annunciato come replace-cross.
Entità
Istituzioni
- arXiv