QLPO: Ottimizzazione delle Politiche Sensibile alla Lunghezza tramite Ricampionamento
Una nuova tecnica nota come Quadrant-weighted Sampling for Length-aware Policy Optimization (QLPO) affronta il problema delle lunghe catene di pensiero nei modelli di ragionamento sostanziali durante l'apprendimento per rinforzo. QLPO, un adattamento basato sul ricampionamento di GRPO, introduce un controllo implicito sulla lunghezza delle risposte senza alterare la funzione di ricompensa. Inizialmente, genera un eccesso di risposte candidate e successivamente ricampiona il set di addestramento, mantenendo il rapporto empirico tra risposte corrette e errate, promuovendo risposte corrette più brevi e risposte errate più lunghe. Questo approccio modifica la distribuzione di addestramento e incoraggia sottilmente la generazione di output più brevi da parte del modello. L'efficacia di questo metodo è stata valutata su modelli con parametri da 1,5B a 32B, comprendenti sia modelli base che modelli di ragionamento avanzati.
Fatti principali
- QLPO è una variante basata sul ricampionamento di GRPO
- Introduce un controllo implicito della lunghezza senza modificare la funzione di ricompensa
- Sovragenera risposte candidate e ricampiona il gruppo di addestramento
- Preserva il rapporto empirico corretto/errato
- Favorisce risposte corrette brevi e risposte errate lunghe
- Rimodella la distribuzione di addestramento per incoraggiare output più brevi
- Testato su modelli da 1,5B a 32B parametri
- Include modelli base e modelli di ragionamento forti
Entità
—