La convergenza GRPO richiede uno spazio d'azione discreto per il controllo di quadricotteri con modelli piccoli
Un recente studio su arXiv (2607.21626) esplora il potenziale dell'ottimizzazione della politica relativa di gruppo (GRPO) nel perfezionamento di piccoli modelli linguistici per applicazioni di controllo continuo di quadricotteri. Quando Qwen-0.5B è stato sottoposto a un fine-tuning GRPO standard per il controllo della velocità di un quadricottero a 25 Hz, ha fallito, con un tasso di successo dello 0% mentre l'entropia è crollata da 0,35 a 0,03 in soli 60 passi. Sebbene l'eliminazione del termine di penalità per lo scatto o dell'ancora KL abbia arrestato il declino dell'entropia, non ha facilitato l'apprendimento. Al contrario, la sostituzione dell'interfaccia d'azione continua con una selezione categorica a 5 vie di preset PID ha portato a un addestramento riuscito. Il controllore finale ha raggiunto un successo del 98,6% con uno scatto di 0,656 m/s³ a 64 passi e un successo del 100% con uno scatto di 1,103 m/s³ (o 0,796 con un limite di velocità) a 256 passi, valutato su tre modelli pre-addestrati.
Fatti principali
- Il fine-tuning GRPO vanilla di Qwen-0.5B per il controllo di quadricotteri collassa ad azione zero con tasso di successo dello 0%.
- L'entropia scende da 0,35 a 0,03 entro 60 passi durante il collasso.
- La rimozione della penalità per lo scatto o dell'ancora KL previene il collasso dell'entropia ma non consente l'apprendimento.
- Uno spazio d'azione categorico discreto a 5 vie su preset PID consente la convergenza.
- A 64 passi: 98,6% di successo, scatto di 0,656 m/s³.
- A 256 passi: 100% di successo, scatto di 1,103 m/s³ (0,796 con limite di velocità).
- Lo studio utilizza il modello Qwen-0.5B e il controllo simulato di un quadricottero.
- La valutazione su tre modelli pre-addestrati mostra risultati coerenti.
Entità
Istituzioni
- arXiv