ARTFEED — Contemporary Art Intelligence

La convergenza GRPO richiede uno spazio d'azione discreto per il controllo di quadricotteri con modelli piccoli

ai-technology · 2026-07-27

Un recente studio su arXiv (2607.21626) esplora il potenziale dell'ottimizzazione della politica relativa di gruppo (GRPO) nel perfezionamento di piccoli modelli linguistici per applicazioni di controllo continuo di quadricotteri. Quando Qwen-0.5B è stato sottoposto a un fine-tuning GRPO standard per il controllo della velocità di un quadricottero a 25 Hz, ha fallito, con un tasso di successo dello 0% mentre l'entropia è crollata da 0,35 a 0,03 in soli 60 passi. Sebbene l'eliminazione del termine di penalità per lo scatto o dell'ancora KL abbia arrestato il declino dell'entropia, non ha facilitato l'apprendimento. Al contrario, la sostituzione dell'interfaccia d'azione continua con una selezione categorica a 5 vie di preset PID ha portato a un addestramento riuscito. Il controllore finale ha raggiunto un successo del 98,6% con uno scatto di 0,656 m/s³ a 64 passi e un successo del 100% con uno scatto di 1,103 m/s³ (o 0,796 con un limite di velocità) a 256 passi, valutato su tre modelli pre-addestrati.

Fatti principali

  • Il fine-tuning GRPO vanilla di Qwen-0.5B per il controllo di quadricotteri collassa ad azione zero con tasso di successo dello 0%.
  • L'entropia scende da 0,35 a 0,03 entro 60 passi durante il collasso.
  • La rimozione della penalità per lo scatto o dell'ancora KL previene il collasso dell'entropia ma non consente l'apprendimento.
  • Uno spazio d'azione categorico discreto a 5 vie su preset PID consente la convergenza.
  • A 64 passi: 98,6% di successo, scatto di 0,656 m/s³.
  • A 256 passi: 100% di successo, scatto di 1,103 m/s³ (0,796 con limite di velocità).
  • Lo studio utilizza il modello Qwen-0.5B e il controllo simulato di un quadricottero.
  • La valutazione su tre modelli pre-addestrati mostra risultati coerenti.

Entità

Istituzioni

  • arXiv

Fonti