SignalReasoner: Valutare il limite superiore dei modelli 3B per il ragionamento matematico sui segnali
Il documento intitolato 'SignalReasoner' valuta il limite superiore dei modelli 3B nell'ambito del ragionamento matematico sui segnali, affrontando specificamente sfide di livello post-laurea. Pubblicato come arXiv:2608.17301, utilizza Qwen2.5-3B-Base come modello di base e adotta il benchmark WirelessMATHBench-XL. La ricerca esamina due strategie di addestramento: apprendimento per rinforzo diretto (RL) e fine-tuning supervisionato (SFT) seguito da RL. Inoltre, valuta GRPO, GSPO e Geometric-Mean Policy Optimization. Questo studio evidenzia una lacuna significativa nell'esplorazione delle applicazioni del RL nell'elaborazione dei segnali.
Fatti principali
- Il documento è arXiv:2608.17301.
- Valuta il limite superiore dei modelli 3B per il ragionamento matematico sui segnali.
- Utilizza Qwen2.5-3B-Base come modello di base.
- Si concentra su problemi di matematica dei segnali di livello post-laurea.
- Il benchmark è WirelessMATHBench-XL.
- Vengono esaminati due paradigmi di addestramento: RL diretto e SFT seguito da RL.
- Valuta GRPO, GSPO e Geometric-Mean Policy Optimization.
- Lo studio affronta una lacuna: il RL per l'elaborazione dei segnali rimane poco esplorato.
Entità
Istituzioni
- arXiv