Regioni di fiducia scalate per entropia per RL asincrono
Un nuovo articolo su arXiv (2607.22186) rivela che i rapporti di importanza nell'apprendimento per rinforzo asincrono si scalano sistematicamente con l'entropia dei token, causando fenomeni distinti a bassa e alta entropia. A bassa entropia, la discrepanza tra training e inferenza si amplifica in rumore di campionamento; ad alta entropia, gli aggiornamenti dei pesi creano deviazioni esplorative legittime. I metodi esistenti che applicano soglie uniformi basate esclusivamente sulla magnitudine del rapporto ammettono involontariamente rumore amplificato mentre limitano strettamente l'esplorazione. L'articolo propone regioni di fiducia scalate per entropia per affrontare questo problema, migliorando la stabilità nel post-training di LLM.
Fatti principali
- Articolo arXiv 2607.22186
- RL asincrono utilizzato per il post-training di LLM
- Dati off-policy obsoleti possono causare il collasso della politica
- La scala del rapporto di importanza varia con l'entropia dei token
- Bassa entropia amplifica la discrepanza training-inferenza in rumore
- Alta entropia induce deviazioni esplorative legittime
- La correzione basata solo sulla magnitudine ammette rumore e limita l'esplorazione
- Regioni di fiducia scalate per entropia proposte come soluzione
Entità
Istituzioni
- arXiv