Regolarizzazione del Vicinato Ground-Truth per il Post-Training RL di Modelli Fondamentali di Serie Temporali
Un nuovo articolo su arXiv (2608.08010) introduce la Regolarizzazione del Vicinato Ground-Truth (GTN-R) per affrontare un fenomeno chiamato 'collasso subottimale' nel post-training con apprendimento per rinforzo (RL) dei modelli fondamentali di serie temporali (TSFM). Gli autori osservano che durante il post-training RL, le distribuzioni di output dei TSFM possono gradualmente allontanarsi dal ground-truth in determinate regioni di previsione, limitando le prestazioni. Attribuiscono ciò alla difficoltà di campionare inizialmente traiettorie di alta qualità vicino al ground-truth. GTN-R è proposta come tecnica di regolarizzazione per mantenere gli output del modello vicini al ground-truth, migliorando così l'accuratezza delle previsioni. L'articolo è classificato come annuncio di tipo cross ed è disponibile su arXiv.
Fatti principali
- ID dell'articolo: arXiv:2608.08010
- Tipo di annuncio: cross
- Propone la Regolarizzazione del Vicinato Ground-Truth (GTN-R)
- Affronta il 'collasso subottimale' nel post-training RL
- Si concentra sui modelli fondamentali di serie temporali (TSFM)
- Il post-training RL può spostare le distribuzioni di output lontano dal ground-truth
- La difficoltà nel campionare traiettorie di alta qualità vicino al ground-truth è un fattore contribuente
- Pubblicato su arXiv
Entità
Istituzioni
- arXiv