Quadro Trust-Region per la Stima dei Momenti in Ottimizzatori Adattivi
Un nuovo studio su arXiv (2608.04026) introduce una strategia trust-region per spiegare i metodi di stima adattiva dei momenti, come Adam, nell'ottimizzazione stocastica del gradiente. Questo approccio mantiene gli aggiornamenti dei pesi all'interno di una regione di fiducia definita da un vincolo sui momenti che va dall'ordine 2 al 4. Ciò porta a varie tecniche di tasso di apprendimento basate sulla stima del secondo momento e del p-esimo momento, con p=4 collegato alla stima simile alla curtosi. Denominato Gmake, questo metodo combina la normalizzazione tramite stima dei momenti, la pianificazione del tasso di apprendimento, il momento tramite filtraggio passa-basso spettrale e la normalizzazione spettrale a livello di operatore. I test con GPT2-124M su FineWeb-Edu e TinyStories suggeriscono che l'uso del quarto momento dà risultati incoraggianti. Il team di ricerca ha classificato questo come un invio di tipo trasversale, fornendo una base teorica per l'ottimizzazione adattiva nell'apprendimento profondo.
Fatti principali
- Il documento arXiv:2608.04026 introduce un quadro trust-region per la stima dei momenti.
- Il quadro si applica a meccanismi di stima adattiva dei momenti come Adam.
- L'ampiezza del passo di aggiornamento è vincolata all'interno di una regione di fiducia governata da un vincolo sui momenti di ordine p in [2,4].
- La derivazione produce meccanismi di tasso di apprendimento basati sulla stima del secondo momento e del p-esimo momento normalizzato.
- p=4 coinvolge una stima simile alla curtosi.
- Il meccanismo generale denominato Gmake unifica normalizzazione, pianificazione, filtraggio passa-basso spettrale e normalizzazione spettrale.
- Gli esperimenti sono stati condotti su GPT2-124M addestrato su FineWeb-Edu e TinyStories.
- I risultati suggeriscono che la realizzazione del quarto momento è efficace.
- Il documento è un invio di tipo trasversale su arXiv.
Entità
Istituzioni
- arXiv