Il Vantaggio degli Ottimizzatori Hyperball Rimane Poco Chiaro
Un recente studio pubblicato su arXiv mette in discussione i presunti benefici degli ottimizzatori di tipo Hyperball nelle reti profonde invarianti di scala. I ricercatori introducono un tasso di apprendimento angolare efficace che incorpora l'angolo degli aggiornamenti dei parametri, nonché le norme dei parametri e degli aggiornamenti. Dimostrano che l'approccio tradizionale basato sulla norma è solo un caso specifico in condizioni di ortogonalità. Scomponendo gli aggiornamenti in parti radiali e tangenziali, scoprono che gli aggiornamenti radiali hanno un impatto diretto minimo sul tasso di apprendimento angolare efficace, il che non chiarisce perché MuonH converga più lentamente rispetto a MuonWD durante le fasi iniziali dell'addestramento.
Fatti principali
- Titolo del paper: Hyperball May Not Be a Free Lunch
- ID arXiv: 2607.22444
- Tipo di annuncio: cross
- Si concentra su reti profonde invarianti di scala
- Deriva il tasso di apprendimento angolare efficace
- Mostra che la misura basata sulla norma è un caso speciale sotto ortogonalità
- Scompone gli aggiornamenti dell'ottimizzatore in componenti radiali e tangenziali
- La componente radiale ha un effetto diretto limitato sul tasso di apprendimento angolare efficace
Entità
Istituzioni
- arXiv