ARTFEED — Contemporary Art Intelligence

Il Vantaggio degli Ottimizzatori Hyperball Rimane Poco Chiaro

other · 2026-07-27

Un recente studio pubblicato su arXiv mette in discussione i presunti benefici degli ottimizzatori di tipo Hyperball nelle reti profonde invarianti di scala. I ricercatori introducono un tasso di apprendimento angolare efficace che incorpora l'angolo degli aggiornamenti dei parametri, nonché le norme dei parametri e degli aggiornamenti. Dimostrano che l'approccio tradizionale basato sulla norma è solo un caso specifico in condizioni di ortogonalità. Scomponendo gli aggiornamenti in parti radiali e tangenziali, scoprono che gli aggiornamenti radiali hanno un impatto diretto minimo sul tasso di apprendimento angolare efficace, il che non chiarisce perché MuonH converga più lentamente rispetto a MuonWD durante le fasi iniziali dell'addestramento.

Fatti principali

  • Titolo del paper: Hyperball May Not Be a Free Lunch
  • ID arXiv: 2607.22444
  • Tipo di annuncio: cross
  • Si concentra su reti profonde invarianti di scala
  • Deriva il tasso di apprendimento angolare efficace
  • Mostra che la misura basata sulla norma è un caso speciale sotto ortogonalità
  • Scompone gli aggiornamenti dell'ottimizzatore in componenti radiali e tangenziali
  • La componente radiale ha un effetto diretto limitato sul tasso di apprendimento angolare efficace

Entità

Istituzioni

  • arXiv

Fonti