ARTFEED — Contemporary Art Intelligence

MESH: Ottimizzazione Sinkhorn a Efficienza di Memoria per l'Addestramento di MoE

ai-technology · 2026-08-06

Uno studio recente pubblicato su arXiv (2608.04407) presenta MESH, un aggiornamento Sinkhorn a momento nascosto volto a migliorare l'ottimizzazione efficiente in termini di memoria nell'addestramento di Mixture-of-Experts (MoE). Condotto in un ambiente controllato utilizzando un framework di pre-addestramento MoE in stile DeepSeek nanowhale con 110M di parametri, la ricerca ha rivelato che l'applicazione diretta della discesa del gradiente Sinkhorn all'addestramento MoE si è rivelata incoerente. Una combinazione di SAGE e Sinkhorn ha ridotto lo stato dell'ottimizzatore da 0,883GB a 0,331GB, ma ha portato a un aumento della perdita di valutazione a 3,8265, in contrasto con i baseline AdamW che vanno da 3,58 a 3,64. Lo studio ha individuato le matrici degli esperti MoE instradate come principale fonte di errore a causa dei loro gradienti condizionali e temporalmente fluttuanti. MESH affronta questo problema ripristinando un segnale temporale di primo momento durante l'intero ciclo di vita del buffer del gradiente senza richiedere che il primo momento dell'esperto venga memorizzato come stato dell'ottimizzatore, e include un'opzione di precondizionamento a blocchi. Questo articolo è anche un annuncio incrociato ed è accessibile su arXiv.

Fatti principali

  • Articolo: arXiv:2608.04407
  • MESH: Ottimizzazione Sinkhorn a Efficienza di Memoria per l'Addestramento di Mixture-of-Experts
  • Ambiente di pre-addestramento MoE in stile DeepSeek nanowhale con 110M di parametri
  • L'ibrido SAGE/Sinkhorn riduce lo stato dell'ottimizzatore da 0,883GB a 0,331GB
  • La perdita di valutazione degrada a 3,8265 con l'ibrido, rispetto ai baseline AdamW 3,58–3,64
  • Le matrici degli esperti MoE instradate sono il punto di errore dominante
  • MESH utilizza un aggiornamento Sinkhorn a momento nascosto
  • MESH ripristina il segnale temporale di primo momento senza memorizzare il primo momento dell'esperto come stato dell'ottimizzatore

Entità

Istituzioni

  • arXiv

Fonti