ARTFEED — Contemporary Art Intelligence

MOSAIC: Scaling Consapevole dei Sistemi per Mixture-of-Experts Sparsi

ai-technology · 2026-08-13

Una recente pubblicazione su arXiv (2608.10605) presenta MOSAIC, un nuovo framework volto alla progettazione simultanea dell'architettura del modello e dei sistemi, su misura per il pre-addestramento su larga scala di modelli linguistici a Mixture-of-Experts (MoE) sparsi. A differenza dei metodi tradizionali in cui le decisioni sull'architettura e sui sistemi vengono prese in modo indipendente, MOSAIC tratta questo co-design come una sfida di ottimizzazione. Integra una legge di scaling predittiva con un modello di prestazioni che valuta l'utilizzo dei FLOP del modello (MFU), le spese di comunicazione, l'uso della memoria e la configurazione parallela. Concentrandosi su modelli MoE sparsi, gli autori analizzano come il numero di esperti e la sparsità del routing influenzino la perdita e l'efficienza. Questa ricerca colma il divario tra configurazioni ottimali dal punto di vista computazionale e quelle ottimali per il cluster, sostenendo uno scaling consapevole dei sistemi per migliorare l'efficienza dell'addestramento.

Fatti principali

  • Titolo del paper: Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts
  • ID arXiv: 2608.10605
  • Tipo di annuncio: cross
  • Introduce MOSAIC, un framework per il co-design dell'architettura del modello e dei sistemi
  • MOSAIC accoppia una legge di scaling predittiva con un modello di prestazioni calibrato
  • Il modello di prestazioni stima MFU, costo di comunicazione, impronta di memoria e layout parallelo ottimale
  • Istanziati per modelli linguistici a Mixture-of-Experts (MoE) sparsi
  • Legge di scaling adattata su modelli MoE sparsi addestrati su dati testuali, con il fattore di sparsità come dimensione di scaling

Entità

Istituzioni

  • arXiv

Fonti