ARTFEED — Contemporary Art Intelligence

LorExperts: Un Nuovo Metodo per Comprimere i Modelli Mixture-of-Experts

ai-technology · 2026-08-11

Uno studio recente pubblicato su arXiv (2608.07814) presenta LorExperts, un approccio innovativo per comprimere i modelli linguistici Mixture-of-Experts (MoE). Sebbene i modelli MoE offrano una capacità sostanziale con un calcolo minimo per token, le loro numerose matrici di peso degli esperti possono comportare costi di implementazione elevati. I metodi di compressione attuali, come il pruning degli esperti (ad esempio, REAP) e il merging, riducono le spese ma spesso compromettono l'accuratezza e richiedono il riaddestramento del router. Sebbene la decomposizione delta a basso rango (ad esempio, D^2-MoE) mantenga tutti gli esperti e il router, la sua efficacia diminuisce all'aumentare del numero di esperti a causa dei limiti di un singolo componente condiviso. I ricercatori dimostrano che i pesi degli esperti MoE sono quasi ortogonali, il che ostacola il ridimensionamento. Tuttavia, gli esperti formano comunità funzionali di co-attivazione indipendenti dalla somiglianza dei pesi. LorExperts affronta questo problema raggruppando gli esperti, mantenendo un esperto dominante a piena precisione per ciascun cluster e utilizzando aggiornamenti a basso rango per gli altri. Questo metodo, che preserva il router, cerca di minimizzare l'uso della memoria senza sacrificare l'accuratezza. Gli autori hanno annunciato questo lavoro come una sottomissione cross-type su arXiv, evidenziando la sua importanza per l'implementazione di modelli linguistici di grandi dimensioni in ambienti con risorse limitate.

Fatti principali

  • LorExperts è un nuovo metodo di compressione per i modelli linguistici Mixture-of-Experts (MoE).
  • Raggruppa gli esperti e mantiene un esperto dominante a piena precisione per ciascun cluster.
  • Il metodo preserva il router, a differenza del pruning e del merging degli esperti.
  • Affronta il degrado della decomposizione delta a basso rango all'aumentare del numero di esperti.
  • Gli esperti si organizzano in comunità funzionali di co-attivazione disaccoppiate dalla somiglianza dei pesi.
  • L'articolo è disponibile su arXiv con ID 2608.07814.
  • Il metodo mira a ridurre i costi di implementazione mantenendo l'accuratezza.
  • È una sottomissione cross-type su arXiv.

Entità

Istituzioni

  • arXiv

Fonti