ARTFEED — Contemporary Art Intelligence

Sensibilità Dipendente dalla Profondità nei Modelli Mixture-of-Experts: Analisi di Qwen3.6-35B-A3B

ai-technology · 2026-08-17

Un recente preprint su arXiv (2608.13565) descrive un'analisi di sensibilità condotta strato per strato sul framework Mixture-of-Experts (MoE) all'interno del modello Qwen3.6-35B-A3B, che consiste in 40 strati MoE, ciascuno con 256 esperti e utilizzando il routing top-8. Impiegando il mascheramento degli esperti basato sulla magnitudine, i ricercatori hanno valutato come la rimozione degli esperti a bassa magnitudine influisse sulle prestazioni, utilizzando il benchmark XLCoST su 100, 300 e 500 prompt su tre server GPU H100. I risultati mostrano che i primi strati (0-9) e gli strati intermedi (10-29) sono sensibili al mascheramento degli esperti, mentre gli ultimi strati (30-39), in particolare quelli molto finali (35-39), possono sopportare un mascheramento significativo, indicando opportunità di compressione del modello. Questa ricerca sottolinea l'importanza della sensibilità degli strati MoE per un'implementazione efficiente.

Fatti principali

  • Lo studio analizza il modello Qwen3.6-35B-A3B con 40 strati MoE, 256 esperti per strato e routing top-8.
  • Il mascheramento degli esperti basato sulla magnitudine viene utilizzato per valutare la sensibilità degli strati.
  • Il benchmark XLCoST per la traduzione di codice multilingue viene utilizzato per la valutazione.
  • Le scale di valutazione includono 100, 300 e 500 prompt.
  • Sono stati utilizzati tre server GPU H100 per gli esperimenti.
  • I primi strati (0-9) e gli strati intermedi (10-29) sono altamente fragili al mascheramento degli esperti.
  • Gli ultimi strati (30-39) e quelli molto finali (35-39) tollerano un mascheramento aggressivo degli esperti a bassa magnitudine.
  • I risultati suggeriscono una sensibilità dipendente dalla profondità, con gli ultimi strati più comprimibili.

Entità

Istituzioni

  • arXiv

Fonti