ARTFEED — Contemporary Art Intelligence

LLaDA MoE v2: Scalare i modelli linguistici di diffusione con miscela di esperti

ai-technology · 2026-08-06

Un recente articolo su arXiv (2608.03457) introduce LLaDA MoE v2, che esamina sistematicamente il comportamento di scaling dei modelli linguistici di diffusione (dLLM) con miscela di esperti (MoE). Questo studio rivela notevoli distinzioni quantitative rispetto ai modelli autoregressivi (AR) per quanto riguarda ottimizzazione, distribuzione del calcolo e architettura. Tra i risultati significativi: la dimensione ottimale del batch nominale aumenta più rapidamente con il calcolo, il tasso di apprendimento ottimale diminuisce rapidamente, e l'analisi IsoFLOP indica una propensione verso il lato dei dati, con il budget ottimale di token che si espande più velocemente del calcolo attivato sul lato del modello. Per l'architettura MoE, scale più grandi beneficiano di pool di esperti più ampi a capacità attivata costante, mentre una granularità moderata degli esperti è ancora efficace, e la frazione ottimale di capacità attivata per gli esperti condivisi rimane coerente. L'articolo stabilisce nuove leggi di scaling per i dLLM MoE, fornendo preziose intuizioni per lo sviluppo futuro di modelli.

Fatti principali

  • Titolo dell'articolo: LLaDA MoE v2: Scalare i modelli linguistici di diffusione con miscela di esperti
  • ID arXiv: 2608.03457
  • Tipo di annuncio: nuovo
  • Focus: comportamento di scaling dei modelli linguistici di diffusione MoE
  • La dimensione ottimale del batch nominale cresce più rapidamente con il calcolo
  • Il tasso di apprendimento ottimale diminuisce più rapidamente con il calcolo
  • L'analisi IsoFLOP rivela una propensione verso il lato dei dati nell'allocazione del calcolo
  • Scale più grandi favoriscono pool di esperti più ampi a capacità attivata fissa

Entità

Istituzioni

  • arXiv

Fonti