ARTFEED — Contemporary Art Intelligence

REFLEX: Allocazione degli Esperti Basata sulla Raffinatezza per Modelli Linguistici a Diffusione

ai-technology · 2026-08-04

Un nuovo preprint arXiv (2608.01784) introduce REFLEX, un metodo senza addestramento per migliorare l'inferenza Mixture-of-Experts (MoE) nei modelli linguistici a diffusione (DLM). L'articolo sostiene che l'inferenza MoE nei DLM dovrebbe essere vista come un'allocazione computazionale consapevole della raffinatezza, poiché ogni passaggio di denoising in avanti rivisita tutte le posizioni dei token con diverse esigenze di raffinamento, mentre il routing predefinito a token fisso assegna un budget uniforme di esperti. REFLEX mantiene invariato il router predefinito ma riorganizza il calcolo degli esperti attorno agli stati di raffinamento in evoluzione, mirando a far corrispondere meglio il calcolo degli esperti con le esigenze di raffinamento. Il metodo è proposto come un modo per migliorare l'efficienza nei DLM senza addestramento aggiuntivo.

Fatti principali

  • Il preprint arXiv:2608.01784 introduce REFLEX.
  • REFLEX è un metodo senza addestramento per l'inferenza MoE nei modelli linguistici a diffusione.
  • Affronta la discrepanza tra il budget uniforme di esperti e le diverse esigenze di raffinamento.
  • Il metodo mantiene invariato il router predefinito.
  • Riorganizza il calcolo degli esperti attorno agli stati di raffinamento in evoluzione.
  • L'articolo è pubblicato su arXiv.
  • Il tipo di annuncio è nuovo.
  • Il metodo è proposto per i modelli linguistici a diffusione.

Entità

Istituzioni

  • arXiv

Fonti