EntropyMoE: Routing Sparso degli Esperti Basato sull'Entropia per LLM Senza Tokenizer
Una recente sottomissione su arXiv (2608.06398) presenta EntropyMoE, un framework innovativo di Mixture-of-Experts (MoE) progettato per modelli di linguaggio di grandi dimensioni (LLM) senza tokenizer che funzionano con patch di byte dinamiche. Questo studio affronta una sfida presente nei modelli a patch di byte attuali, che applicano uniformemente calcoli feed-forward densi su tutte le patch, trascurando di adattare la capacità del modello in base alle variazioni semantiche e di granularità delle patch. EntropyMoE sostituisce i componenti feed-forward densi nel Transformer globale a patch con layer di esperti Top-K, utilizzando ogni patch dinamica per il routing degli esperti. Il processo di routing è informato dall'entropia della patch, lo stesso segnale impiegato nella creazione dinamica delle patch, con entropia e lunghezza della patch che definiscono congiuntamente lo spazio delle caratteristiche di routing. Questo metodo migliora l'efficienza del calcolo sparso, potenzialmente aumentando le prestazioni negli LLM senza tokenizer.
Fatti principali
- EntropyMoE è un'architettura Mixture-of-Experts (MoE) per LLM senza tokenizer.
- Opera su patch di byte dinamiche, raggruppando i byte in patch di dimensioni variabili.
- Sostituisce i moduli feed-forward densi con layer di esperti Top-K.
- Il routing degli esperti si basa sull'entropia e sulla lunghezza della patch.
- Il router utilizza lo stesso segnale di granularità della costruzione dinamica delle patch.
- L'articolo è disponibile su arXiv con ID 2608.06398.
- Il tipo di annuncio è 'nuovo'.
- L'approccio mira ad adattare la capacità del modello alla semantica e alla granularità delle patch.
Entità
Istituzioni
- arXiv