ARTFEED — Contemporary Art Intelligence

EntropyMoE: Routing Sparso degli Esperti Basato sull'Entropia per LLM Senza Tokenizer

ai-technology · 2026-08-10

Una recente sottomissione su arXiv (2608.06398) presenta EntropyMoE, un framework innovativo di Mixture-of-Experts (MoE) progettato per modelli di linguaggio di grandi dimensioni (LLM) senza tokenizer che funzionano con patch di byte dinamiche. Questo studio affronta una sfida presente nei modelli a patch di byte attuali, che applicano uniformemente calcoli feed-forward densi su tutte le patch, trascurando di adattare la capacità del modello in base alle variazioni semantiche e di granularità delle patch. EntropyMoE sostituisce i componenti feed-forward densi nel Transformer globale a patch con layer di esperti Top-K, utilizzando ogni patch dinamica per il routing degli esperti. Il processo di routing è informato dall'entropia della patch, lo stesso segnale impiegato nella creazione dinamica delle patch, con entropia e lunghezza della patch che definiscono congiuntamente lo spazio delle caratteristiche di routing. Questo metodo migliora l'efficienza del calcolo sparso, potenzialmente aumentando le prestazioni negli LLM senza tokenizer.

Fatti principali

  • EntropyMoE è un'architettura Mixture-of-Experts (MoE) per LLM senza tokenizer.
  • Opera su patch di byte dinamiche, raggruppando i byte in patch di dimensioni variabili.
  • Sostituisce i moduli feed-forward densi con layer di esperti Top-K.
  • Il routing degli esperti si basa sull'entropia e sulla lunghezza della patch.
  • Il router utilizza lo stesso segnale di granularità della costruzione dinamica delle patch.
  • L'articolo è disponibile su arXiv con ID 2608.06398.
  • Il tipo di annuncio è 'nuovo'.
  • L'approccio mira ad adattare la capacità del modello alla semantica e alla granularità delle patch.

Entità

Istituzioni

  • arXiv

Fonti