ARTFEED — Contemporary Art Intelligence

S2-MoE: Decodifica Auto-Speculativa Efficiente per MoE su Dispositivi Edge

ai-technology · 2026-08-18

Un nuovo approccio chiamato S2-MoE è stato presentato in un articolo arXiv (2608.15018) per migliorare l'efficienza dell'inferenza di modelli linguistici di grandi dimensioni (LLM) su dispositivi edge. Questa tecnica integra la decodifica auto-speculativa con un framework Mixture-of-Experts (MoE), affrontando problemi legati a limiti di memoria e larghezza di banda. Utilizzando l'espansione speculativa adattiva consapevole del routing, S2-MoE minimizza l'overhead di verifica, mentre il gating esperto consapevole del riutilizzo migliora l'efficienza della verifica. Inoltre, sincronizza l'esecuzione di bozza e target attraverso un contesto condiviso. Quando implementato in llama.cpp, questo metodo dimostra un aumento di velocità fino a 5,3 volte (circa 2,0 volte in media) rispetto alla decodifica autoregressiva standard su vari modelli MoE e dataset su dispositivi edge. Il codice è disponibile su GitHub.

Fatti principali

  • S2-MoE è un framework di decodifica auto-speculativa per l'inferenza MoE su dispositivi edge.
  • Riduce la verifica ridondante attraverso l'espansione speculativa adattiva consapevole del routing.
  • Migliora l'efficienza della verifica con il gating esperto consapevole del riutilizzo.
  • Allinea l'esecuzione di bozza e target tramite un contesto condiviso.
  • Implementato in llama.cpp.
  • Raggiunge un'accelerazione fino a 5,3 volte (circa 2,0 volte in media) rispetto alla decodifica autoregressiva standard.
  • Testato su diversi modelli MoE e dataset su dispositivi edge.
  • Codice disponibile su https://github.com/angerybob/

Entità

Istituzioni

  • arXiv
  • llama.cpp

Fonti