S2-MoE: Decodifica Auto-Speculativa Efficiente per MoE su Dispositivi Edge
Un nuovo approccio chiamato S2-MoE è stato presentato in un articolo arXiv (2608.15018) per migliorare l'efficienza dell'inferenza di modelli linguistici di grandi dimensioni (LLM) su dispositivi edge. Questa tecnica integra la decodifica auto-speculativa con un framework Mixture-of-Experts (MoE), affrontando problemi legati a limiti di memoria e larghezza di banda. Utilizzando l'espansione speculativa adattiva consapevole del routing, S2-MoE minimizza l'overhead di verifica, mentre il gating esperto consapevole del riutilizzo migliora l'efficienza della verifica. Inoltre, sincronizza l'esecuzione di bozza e target attraverso un contesto condiviso. Quando implementato in llama.cpp, questo metodo dimostra un aumento di velocità fino a 5,3 volte (circa 2,0 volte in media) rispetto alla decodifica autoregressiva standard su vari modelli MoE e dataset su dispositivi edge. Il codice è disponibile su GitHub.
Fatti principali
- S2-MoE è un framework di decodifica auto-speculativa per l'inferenza MoE su dispositivi edge.
- Riduce la verifica ridondante attraverso l'espansione speculativa adattiva consapevole del routing.
- Migliora l'efficienza della verifica con il gating esperto consapevole del riutilizzo.
- Allinea l'esecuzione di bozza e target tramite un contesto condiviso.
- Implementato in llama.cpp.
- Raggiunge un'accelerazione fino a 5,3 volte (circa 2,0 volte in media) rispetto alla decodifica autoregressiva standard.
- Testato su diversi modelli MoE e dataset su dispositivi edge.
- Codice disponibile su https://github.com/angerybob/
Entità
Istituzioni
- arXiv
- llama.cpp