SPADE: Decodifica Speculativa per un'Inferenza Efficiente di LLM tra Edge e Cloud
SPADE, un nuovo framework di inferenza distribuita, combina la decodifica speculativa tra dispositivi edge e cloud per migliorare l'efficienza e minimizzare costi e latenza mantenendo l'accuratezza. Impiega un modello draft leggero sui dispositivi edge per produrre rapidamente token candidati, che vengono poi verificati contemporaneamente da un modello più grande nel cloud. Solo i token accettati vengono mantenuti, con i rifiuti che richiedono correzioni da parte del verificatore, riducendo così significativamente le query al cloud. Questo design adattabile sposta la maggior parte dei calcoli verso l'edge, riducendo sia il tempo di inferenza che i costi del cloud, mantenendo l'accuratezza del modello più grande. Questa ricerca, identificata da arXiv 2608.13076, presenta una soluzione pratica alle pesanti esigenze computazionali dei modelli linguistici di grandi dimensioni (LLM), specialmente in ambienti di edge computing con risorse limitate.
Fatti principali
- SPADE è un framework di inferenza distribuita che integra la decodifica speculativa tra edge e cloud.
- Un modello draft compatto sull'edge genera token candidati rapidamente.
- Un grande modello verificatore nel cloud valida i token in parallelo.
- I token accettati vengono mantenuti; solo i rifiuti attivano la correzione da parte del verificatore.
- Il design riduce sostanzialmente il numero di query al cloud.
- Sposta la maggior parte del calcolo verso l'edge, riducendo il tempo di inferenza e il costo del cloud.
- Preserva l'accuratezza del modello più grande.
- L'articolo è disponibile su arXiv con identificatore 2608.13076.
Entità
Istituzioni
- arXiv