Framework di Previsione della Latenza per il Deployment di LLM su Dispositivi Edge
Un nuovo framework è stato introdotto in arXiv:2607.21602, volto a prevedere la latenza di inferenza per modelli linguistici di grandi dimensioni su vari dispositivi edge. Questa metodologia enfatizza le complessità di ogni richiesta di inferenza, incorporando specifiche hardware, varianti del modello e prompt, distinguendo le fasi di prefill e decode. Combina parametri statici con dati hardware in tempo reale tramite un modello di previsione gated. Le considerazioni chiave includono l'architettura del modello, le caratteristiche del prompt, l'efficienza del runtime backend e le impostazioni di temperatura. I test sono stati eseguiti su dispositivi come Pixel, Jetson Nano, Orange Pi 5 Pro e RTX 3090, mostrando notevoli miglioramenti nell'accuratezza della previsione della latenza per il Pixel 8.
Fatti principali
- arXiv:2607.21602 introduce un framework di previsione della latenza sensibile al runtime per LLM su dispositivi edge.
- Il framework rappresenta le richieste di inferenza come configurazioni hardware-runtime-modello-prompt.
- L'inferenza è separata in fasi di prefill e decode.
- Un modello di previsione gated fonde adattivamente descrittori statici con telemetria hardware dinamica.
- I fattori che influenzano la latenza includono architettura del modello, comportamento del prompt, runtime backend, utilizzo hardware, DVFS e variazioni termiche.
- La valutazione ha utilizzato dispositivi mobili Pixel, Jetson Nano, Orange Pi 5 Pro e GPU classe RTX 3090.
- Sul Pixel 8, l'R-quadro della latenza totale è migliorato da 0,953 a 0,960.
- L'R-quadro della latenza di decode sul Pixel 8 è migliorato da 0,957 a 0,973.
Entità
—