BALANCE: Inferenza LLM Ibrida Autoregressiva-Speculativa in Reti Edge Wireless
È stato proposto un nuovo framework chiamato BALANCE per ottimizzare l'inferenza dei modelli linguistici di grandi dimensioni (LLM) nelle reti edge wireless, affrontando il compromesso latenza-memoria tra decodifica autoregressiva (AD) e decodifica speculativa (SD). Il framework, descritto in un articolo su arXiv (2608.05926), consente a un server edge di ospitare sia un modello linguistico di piccole dimensioni (SLM) che un LLM, assegnando ogni utente a AD o SD e facendo funzionare entrambe le modalità simultaneamente. L'obiettivo è massimizzare il numero di utenti serviti formulando un problema di massimizzazione del throughput delle attività. Questa ricerca è rilevante per le reti mobili di prossima generazione, dove l'inferenza edge è vista come un paradigma promettente per fornire servizi LLM. L'articolo è stato annunciato come una sottomissione cross-type su arXiv.
Fatti principali
- BALANCE è un framework di inferenza ibrido autoregressivo-speculativo per l'inferenza LLM edge.
- Affronta il compromesso latenza-memoria tra decodifica autoregressiva (AD) e decodifica speculativa (SD).
- Il server edge ospita sia un modello linguistico di piccole dimensioni (SLM) che un modello linguistico di grandi dimensioni (LLM).
- Ogni utente è assegnato a AD o SD, e entrambe le modalità funzionano simultaneamente.
- Il framework mira a massimizzare il numero di utenti serviti.
- Viene formulato un problema di massimizzazione del throughput delle attività.
- L'articolo è disponibile su arXiv con ID 2608.05926.
- La ricerca è rivolta alle reti mobili di prossima generazione.
Entità
Istituzioni
- arXiv