ARTFEED — Contemporary Art Intelligence

BALANCE: Inferenza LLM Ibrida Autoregressiva-Speculativa in Reti Edge Wireless

ai-technology · 2026-08-07

È stato proposto un nuovo framework chiamato BALANCE per ottimizzare l'inferenza dei modelli linguistici di grandi dimensioni (LLM) nelle reti edge wireless, affrontando il compromesso latenza-memoria tra decodifica autoregressiva (AD) e decodifica speculativa (SD). Il framework, descritto in un articolo su arXiv (2608.05926), consente a un server edge di ospitare sia un modello linguistico di piccole dimensioni (SLM) che un LLM, assegnando ogni utente a AD o SD e facendo funzionare entrambe le modalità simultaneamente. L'obiettivo è massimizzare il numero di utenti serviti formulando un problema di massimizzazione del throughput delle attività. Questa ricerca è rilevante per le reti mobili di prossima generazione, dove l'inferenza edge è vista come un paradigma promettente per fornire servizi LLM. L'articolo è stato annunciato come una sottomissione cross-type su arXiv.

Fatti principali

  • BALANCE è un framework di inferenza ibrido autoregressivo-speculativo per l'inferenza LLM edge.
  • Affronta il compromesso latenza-memoria tra decodifica autoregressiva (AD) e decodifica speculativa (SD).
  • Il server edge ospita sia un modello linguistico di piccole dimensioni (SLM) che un modello linguistico di grandi dimensioni (LLM).
  • Ogni utente è assegnato a AD o SD, e entrambe le modalità funzionano simultaneamente.
  • Il framework mira a massimizzare il numero di utenti serviti.
  • Viene formulato un problema di massimizzazione del throughput delle attività.
  • L'articolo è disponibile su arXiv con ID 2608.05926.
  • La ricerca è rivolta alle reti mobili di prossima generazione.

Entità

Istituzioni

  • arXiv

Fonti