Astrolabe: Scheduler basato su previsioni randomizzate per il servizio di LLM
C'è un nuovo studio su arXiv (2508.03611) che introduce Astrolabe, uno scheduler intelligente che utilizza previsioni randomizzate per la gestione delle richieste una tantum in servizi di modelli linguistici di grandi dimensioni (LLM) multi-istanza. Questo scheduler migliora la distribuzione del carico senza i problemi associati al ribilanciamento basato sulla migrazione, che può causare overhead aggiuntivo e congestione di rete a causa dei trasferimenti di cache KV quando la domanda raggiunge il picco. Astrolabe utilizza previsioni sulla lunghezza delle risposte, simula la latenza per ciascuna istanza e segue un metodo di scelta tra due opzioni per l'invio delle richieste, prevenendo efficacemente l'accumulo di richieste. I test con la configurazione Llama-2-7B/ShareGPT mostrano che Astrolabe eguaglia la capacità SLO del sistema leader basato sul carico (31.6 vs. 31.5 QPS), accelerando anche il tempo al primo token dell'8-36% e aumentando la capacità SLO fino al 20% durante i cambi di configurazione.
Fatti principali
- Astrolabe è uno scheduler basato su previsioni randomizzate per il servizio di LLM.
- È progettato per l'invio di richieste una tantum in servizi LLM multi-istanza.
- Evita il ribilanciamento basato sulla migrazione per ridurre l'overhead di trasferimento della cache KV.
- Utilizza la stima della lunghezza delle risposte, la previsione della latenza basata su simulazione e l'invio con scelta tra due opzioni.
- Su Llama-2-7B/ShareGPT, eguaglia la capacità SLO del miglior baseline (31.6 vs 31.5 QPS).
- Riduce il TTFT medio dell'8-36%, il TTFT P99 del 16-77% e la latenza E2E media fino al 5.6%.
- Riduce le prelazioni di circa sei volte una volta raggiunta la capacità.
- Sotto cambi di configurazione, migliora la capacità SLO fino al 20%.
- L'articolo è disponibile su arXiv con ID 2508.03611.
Entità
Istituzioni
- arXiv