LLMVisor: Attribuzione della Latenza in Tempo Reale per il Servizio LLM Multi-Tenant
I ricercatori hanno introdotto un nuovo modello chiamato LLMVisor per analizzare la latenza in tempo reale in ambienti multi-tenant che utilizzano modelli linguistici di grandi dimensioni (LLM). Poiché gli LLM iniziano a essere eseguiti su cluster GPU condivisi, la pratica del co-batching aumenta la produttività ma rende difficile monitorare l'utilizzo dei singoli tenant. LLMVisor affronta questa sfida utilizzando un approccio guidato da roofline che scompone le fasi di memoria e calcolo in un formato lineare a tratti chiaro basato su FLOPs e I/O di memoria. Esso decompone efficacemente la latenza del batch in quote di richieste individuali e opera a livello di microsecondi, rendendolo ideale per la pianificazione in tempo reale. I test sono stati effettuati con Llama 3.1-8B e Qwen 2.5-14B/32B su GPU A100/H100, mostrando miglioramenti significativi. Il documento di ricerca è disponibile su arXiv con l'identificatore 2608.08382.
Fatti principali
- LLMVisor è un modello di attribuzione della latenza in tempo reale per il servizio LLM multi-tenant.
- Utilizza un approccio guidato da roofline per catturare le fasi limitate dalla memoria e dal calcolo.
- Il modello decompone la latenza del batch in quote additive per richiesta.
- Funziona a scala di microsecondi, adatto per cicli di pianificazione.
- Valutato su modelli Llama 3.1-8B, Qwen 2.5-14B e Qwen 2.5-32B.
- Testato su GPU A100 e H100 con diverso parallelismo tensoriale.
- Rispetto alla baseline basata sul conteggio dei token, riduce l'errore relativo fino a 2,5 volte a p90 e 3,3 volte a p99 per il prefill.
- Raggiunge un R-quadro quasi perfetto nella previsione della latenza.
Entità
Istituzioni
- arXiv