ARTFEED — Contemporary Art Intelligence

LLMVisor: Attribuzione della Latenza in Tempo Reale per il Servizio LLM Multi-Tenant

ai-technology · 2026-08-11

I ricercatori hanno introdotto un nuovo modello chiamato LLMVisor per analizzare la latenza in tempo reale in ambienti multi-tenant che utilizzano modelli linguistici di grandi dimensioni (LLM). Poiché gli LLM iniziano a essere eseguiti su cluster GPU condivisi, la pratica del co-batching aumenta la produttività ma rende difficile monitorare l'utilizzo dei singoli tenant. LLMVisor affronta questa sfida utilizzando un approccio guidato da roofline che scompone le fasi di memoria e calcolo in un formato lineare a tratti chiaro basato su FLOPs e I/O di memoria. Esso decompone efficacemente la latenza del batch in quote di richieste individuali e opera a livello di microsecondi, rendendolo ideale per la pianificazione in tempo reale. I test sono stati effettuati con Llama 3.1-8B e Qwen 2.5-14B/32B su GPU A100/H100, mostrando miglioramenti significativi. Il documento di ricerca è disponibile su arXiv con l'identificatore 2608.08382.

Fatti principali

  • LLMVisor è un modello di attribuzione della latenza in tempo reale per il servizio LLM multi-tenant.
  • Utilizza un approccio guidato da roofline per catturare le fasi limitate dalla memoria e dal calcolo.
  • Il modello decompone la latenza del batch in quote additive per richiesta.
  • Funziona a scala di microsecondi, adatto per cicli di pianificazione.
  • Valutato su modelli Llama 3.1-8B, Qwen 2.5-14B e Qwen 2.5-32B.
  • Testato su GPU A100 e H100 con diverso parallelismo tensoriale.
  • Rispetto alla baseline basata sul conteggio dei token, riduce l'errore relativo fino a 2,5 volte a p90 e 3,3 volte a p99 per il prefill.
  • Raggiunge un R-quadro quasi perfetto nella previsione della latenza.

Entità

Istituzioni

  • arXiv

Fonti