HeraSys ottimizza i flussi di lavoro LLM concorrenti tramite orchestrazione a grana fine
Una recente pubblicazione su arXiv (2607.22578) presenta HeraSys, un sistema per il serving di modelli linguistici di grandi dimensioni (LLM) che mira a migliorare le prestazioni complessive dei flussi di lavoro concorrenti multi-tenant. A differenza delle soluzioni attuali che si concentrano principalmente sull'ottimizzazione all'interno di un singolo flusso di lavoro, HeraSys enfatizza l'ottimizzazione tra flussi di lavoro riducendo la ridondanza computazionale attraverso l'unione e il riutilizzo di nodi strutturali. Incorpora una politica di scheduling congiunta sensibile al carico, che regola dinamicamente la sequenza di esecuzione in base alle priorità inter e intra-query. Inoltre, HeraSys impiega un meccanismo di sbilanciamento delle risorse insieme a batching adattivo e scomposizione della pipeline per ridurre la latenza di coda garantendo al contempo una bassa latenza media. Questo sistema segna un passaggio dalla gestione di richieste isolate alla gestione di flussi di lavoro ad alta concorrenza nel serving LLM.
Fatti principali
- HeraSys è un sistema di serving LLM per flussi di lavoro concorrenti.
- Elimina la ridondanza computazionale tra flussi di lavoro tramite unione e riutilizzo di nodi strutturali.
- Introduce una politica di scheduling congiunta sensibile al carico.
- Utilizza sbilanciamento delle risorse, batching adattivo e scomposizione della pipeline.
- Mitiga la latenza di coda mantenendo una bassa latenza media.
- L'articolo è su arXiv con ID 2607.22578.
- Affronta l'ottimizzazione inter-flusso di lavoro, non solo intra-flusso.
- Il sistema è mirato a flussi di lavoro agentici multi-tenant ad alta concorrenza.
Entità
Istituzioni
- arXiv