CacheScout: Gestione della KV-Cache Basata sull'Apprendimento per il Servizio LLM Multi-Agente
Un recente articolo di ricerca presenta CacheScout, un livello runtime volto a migliorare la gestione della KV-cache nei framework di servizio LLM multi-agente. Questo studio, pubblicato su arXiv (2608.14624), affronta le carenze dei sistemi attuali che gestiscono la KV-cache in modo reattivo, basandosi sulla cache dei prefissi e sull'eliminazione basata sulla recency. Nei processi LLM multi-agente, le richieste degli utenti vengono suddivise in una serie di agenti specializzati, ciascuno dei quali esegue un contesto coerente (inclusi prompt di sistema, definizioni di strumenti ed esempi few-shot), il che apre opportunità per il riutilizzo della KV-cache. Tuttavia, i sistemi esistenti spesso rimuovono prematuramente contesti riutilizzabili, causando ricalcoli non necessari. La scoperta principale di CacheScout è che il potenziale di riutilizzo futuro della cache è determinato dalla semantica dell'esecuzione degli agenti, non solo dalla recency della cache. Impara queste transizioni di esecuzione in tempo reale, eliminando la necessità di grafi di flusso di lavoro predefiniti o di addestramento offline.
Fatti principali
- arXiv:2608.14624v1
- Tipo di annuncio: nuovo
- I sistemi LLM multi-agente sono un importante paradigma di implementazione per i servizi AI
- Ogni richiesta utente viene scomposta in una sequenza di agenti specializzati
- Ogni agente esegue ripetutamente un contesto fisso: prompt di sistema, definizioni di strumenti, esempi few-shot
- I sistemi di servizio LLM esistenti gestiscono la KV-cache in modo reattivo utilizzando la cache dei prefissi e la sostituzione basata sulla recency
- I contesti degli agenti riutilizzabili vengono spesso eliminati prima della loro successiva invocazione, forzando ripetuti ricalcoli
- CacheScout è un livello runtime della KV-cache consapevole degli agenti per il servizio LLM multi-agente
- CacheScout apprende le transizioni di esecuzione degli agenti online, senza grafi di flusso di lavoro predefiniti o addestramento offline
Entità
Istituzioni
- arXiv