SpecBox: Preallocazione Speculativa di Sandbox per un Servizio Efficiente di Agenti LLM
SpecBox, un sistema runtime di nuova concezione, affronta la sfida di bilanciare l'utilizzo delle risorse con la latenza interattiva di coda nel servizio di agenti LLM, specialmente quando gli agenti utilizzano il Model Context Protocol (MCP) per chiamare sandbox esterne isolate. Questo sistema, descritto in un articolo arXiv (2607.23933v2), implementa la preallocazione speculativa di sandbox per ridurre gli oneri associati alle prenotazioni di sandbox a lungo termine e i ritardi causati dalle configurazioni lazy on-demand. Impiegando il matching di parole chiave e l'embedding semantico in streaming, SpecBox facilita il pre-riscaldamento delle sandbox basato sull'intento, che anticipa le esigenze di esecuzione degli strumenti durante la generazione di token LLM e sincronizza l'inizializzazione delle sandbox con l'inferenza del modello. Questa strategia mira a migliorare le prestazioni per attività multi-tenant e multi-turno degli agenti. L'articolo, classificato come tipo replace-cross, è accessibile all'indirizzo https://arxiv.org/abs/2607.23933.
Fatti principali
- SpecBox è un runtime per la preallocazione speculativa di sandbox nel servizio di agenti LLM.
- Affronta il compromesso tra utilizzo delle risorse e latenza interattiva di coda.
- Utilizza il matching di parole chiave e l'embedding semantico in streaming per il pre-riscaldamento delle sandbox basato sull'intento.
- Sovrappone il bootstrap delle sandbox con l'inferenza del modello.
- È progettato per carichi di lavoro multi-tenant e multi-turno degli agenti.
- L'articolo è disponibile su arXiv con ID 2607.23933.
- Il tipo di articolo è replace-cross.
- Il sistema è progettato per agenti LLM che utilizzano il Model Context Protocol (MCP).
Entità
Istituzioni
- arXiv