Agenti Auto-Speculanti: RL Congiunto Agente-Speculatore per Chiamate a Strumenti più Veloci
Un nuovo metodo di apprendimento per rinforzo addestra un singolo grande modello linguistico sia a risolvere compiti sia a prevedere la propria prossima chiamata a uno strumento, riducendo la latenza pre-eseguendo le chiamate quando le previsioni corrispondono. L'approccio, chiamato RL congiunto agente-speculatore, unifica agente e speculatore nello stesso modello, riutilizzando la cache KV del prefisso. Affronta il divario speculatore-agente, dove modelli di bozza separati o tracce memorizzate sono scarsamente allineati con il comportamento dell'agente distribuito. L'agente target stesso è identificato come un forte speculatore della prossima chiamata, portando a un design più semplice.
Fatti principali
- L'articolo arXiv 2607.25816 introduce gli agenti auto-speculanti
- Il metodo di apprendimento per rinforzo congiunto agente-speculatore unifica agente e speculatore in un unico modello
- La speculazione sulle chiamate a strumenti prevede e pre-esegue la prossima chiamata a strumento dell'agente
- Gli speculatori esistenti sono modelli di bozza separati o tracce memorizzate
- L'agente target stesso è un forte speculatore della prossima chiamata
- La cache KV del prefisso è completamente riutilizzata nel modello a doppia modalità
- Il metodo mira a ridurre il tempo di attesa per i risultati delle chiamate a strumenti
- Il divario speculatore-agente è identificato come un problema chiave
Entità
Istituzioni
- arXiv