ARTFEED — Contemporary Art Intelligence

Agenti Auto-Speculanti: RL Congiunto Agente-Speculatore per Chiamate a Strumenti più Veloci

ai-technology · 2026-07-29

Un nuovo metodo di apprendimento per rinforzo addestra un singolo grande modello linguistico sia a risolvere compiti sia a prevedere la propria prossima chiamata a uno strumento, riducendo la latenza pre-eseguendo le chiamate quando le previsioni corrispondono. L'approccio, chiamato RL congiunto agente-speculatore, unifica agente e speculatore nello stesso modello, riutilizzando la cache KV del prefisso. Affronta il divario speculatore-agente, dove modelli di bozza separati o tracce memorizzate sono scarsamente allineati con il comportamento dell'agente distribuito. L'agente target stesso è identificato come un forte speculatore della prossima chiamata, portando a un design più semplice.

Fatti principali

  • L'articolo arXiv 2607.25816 introduce gli agenti auto-speculanti
  • Il metodo di apprendimento per rinforzo congiunto agente-speculatore unifica agente e speculatore in un unico modello
  • La speculazione sulle chiamate a strumenti prevede e pre-esegue la prossima chiamata a strumento dell'agente
  • Gli speculatori esistenti sono modelli di bozza separati o tracce memorizzate
  • L'agente target stesso è un forte speculatore della prossima chiamata
  • La cache KV del prefisso è completamente riutilizzata nel modello a doppia modalità
  • Il metodo mira a ridurre il tempo di attesa per i risultati delle chiamate a strumenti
  • Il divario speculatore-agente è identificato come un problema chiave

Entità

Istituzioni

  • arXiv

Fonti