Il framework TSDS ottimizza gli agenti LLM edge con il rinvio
Un nuovo framework chiamato Think Short, Defer Smart (TSDS) consente agli agenti LLM basati su dispositivi edge di gestire i budget di ragionamento, rinviando le azioni incerte a modelli cloud. TSDS integra una sonda di convergenza leggera che interrompe il ragionamento on-device una volta che un'azione si stabilizza, e una regola di rinvio basata sulla perplessità per l'escalation. Entrambi i meccanismi sono calibrati tramite una procedura multi-obiettivo Learn-Then-Test (LTT), che fornisce garanzie su campioni finiti riguardo la ricompensa attesa per episodio e il tasso di chiamate al cloud. Il framework è stato valutato su quattro benchmark ReAct che coprono aritmetica, QA multi-hop, generazione di codice e controllo fisico AI. Il paper è disponibile su arXiv con ID 2607.26865.
Fatti principali
- TSDS sta per Think Short, Defer Smart.
- Il framework è progettato per agenti LLM edge che seguono il paradigma ReAct.
- Utilizza una sonda di convergenza per interrompere il ragionamento on-device quando un'azione si stabilizza.
- Una regola di rinvio basata sulla perplessità scala le azioni incerte a un modello cloud.
- La calibrazione avviene tramite una procedura multi-obiettivo Learn-Then-Test (LTT).
- Fornisce garanzie su campioni finiti riguardo la ricompensa attesa per episodio e il tasso di chiamate al cloud.
- Valutato su quattro benchmark ReAct tra cui aritmetica e QA multi-hop.
- Paper disponibile su arXiv con ID 2607.26865.
Entità
Istituzioni
- arXiv