SkillTTA: La sintesi adattiva delle abilità potenzia le prestazioni degli agenti LLM
Un nuovo approccio chiamato SkillTTA affronta il problema di trasformare il calcolo extra durante il test in capacità migliorate per gli agenti LLM. Invece di limitarsi ad aumentare il contesto o incorporare rollout, SkillTTA si concentra sul recupero di traiettorie di addestramento pertinenti al compito e crea un'abilità temporanea basata sul contesto target osservabile, utilizzando un risolutore con parametri fissi. Per migliorare ulteriormente le prestazioni, incorpora l'ottimizzazione dei meta-prompt (MPO) per affinare la politica responsabile della generazione di queste abilità. MPO valuta i prompt candidati su compiti accoppiati, dà priorità alle transizioni informative e limita gli aggiornamenti a slot atomici specifici del benchmark, riducendo la varianza derivante da osservazioni indirette. SkillTTA supera i metodi di riutilizzo leader su benchmark come ALFWorld, SpreadsheetBench, BigCodeBench e WebShop.
Fatti principali
- SkillTTA recupera traiettorie di addestramento pertinenti al compito e sintetizza abilità temporanee.
- L'ottimizzazione dei meta-prompt (MPO) adatta la politica per scrivere abilità.
- MPO valuta i prompt candidati su compiti accoppiati e enfatizza le transizioni informative.
- Gli aggiornamenti sono confinati a slot atomici specifici del benchmark per ridurre la varianza.
- SkillTTA supera i metodi di riutilizzo all'avanguardia su ALFWorld, SpreadsheetBench, BigCodeBench e WebShop.
- Il metodo affronta la conversione del calcolo in capacità durante il test.
- Il risolutore utilizza parametri fissi.
- L'approccio non si basa sull'espansione del contesto o sull'aggiunta di rollout.
Entità
—