SINKFLEX-RL: Sistema RL Modulare per Agenti con Uso Prolungato di Strumenti
Un recente preprint su arXiv (2608.10357) presenta SINKFLEX-RL, un framework modulare progettato per l'apprendimento per rinforzo (RL) in ambienti che richiedono un uso prolungato di strumenti. Questo sistema affronta problemi come i rollout on-policy multi-turno che generano contesti estesi e la necessità di maschere personalizzate e normalizzazione del sink appresa nei livelli di attenzione specifici del modello. SINKFLEX-RL integra un wrapper ambientale compatibile con Gymnasium, un flusso di dati per rollout in stile VERL, l'ottimizzazione della politica relativa al gruppo senza fare affidamento su un modello di valore separato, e un meccanismo FlexAttention consapevole del sink per mantenere il ridimensionamento del sink specifico del modello sia con maschere causali che a finestra scorrevole. In una valutazione iniziale su Tau2Bench retail, la ricompensa di validazione (mean@1) è aumentata da 0.25 all'inizio dell'addestramento a 0.44 successivamente, con miglioramenti anche nei punteggi di addestramento e nelle metriche di ricompensa della traiettoria. Questo sistema è proposto come una soluzione efficace per agenti che devono navigare obiettivi utente, politiche di dominio, uso di strumenti, stati del simulatore e ricompense verificabili ritardate.
Fatti principali
- SINKFLEX-RL è un sistema di addestramento modulare per RL in ambienti con doppio controllo e uso di strumenti.
- Combina un wrapper ambientale compatibile con Gymnasium, un flusso di dati per rollout in stile VERL, ottimizzazione della politica relativa al gruppo e FlexAttention consapevole del sink.
- Il sistema affronta contesti lunghi derivanti da rollout on-policy multi-turno e livelli di attenzione specifici del modello.
- In una esecuzione Tau2Bench retail, la ricompensa di validazione (mean@1) è aumentata da 0.25 a 0.44.
- I punteggi di addestramento e le metriche di ricompensa della traiettoria sono anch'essi aumentati.
- Il sistema è progettato per agenti con uso prolungato di strumenti che ragionano su obiettivi utente, politiche di dominio, chiamate di strumenti, stato del simulatore e ricompense ritardate.
- Il preprint è disponibile su arXiv con ID 2608.10357.
- Il tipo di annuncio è cross.
Entità
Istituzioni
- arXiv