L'assegnazione del credito sensibile al feedback migliora l'addestramento di agenti multi-turno
Un nuovo articolo disponibile su arXiv con identificativo 2608.17499 presenta un approccio innovativo chiamato Feedback-Aware Credit Assignment (FACA), progettato per migliorare l'addestramento di agenti multi-turno. FACA utilizza il turno successivo dell'utente come fonte di evidenza rumorosa e temporalmente locale riguardante l'interazione precedente utente-utente. A differenza dell'apprendimento per rinforzo interattivo tradizionale, che si basa su una singola ricompensa terminale per ogni rollout, FACA integra un vantaggio di reazione normalizzato localmente con un vantaggio di esito terminale validato. I risultati sperimentali hanno mostrato che FACA ha migliorato la media della famiglia τ su nove domini di 5,91 e 10,22 punti percentuali in tre diverse sessioni di addestramento, rispetto a un controllo baseline Interactive GRPO.
Fatti principali
- L'articolo è disponibile su arXiv con identificativo 2608.17499.
- L'articolo introduce un metodo chiamato Feedback-Aware Credit Assignment (FACA).
- FACA sfrutta il turno successivo dell'utente come evidenza rumorosa e temporalmente locale riguardante il segmento utente-utente precedente.
- L'apprendimento per rinforzo interattivo standard utilizza tipicamente una singola ricompensa terminale per ogni rollout.
- FACA combina un vantaggio di reazione normalizzato localmente con un vantaggio di esito terminale verificato.
- FACA non richiede un critico o un rollout aggiuntivo.
- Negli esperimenti, FACA ha migliorato la media della famiglia τ su nove domini di 5,91 e 10,22 punti percentuali in tre run di addestramento indipendenti.
- Il baseline utilizzato era un controllo Interactive GRPO basato solo sull'esito, abbinato per simulatore, dialogo visibile, inizializzazione, rollout e ottimizzazione.
Entità
—