CrEST: Assegnazione Gerarchica del Credito per Agenti LLM Multi-Turno
L'introduzione di un nuovo framework chiamato CrEST mira a migliorare l'assegnazione del credito nell'apprendimento per rinforzo con ricompense verificabili (RLVR) per addestrare agenti che utilizzano strumenti su più turni. Questo approccio affronta gli svantaggi dell'assegnazione del credito a livello di traiettoria, che fonde risultati diversi di ogni turno in un unico segnale di ricompensa, così come i problemi con la distillazione on-policy, che è limitata dai vincoli dell'insegnante o suscettibile al collasso della concentrazione del gradiente. CrEST mantiene il tetto limitato dal verificatore del RL mentre integra segnali densi a livello di token da un auto-insegnante. Affronta l'assegnazione del credito su due fronti: i vantaggi verificati segmentati per turno mitigano la diluizione inter-turno, e la modulazione con gate di entropia dall'auto-insegnante migliora i contributi dei token intra-turno. Gli esperimenti condotti su BFCL V3 e WildToolBench dimostrano che CrEST supera costantemente i baselines di RL e distillazione su due scale di modello. L'articolo è accessibile su arXiv (2608.13179).
Fatti principali
- CrEST è un framework di assegnazione gerarchica del credito per agenti LLM multi-turno e multi-step.
- Combina il tetto limitato dal verificatore di RLVR con segnali densi a livello di token da un auto-insegnante.
- Utilizza vantaggi verificati segmentati per turno e modulazione con gate di entropia dell'auto-insegnante.
- Gli esperimenti sono stati condotti su BFCL V3 e WildToolBench.
- CrEST supera i baselines di RL e distillazione su due scale di modello.
- L'articolo è disponibile su arXiv con ID 2608.13179.
- Il metodo affronta la diluizione inter-turno e i contributi dei token intra-turno.
- Evita il collasso della concentrazione del gradiente osservato nella distillazione on-policy.
Entità
Istituzioni
- arXiv