ARTFEED — Contemporary Art Intelligence

CrEST: Assegnazione Gerarchica del Credito per Agenti LLM Multi-Turno

ai-technology · 2026-08-15

L'introduzione di un nuovo framework chiamato CrEST mira a migliorare l'assegnazione del credito nell'apprendimento per rinforzo con ricompense verificabili (RLVR) per addestrare agenti che utilizzano strumenti su più turni. Questo approccio affronta gli svantaggi dell'assegnazione del credito a livello di traiettoria, che fonde risultati diversi di ogni turno in un unico segnale di ricompensa, così come i problemi con la distillazione on-policy, che è limitata dai vincoli dell'insegnante o suscettibile al collasso della concentrazione del gradiente. CrEST mantiene il tetto limitato dal verificatore del RL mentre integra segnali densi a livello di token da un auto-insegnante. Affronta l'assegnazione del credito su due fronti: i vantaggi verificati segmentati per turno mitigano la diluizione inter-turno, e la modulazione con gate di entropia dall'auto-insegnante migliora i contributi dei token intra-turno. Gli esperimenti condotti su BFCL V3 e WildToolBench dimostrano che CrEST supera costantemente i baselines di RL e distillazione su due scale di modello. L'articolo è accessibile su arXiv (2608.13179).

Fatti principali

  • CrEST è un framework di assegnazione gerarchica del credito per agenti LLM multi-turno e multi-step.
  • Combina il tetto limitato dal verificatore di RLVR con segnali densi a livello di token da un auto-insegnante.
  • Utilizza vantaggi verificati segmentati per turno e modulazione con gate di entropia dell'auto-insegnante.
  • Gli esperimenti sono stati condotti su BFCL V3 e WildToolBench.
  • CrEST supera i baselines di RL e distillazione su due scale di modello.
  • L'articolo è disponibile su arXiv con ID 2608.13179.
  • Il metodo affronta la diluizione inter-turno e i contributi dei token intra-turno.
  • Evita il collasso della concentrazione del gradiente osservato nella distillazione on-policy.

Entità

Istituzioni

  • arXiv

Fonti