LongRCA Bench: Nuovo Benchmark per Diagnosticare i Fallimenti degli Agenti a Lungo Orizzonte
Un nuovo benchmark chiamato LongRCA Bench è stato sviluppato da ricercatori per identificare i fallimenti nelle esecuzioni di agenti a lungo orizzonte. Include 1.140 traiettorie fallite in cinque domini distinti, prive di errori iniettati, e offre etichette umane valutate in modo indipendente che indicano il ruolo responsabile e il primo passo critico della causa principale. La traiettoria mediana consiste in 145 passi, con la migliore baseline che raggiunge solo il 13,2% di accuratezza nell'individuare esattamente il passo della causa principale, sottolineando la difficoltà di questo compito. Inoltre, l'articolo introduce Root-Cause Trajectory Attribution (RCTA), un metodo che opera senza addestramento, che identifica i passi di errore potenziali dai riepiloghi dei segmenti e li collega a passaggi precedenti. Questa ricerca affronta il problema meno esplorato dell'attribuzione dei fallimenti negli agenti a lungo orizzonte, dove le valutazioni tradizionali a livello di risultato non riescono a tracciare la fonte degli errori. Il benchmark è accessibile su arXiv (arXiv:2608.15242).
Fatti principali
- LongRCA Bench comprende 1.140 traiettorie fallite in cinque domini.
- Non sono presenti errori iniettati nel benchmark.
- Sono fornite etichette umane per il ruolo responsabile e il primo passo decisivo della causa principale.
- La lunghezza mediana della traiettoria è di 145 passi.
- La baseline più forte raggiunge solo il 13,2% di accuratezza esatta sul passo della causa principale.
- RCTA è un metodo senza addestramento per l'attribuzione della causa principale.
- RCTA recupera i passi di errore candidati dai riepiloghi dei segmenti e li traccia fino ai passaggi precedenti.
- L'articolo è disponibile su arXiv con ID 2608.15242.
Entità
Istituzioni
- arXiv