ARTFEED — Contemporary Art Intelligence

LongRCA Bench: Nuovo Benchmark per Diagnosticare i Fallimenti degli Agenti a Lungo Orizzonte

ai-technology · 2026-08-18

Un nuovo benchmark chiamato LongRCA Bench è stato sviluppato da ricercatori per identificare i fallimenti nelle esecuzioni di agenti a lungo orizzonte. Include 1.140 traiettorie fallite in cinque domini distinti, prive di errori iniettati, e offre etichette umane valutate in modo indipendente che indicano il ruolo responsabile e il primo passo critico della causa principale. La traiettoria mediana consiste in 145 passi, con la migliore baseline che raggiunge solo il 13,2% di accuratezza nell'individuare esattamente il passo della causa principale, sottolineando la difficoltà di questo compito. Inoltre, l'articolo introduce Root-Cause Trajectory Attribution (RCTA), un metodo che opera senza addestramento, che identifica i passi di errore potenziali dai riepiloghi dei segmenti e li collega a passaggi precedenti. Questa ricerca affronta il problema meno esplorato dell'attribuzione dei fallimenti negli agenti a lungo orizzonte, dove le valutazioni tradizionali a livello di risultato non riescono a tracciare la fonte degli errori. Il benchmark è accessibile su arXiv (arXiv:2608.15242).

Fatti principali

  • LongRCA Bench comprende 1.140 traiettorie fallite in cinque domini.
  • Non sono presenti errori iniettati nel benchmark.
  • Sono fornite etichette umane per il ruolo responsabile e il primo passo decisivo della causa principale.
  • La lunghezza mediana della traiettoria è di 145 passi.
  • La baseline più forte raggiunge solo il 13,2% di accuratezza esatta sul passo della causa principale.
  • RCTA è un metodo senza addestramento per l'attribuzione della causa principale.
  • RCTA recupera i passi di errore candidati dai riepiloghi dei segmenti e li traccia fino ai passaggi precedenti.
  • L'articolo è disponibile su arXiv con ID 2608.15242.

Entità

Istituzioni

  • arXiv

Fonti