SearchAuditor: Nuovo framework per auditare e riparare i guasti negli agenti di ricerca a lungo orizzonte
Un nuovo studio ha introdotto SearchAuditBench, uno strumento creato per valutare quanto bene gli auditor basati su modelli linguistici di grandi dimensioni possano individuare, attribuire e correggere errori negli agenti di ricerca a lungo orizzonte. Questo benchmark consiste in 1.243 tentativi falliti, con una media di 73,1 messaggi e 65,1K token, tratti da otto modelli open-weight su cinque benchmark di deep search. Esperti hanno annotato accuratamente ogni tentativo, segnando il passo critico dell'errore, la sua causa legata alla ricerca e una possibile correzione, insieme a criteri di valutazione. Lo studio presenta anche SearchAuditor, un framework completo che identifica efficientemente questi guasti, eliminando la necessità di controlli manuali di lunghi log di esecuzione. Rivela che anche piccoli errori di ragionamento negli agenti di deep search possono portare a risposte apparentemente fluenti ma errate. La ricerca è disponibile su arXiv con ID 2608.05212.
Fatti principali
- SearchAuditBench include 1.243 traiettorie fallite.
- Le traiettorie hanno in media 73,1 messaggi e 65,1K token.
- I dati sono stati raccolti da otto modelli open-weight su cinque benchmark di deep search.
- Ogni traiettoria è annotata da esperti con il passo critico dell'errore, la causa principale e la riparazione di riferimento.
- SearchAuditor è un framework di auditing multi-prospettiva.
- L'articolo è disponibile su arXiv (2608.05212).
- La ricerca mira a ridurre il carico umano nella diagnosi dei guasti degli agenti di ricerca.
- Gli agenti di ricerca a lungo orizzonte sono complessi e fragili.
Entità
Istituzioni
- arXiv