AGENTCHAOSBENCH: Benchmark per il Rilevamento di Guasti in Esecuzione nei Sistemi Agenti Basati su LLM
Un nuovo benchmark chiamato AGENTCHAOSBENCH è stato lanciato per identificare e localizzare errori in esecuzione nei sistemi agenti basati su LLM utilizzando la telemetria di esecuzione. Affronta il problema che l'affidabilità dipende dall'intero processo di esecuzione, inclusi chiamate a strumenti e modelli, guardrail e comunicazioni tra agenti, piuttosto che solo dal risultato finale. I metodi di valutazione tradizionali che guardano solo ai risultati finali non colgono le ragioni alla base dei fallimenti. Questo benchmark testa cinque applicazioni diverse che utilizzano il protocollo Agent-to-Agent e il Model Context Protocol per le chiamate agli strumenti. Introduce dieci diversi tipi di guasti operativi in vari punti e include un controllo senza guasti. I guasti vanno da strumenti lenti o non disponibili a messaggi instradati in modo errato. Il dataset generato include 275 tracce ripulite: 250 esecuzioni con guasti che coprono dieci tipi di guasto e 25 controlli senza guasti. Ogni traccia con guasto è marcata con il suo specifico tipo e posizione, il che aiuta a valutare le tecniche di rilevamento e localizzazione dei guasti. Questa ricerca è dettagliata in un articolo su arXiv con identificatore 2608.14680, che probabilmente copre come è stato creato il benchmark, il processo di iniezione dei guasti e il suo potenziale per migliorare l'affidabilità nei sistemi agenti.
Fatti principali
- AGENTCHAOSBENCH è un benchmark per rilevare e localizzare guasti in esecuzione nei sistemi agenti.
- Utilizza la telemetria di esecuzione per identificare i guasti.
- Cinque applicazioni eterogenee coordinano gli agenti tramite il protocollo Agent-to-Agent.
- Gli strumenti vengono chiamati tramite il Model Context Protocol.
- Vengono iniettati dieci tipi di guasti operativi, inclusi strumenti non disponibili, strumenti lenti, risposte corrotte, risposte sovradimensionate, deleghe ritardate, deleghe in loop, deleghe instradate erroneamente e guardrail bypassati.
- Il dataset include 275 tracce ripulite: 250 esecuzioni con guasti e 25 controlli senza guasti.
- I guasti vengono iniettati ai confini di strumenti, modelli, guardrail e tra agenti.
- L'articolo è disponibile su arXiv con ID 2608.14680.
Entità
Istituzioni
- arXiv