ARTFEED — Contemporary Art Intelligence

AGENTCHAOSBENCH: Benchmark per il Rilevamento di Guasti in Esecuzione nei Sistemi Agenti Basati su LLM

ai-technology · 2026-08-18

Un nuovo benchmark chiamato AGENTCHAOSBENCH è stato lanciato per identificare e localizzare errori in esecuzione nei sistemi agenti basati su LLM utilizzando la telemetria di esecuzione. Affronta il problema che l'affidabilità dipende dall'intero processo di esecuzione, inclusi chiamate a strumenti e modelli, guardrail e comunicazioni tra agenti, piuttosto che solo dal risultato finale. I metodi di valutazione tradizionali che guardano solo ai risultati finali non colgono le ragioni alla base dei fallimenti. Questo benchmark testa cinque applicazioni diverse che utilizzano il protocollo Agent-to-Agent e il Model Context Protocol per le chiamate agli strumenti. Introduce dieci diversi tipi di guasti operativi in vari punti e include un controllo senza guasti. I guasti vanno da strumenti lenti o non disponibili a messaggi instradati in modo errato. Il dataset generato include 275 tracce ripulite: 250 esecuzioni con guasti che coprono dieci tipi di guasto e 25 controlli senza guasti. Ogni traccia con guasto è marcata con il suo specifico tipo e posizione, il che aiuta a valutare le tecniche di rilevamento e localizzazione dei guasti. Questa ricerca è dettagliata in un articolo su arXiv con identificatore 2608.14680, che probabilmente copre come è stato creato il benchmark, il processo di iniezione dei guasti e il suo potenziale per migliorare l'affidabilità nei sistemi agenti.

Fatti principali

  • AGENTCHAOSBENCH è un benchmark per rilevare e localizzare guasti in esecuzione nei sistemi agenti.
  • Utilizza la telemetria di esecuzione per identificare i guasti.
  • Cinque applicazioni eterogenee coordinano gli agenti tramite il protocollo Agent-to-Agent.
  • Gli strumenti vengono chiamati tramite il Model Context Protocol.
  • Vengono iniettati dieci tipi di guasti operativi, inclusi strumenti non disponibili, strumenti lenti, risposte corrotte, risposte sovradimensionate, deleghe ritardate, deleghe in loop, deleghe instradate erroneamente e guardrail bypassati.
  • Il dataset include 275 tracce ripulite: 250 esecuzioni con guasti e 25 controlli senza guasti.
  • I guasti vengono iniettati ai confini di strumenti, modelli, guardrail e tra agenti.
  • L'articolo è disponibile su arXiv con ID 2608.14680.

Entità

Istituzioni

  • arXiv

Fonti