TelemetrySuffBench: Benchmarking della Diagnosi dell'Origine dei Guasti nella Telemetria degli Agenti
È stato introdotto un nuovo benchmark chiamato TelemetrySuffBench per valutare quanto la telemetria degli agenti possa individuare le fonti di guasto in sistemi con più componenti. È descritto in un articolo su arXiv (2608.07899) e distingue tra rilevamento dei guasti, localizzazione dei guasti e astensione sicura quando le prove sono insufficienti. Il benchmark produce tracce standard con guasti a legame ritardato e le visualizza utilizzando viste grossolane accoppiate, maschere di telemetria a sette fattori e coppie di origini ambigue identiche. Cinque modelli linguistici all'avanguardia sono stati esaminati utilizzando metodi coerenti, incluse analisi per sottogruppi e controlli di output non validi. I risultati mostrano che la telemetria completa offre una precisione Top-1 del passo di origine che varia dal 33,8% al 97,2%, mentre altre viste raggiungono tassi di rilevamento elevati ma limitano la precisione dell'origine a solo lo 0,5%, evidenziando significative lacune nella robustezza.
Fatti principali
- TelemetrySuffBench è un benchmark controllato per la diagnosi dell'origine dei guasti nei sistemi agente.
- Separa il rilevamento dei guasti, la localizzazione dell'origine dei guasti e l'astensione sicura.
- Il benchmark costruisce tracce canoniche multi-componente con guasti a legame ritardato.
- Utilizza viste grossolane accoppiate, maschere di telemetria a sette fattori e coppie di origini ambigue esattamente uguali.
- Sono stati valutati cinque modelli linguistici all'avanguardia.
- Con telemetria completa, la precisione Top-1 del passo di origine varia dal 33,8% al 97,2% tra i modelli.
- Le viste di metadati, compatibili con OpenTelemetry e OpenInference mantengono un F1 di rilevamento dal 99,5% al 100%.
- La precisione del passo di origine è limitata al massimo allo 0,5% con queste viste.
- L'articolo è disponibile su arXiv con ID 2608.07899.
Entità
Istituzioni
- arXiv