ORCA-bench: Benchmarking degli Agenti LLM per l'Analisi delle Cause Radice in Ambienti On-Call
Il nuovo benchmark ORCA-bench serve a valutare gli agenti basati su modelli linguistici di grandi dimensioni (LLM) in situazioni di produzione on-call. Questo benchmark integra un sistema di microservizi live dotato di OpenTelemetry, utilizzando sei giorni di metriche, log e tracce accessibili tramite interfacce di telemetria reali come Prometheus, Jaeger e OpenSearch attraverso Grafana, insieme al codice sorgente completo. Include 1.079 attività di analisi delle cause radice (RCA) che variano in specificità del report, tempo di rilevamento e scenari di guasto concorrenti. I sintomi sono curati e validati da esperti SRE, mentre la valutazione dell'LLM è rivalutata indipendentemente da esseri umani, raggiungendo un coefficiente kappa di Cohen di 0,90. Tra cinque agenti leader, la più alta accuratezza RCA registrata è del 25%.
Fatti principali
- ORCA-bench è un benchmark per agenti LLM nell'analisi delle cause radice in ambienti on-call.
- Utilizza un sistema di microservizi live strumentato con OpenTelemetry.
- Il sistema espone sei giorni di metriche, log e tracce tramite Prometheus, Jaeger e OpenSearch attraverso Grafana.
- Viene fornito accesso completo al codice sorgente.
- Ci sono 1.079 attività RCA con variazioni nella specificità del report, nel tempo di rilevamento e nei guasti concomitanti.
- I sintomi di verità di base sono curati da esperti SRE.
- Il giudizio LLM viene rivalutato da esseri umani con un coefficiente kappa di Cohen di 0,90.
- La migliore accuratezza RCA tra cinque agenti all'avanguardia è del 25%.
Entità
Istituzioni
- arXiv
- OpenTelemetry
- Prometheus
- Jaeger
- OpenSearch
- Grafana