ARTFEED — Contemporary Art Intelligence

ORCA-bench: Benchmarking degli Agenti LLM per l'Analisi delle Cause Radice in Ambienti On-Call

ai-technology · 2026-08-06

Il nuovo benchmark ORCA-bench serve a valutare gli agenti basati su modelli linguistici di grandi dimensioni (LLM) in situazioni di produzione on-call. Questo benchmark integra un sistema di microservizi live dotato di OpenTelemetry, utilizzando sei giorni di metriche, log e tracce accessibili tramite interfacce di telemetria reali come Prometheus, Jaeger e OpenSearch attraverso Grafana, insieme al codice sorgente completo. Include 1.079 attività di analisi delle cause radice (RCA) che variano in specificità del report, tempo di rilevamento e scenari di guasto concorrenti. I sintomi sono curati e validati da esperti SRE, mentre la valutazione dell'LLM è rivalutata indipendentemente da esseri umani, raggiungendo un coefficiente kappa di Cohen di 0,90. Tra cinque agenti leader, la più alta accuratezza RCA registrata è del 25%.

Fatti principali

  • ORCA-bench è un benchmark per agenti LLM nell'analisi delle cause radice in ambienti on-call.
  • Utilizza un sistema di microservizi live strumentato con OpenTelemetry.
  • Il sistema espone sei giorni di metriche, log e tracce tramite Prometheus, Jaeger e OpenSearch attraverso Grafana.
  • Viene fornito accesso completo al codice sorgente.
  • Ci sono 1.079 attività RCA con variazioni nella specificità del report, nel tempo di rilevamento e nei guasti concomitanti.
  • I sintomi di verità di base sono curati da esperti SRE.
  • Il giudizio LLM viene rivalutato da esseri umani con un coefficiente kappa di Cohen di 0,90.
  • La migliore accuratezza RCA tra cinque agenti all'avanguardia è del 25%.

Entità

Istituzioni

  • arXiv
  • OpenTelemetry
  • Prometheus
  • Jaeger
  • OpenSearch
  • Grafana

Fonti