InfraBench: Benchmarking degli Agenti AI per la Gestione delle Infrastrutture
InfraBench, una suite di benchmark di recente lancio, è progettata per valutare gli agenti AI in scenari realistici di gestione delle infrastrutture. Comprende l'intero stack di sistema e il ciclo di vita operativo, incorporando una valutazione dettagliata del rischio. I test condotti con 15 diverse configurazioni di modelli di agenti hanno indicato che anche l'agente più capace non riesce a ottenere un punteggio perfetto in tutti i compiti. I punteggi effettivi medi variavano tra circa il 40% e l'88%, con errori standard per ciascuna configurazione che andavano da 6 a 12 punti. Ripetendo ogni compito tre volte si è dimostrato che anche le migliori configurazioni riescono solo in una parte delle volte. Il punteggio per compito ha rivelato una tendenza costante al fallimento: mentre gli agenti possono raggiungere obiettivi immediati, spesso vacillano nel garantire l'affidabilità a lungo termine. Questo benchmark mira ad affrontare la crescente complessità della gestione delle infrastrutture informatiche contemporanee e il ruolo degli agenti AI nell'automatizzare queste responsabilità. I risultati sottolineano i limiti esistenti degli agenti AI nell'affrontare le complessità delle infrastrutture del mondo reale.
Fatti principali
- InfraBench è una suite di benchmark per valutare gli agenti AI su compiti infrastrutturali.
- Copre l'intero stack di sistema e il ciclo di vita operativo.
- Include una valutazione del rischio a grana fine.
- Sono stati condotti esperimenti con 15 configurazioni di modelli di agenti.
- L'agente più forte non è riuscito a ottenere un punteggio pieno in tutti i compiti.
- I punteggi effettivi medi variavano dal 40% all'88%.
- Gli errori standard per configurazione erano di 6-12 punti.
- Le migliori configurazioni superavano solo una frazione dei tentativi quando i compiti venivano ripetuti tre volte.
Entità
Istituzioni
- arXiv