CTBench: Benchmarking degli Agenti AI per la Risoluzione dei Problemi nelle Telecomunicazioni
CTBench, un nuovo benchmark pubblico dettagliato in arXiv:2608.12002, valuta l'efficacia degli agenti AI nella gestione delle operazioni di rete telecomunicazioni nel mondo reale. Enfatizza l'analisi delle cause profonde e il ripristino dei percorsi, compiti essenziali per gli ingegneri di rete che devono identificare guasti, ottimizzare le configurazioni e minimizzare i costi sotto vincoli stringenti. Le valutazioni attuali non riflettono accuratamente le dinamiche di rete reali né valutano gli agenti in ambienti con osservabilità parziale che coinvolgono vari fornitori, dispositivi, protocolli e interfacce. Creando compiti progettati da esperti arricchiti con metadati dettagliati, inclusi passaggi di prova d'oro, CTBench colma questa lacuna. Utilizza metriche basate su esperti per valutare sia i risultati finali che il ragionamento diagnostico. Gli esperimenti rivelano che anche agenti avanzati incontrano sfide con questi compiti, evidenziando ampie opportunità di miglioramento. Il benchmark mira a promuovere progressi nell'automazione delle operazioni e della manutenzione di rete.
Fatti principali
- CTBench è un benchmark pubblico per agenti AI nella risoluzione dei problemi delle telecomunicazioni.
- Si concentra sull'analisi delle cause profonde e sul ripristino dei percorsi.
- I compiti sono costruiti da esperti e annotati con passaggi di prova d'oro.
- Le metriche valutano sia le risposte finali che le prove diagnostiche.
- Gli esperimenti mostrano che gli agenti all'avanguardia faticano con i compiti.
- Il benchmark affronta i limiti delle valutazioni esistenti.
- Modella ambienti di telecomunicazione parzialmente osservabili con diversi fornitori, dispositivi, protocolli e interfacce.
- L'articolo è disponibile su arXiv con ID 2608.12002.
Entità
Istituzioni
- arXiv