MetaRoute-Bench: Un Nuovo Framework per la Valutazione delle Politiche di Routing Agentico
MetaRoute-Bench è stato introdotto per valutare come vengono prese le decisioni nei sistemi agentici, che spesso si trovano di fronte a scelte come rispondere direttamente alle domande, scomporre i compiti, utilizzare strumenti, eseguire codice, consultare esperti, verificare i risultati o recuperare dagli errori. Queste decisioni influenzano la qualità del completamento dei compiti, i costi e il tempo impiegato, ma di solito vengono valutate solo attraverso l'accuratezza complessiva del compito. Questo benchmark fornisce un modo chiaro e aperto per analizzare questi processi decisionali all'interno di un unico modello di esecuzione. Include 180 profili di compiti sintetici in aree come l'analisi dei dati e l'elaborazione dei documenti, e presenta otto politiche di routing e 30 coppie di semi casuali. Una politica consapevole del compito ha raggiunto un tasso di successo del 79,4%, superando altri approcci. Il benchmark è disponibile su arXiv con l'identificatore 2608.00107.
Fatti principali
- MetaRoute-Bench è un framework aperto e ispezionabile per confrontare le politiche di meta-decisione.
- Il benchmark contiene 180 profili di compiti sintetici.
- I profili dei compiti coprono analisi dei dati, ricerca ed elaborazione dei documenti.
- Vengono valutate otto politiche di routing.
- Vengono utilizzate 30 coppie di semi casuali.
- Sono state analizzate 43.200 tracce.
- Una politica compositiva consapevole del compito ha raggiunto il 79,4% di successo.
- Una politica statica specifica per il carico di lavoro ha raggiunto il 76,7% di successo.
- Il routing dei compiti one-shot ha raggiunto il 67,4% di successo.
- La risposta diretta ha raggiunto il 52,9% di successo.
- La politica consapevole del compito ha superato la politica statica di 2,7 punti percentuali.
- Il benchmark è disponibile su arXiv con l'identificatore 2608.00107.
Entità
Istituzioni
- arXiv