Messier: Corpus Unificato di 957.000 Record per la Valutazione di Agenti AI
Un gruppo di ricercatori ha introdotto Messier, un dataset completo progettato per creare uniformità nel modo in cui valutiamo gli agenti AI attraverso diversi benchmark. Questo dataset è composto da 957.253 voci, coprendo 30 benchmark, 714 agenti, 11.891 compiti e 74.205 verificatori. Include punteggi pubblici e esecuzioni di cinque agenti in sei campi sottorappresentati, come un nuovo benchmark legale. Ogni voce è organizzata per modello, scaffold, ambiente, compito, verificatore e regola di aggregazione, utilizzando le classificazioni SOC/NAICS per approfondimenti industriali. I loro risultati rivelano progressi misti: mentre la chiamata di funzione è ben consolidata e la programmazione sta accelerando, i flussi di lavoro aziendali rimangono particolarmente impegnativi. Questo progetto mira a snellire le valutazioni degli agenti fornendo un quadro empirico unificato.
Fatti principali
- Il corpus Messier contiene 957.253 record
- Copre 30 benchmark, 714 agenti, 11.891 compiti, 74.205 verificatori
- Include esecuzioni di cinque agenti in sei domini sottorappresentati
- Standardizzato per modello, scaffold, ambiente, compito, verificatore, regola di aggregazione
- Utilizza le classificazioni SOC/NAICS per l'analisi occupazionale e industriale
- Chiamata di funzione satura, programmazione in miglioramento più rapido, flussi di lavoro aziendali più impegnativi
- Pubblicato su arXiv con ID 2607.25891
- Mira ad affrontare la frammentazione nella valutazione degli agenti AI
Entità
Istituzioni
- arXiv