ARTFEED — Contemporary Art Intelligence

Messier: Corpus Unificato di 957.000 Record per la Valutazione di Agenti AI

ai-technology · 2026-07-29

Un gruppo di ricercatori ha introdotto Messier, un dataset completo progettato per creare uniformità nel modo in cui valutiamo gli agenti AI attraverso diversi benchmark. Questo dataset è composto da 957.253 voci, coprendo 30 benchmark, 714 agenti, 11.891 compiti e 74.205 verificatori. Include punteggi pubblici e esecuzioni di cinque agenti in sei campi sottorappresentati, come un nuovo benchmark legale. Ogni voce è organizzata per modello, scaffold, ambiente, compito, verificatore e regola di aggregazione, utilizzando le classificazioni SOC/NAICS per approfondimenti industriali. I loro risultati rivelano progressi misti: mentre la chiamata di funzione è ben consolidata e la programmazione sta accelerando, i flussi di lavoro aziendali rimangono particolarmente impegnativi. Questo progetto mira a snellire le valutazioni degli agenti fornendo un quadro empirico unificato.

Fatti principali

  • Il corpus Messier contiene 957.253 record
  • Copre 30 benchmark, 714 agenti, 11.891 compiti, 74.205 verificatori
  • Include esecuzioni di cinque agenti in sei domini sottorappresentati
  • Standardizzato per modello, scaffold, ambiente, compito, verificatore, regola di aggregazione
  • Utilizza le classificazioni SOC/NAICS per l'analisi occupazionale e industriale
  • Chiamata di funzione satura, programmazione in miglioramento più rapido, flussi di lavoro aziendali più impegnativi
  • Pubblicato su arXiv con ID 2607.25891
  • Mira ad affrontare la frammentazione nella valutazione degli agenti AI

Entità

Istituzioni

  • arXiv

Fonti