ARTFEED — Contemporary Art Intelligence

OmegaUse-OfficeVal: Benchmark per testare agenti LLM su compiti d'ufficio

ai-technology · 2026-07-30

Un nuovo benchmark chiamato OmegaUse-OfficeVal è stato sviluppato da ricercatori per valutare agenti basati su modelli linguistici di grandi dimensioni (LLM) in compiti d'ufficio complessi, fondati su principi economici. Questo benchmark comprende 100 compiti, tutti provenienti da richieste reali di suite per ufficio, modificati con un metodo che preserva la privacy. Ogni compito richiede in media 2,32 ore di lavoro umano. Inoltre, ogni compito è associato a due indicatori economici: il tempo impiegato dal lavoro umano e un proxy per il prezzo del compito, consentendo un'analisi diretta dei costi tra lavoro umano e inferenza LLM. Il processo di valutazione è supportato da verificatori basati su codice che utilizzano rubriche dettagliate. Questa ricerca è documentata in un articolo disponibile su arXiv (2607.27155).

Fatti principali

  • OmegaUse-OfficeVal è un benchmark per agenti LLM su compiti d'ufficio.
  • Comprende 100 compiti da richieste reali di suite per ufficio.
  • I compiti richiedono in media 2,32 ore di lavoro umano.
  • Ogni compito ha due segnali economici: tempo di lavoro umano e proxy del prezzo del compito.
  • Verificatori basati su codice da rubriche dettagliate sono utilizzati per la valutazione.
  • Il benchmark consente confronti di costo tra umani e LLM.
  • L'articolo è disponibile su arXiv con ID 2607.27155.
  • Il benchmark supporta una valutazione ponderata per valore.

Entità

Istituzioni

  • arXiv

Fonti