ARTFEED — Contemporary Art Intelligence

SQBench: un benchmark per valutare gli agenti basati su modelli linguistici nei flussi di lavoro produttivi

other · 2026-07-29

I ricercatori hanno presentato SQBench, un nuovo benchmark progettato per valutare le prestazioni degli agenti basati su modelli linguistici nell'esecuzione di compiti orientati alla produzione. La versione iniziale, SQBench v1.0, comprende 220 compiti standardizzati suddivisi in tre livelli: L1 per le capacità atomiche, L2 per le competenze composite e L3 per gli scenari aziendali. Ogni compito richiede che un agente gestisca gli asset di input, utilizzi gli strumenti disponibili e generi un output chiaramente definito. Il processo di valutazione calcola innanzitutto il Completamento funzionale, seguito dalla Penalità di Rischio e dalle Prestazioni, derivate da trigger indipendenti in una Matrice di Rischio 10D. Un Superamento Rigoroso è definito come Completamento = 1 e Penalità di Rischio = 0. La ricerca ha valutato 27 configurazioni di modelli utilizzando un protocollo unificato, con un'esecuzione per ogni coppia configurazione-compito, raggiungendo un Weighted Pass@1 massimo predefinito del 60,5%.

Fatti principali

  • SQBench è un benchmark per valutare l'esecuzione di compiti orientati alla produzione da parte di agenti basati su modelli linguistici.
  • SQBench v1.0 contiene 220 compiti standardizzati.
  • I compiti sono organizzati in L1 (capacità atomiche), L2 (competenze composite) e L3 (scenari aziendali).
  • Ogni compito richiede l'elaborazione di asset di input, l'uso di strumenti e la produzione di un deliverable.
  • La valutazione calcola il Completamento, quindi deriva la Penalità di Rischio e le Prestazioni da una Matrice di Rischio 10D.
  • Un Superamento Rigoroso richiede Completamento = 1 e Penalità di Rischio = 0.
  • Sono state valutate 27 configurazioni di modelli con un protocollo comune.
  • Il Weighted Pass@1 massimo predefinito è stato del 60,5%.

Entità

Fonti