ARTFEED — Contemporary Art Intelligence

DashArena: Nuovo Benchmark per la Generazione di Dashboard Analitiche Interattive

ai-technology · 2026-08-13

I ricercatori hanno introdotto un nuovo benchmark chiamato DashArena, volto a valutare i modelli linguistici di grandi dimensioni (LLM) nella loro capacità di creare dashboard analitiche interattive. I dettagli sono condivisi in un articolo disponibile su arXiv (ID: 2608.10567). Questo benchmark affronta la sfida di valutare la generazione di dashboard, che è spesso un compito aperto. DashArena si distingue come il primo del suo genere per la creazione di dashboard basate su compiti e aperti. Richiede che i modelli producano una dashboard insieme a una traiettoria di interazione riproducibile. Un esecutore browser riproduce quindi questo percorso, fornendo prove visive del processo analitico. Un giudice basato su modello visione-linguaggio (VLM) valuta gli output, e una classifica viene creata utilizzando l'aggregazione di Bradley–Terry. I ricercatori hanno anche sviluppato il modello DashJudge-8B basato sul giudice. Puoi leggere l'articolo su https://arxiv.org/abs/2608.10567.

Fatti principali

  • DashArena è introdotto come benchmark per la generazione di dashboard analitiche interattive.
  • Si afferma che sia il primo benchmark per la generazione aperta e basata su compiti di tali dashboard.
  • Il benchmark richiede che i sistemi generino sia una dashboard che una traiettoria di interazione riproducibile.
  • Un esecutore browser riproduce la traiettoria per produrre prove visive e di esecuzione.
  • Un giudice VLM confronta i candidati utilizzando le prove.
  • L'aggregazione di Bradley–Terry produce la classifica.
  • Il giudice è distillato nel modello open-weight DashJudge-8B.
  • L'articolo è disponibile su arXiv con ID 2608.10567.

Entità

Istituzioni

  • arXiv

Fonti