DashArena: Nuovo Benchmark per la Generazione di Dashboard Analitiche Interattive
I ricercatori hanno introdotto un nuovo benchmark chiamato DashArena, volto a valutare i modelli linguistici di grandi dimensioni (LLM) nella loro capacità di creare dashboard analitiche interattive. I dettagli sono condivisi in un articolo disponibile su arXiv (ID: 2608.10567). Questo benchmark affronta la sfida di valutare la generazione di dashboard, che è spesso un compito aperto. DashArena si distingue come il primo del suo genere per la creazione di dashboard basate su compiti e aperti. Richiede che i modelli producano una dashboard insieme a una traiettoria di interazione riproducibile. Un esecutore browser riproduce quindi questo percorso, fornendo prove visive del processo analitico. Un giudice basato su modello visione-linguaggio (VLM) valuta gli output, e una classifica viene creata utilizzando l'aggregazione di Bradley–Terry. I ricercatori hanno anche sviluppato il modello DashJudge-8B basato sul giudice. Puoi leggere l'articolo su https://arxiv.org/abs/2608.10567.
Fatti principali
- DashArena è introdotto come benchmark per la generazione di dashboard analitiche interattive.
- Si afferma che sia il primo benchmark per la generazione aperta e basata su compiti di tali dashboard.
- Il benchmark richiede che i sistemi generino sia una dashboard che una traiettoria di interazione riproducibile.
- Un esecutore browser riproduce la traiettoria per produrre prove visive e di esecuzione.
- Un giudice VLM confronta i candidati utilizzando le prove.
- L'aggregazione di Bradley–Terry produce la classifica.
- Il giudice è distillato nel modello open-weight DashJudge-8B.
- L'articolo è disponibile su arXiv con ID 2608.10567.
Entità
Istituzioni
- arXiv