TSQueryBench: Nuovo benchmark rivela asimmetria tra generazione e valutazione dei LLM
TSQueryBench funge da benchmark sintetico con 500 istanze di dati di serie temporali suddivise in 10 diverse tipologie di query, ciascuna accompagnata da spiegazioni corrette, parzialmente corrette e non corrette. La valutazione ha coinvolto sei grandi modelli linguistici, concentrandosi sulla generazione di spiegazioni, ranking relativo, punteggio indipendente e rilevamento di anomalie multiple. Una scoperta significativa indica che questi modelli possono valutare efficacemente anche quando non producono spiegazioni accurate. Per valutare le spiegazioni, è essenziale verificare le affermazioni numeriche rispetto a dati strutturati. TSQueryBench offre etichette di verità (ground-truth) per una valutazione approfondita sia della generazione che della valutazione. Questa ricerca sottolinea che le capacità di un modello nel giudicare e nello spiegare potrebbero non essere allineate, aspetto cruciale per implementare valutatori LLM in settori come finanza, sanità e scienza del clima. L'articolo è disponibile su arXiv con identificatore 2604.02118.
Fatti principali
- TSQueryBench è un benchmark sintetico controllato con 500 istanze di serie temporali.
- Il benchmark copre 10 tipi di query.
- Ogni istanza è associata a spiegazioni corrette, parzialmente corrette e non corrette.
- Sono stati valutati sei grandi modelli linguistici.
- Quattro compiti: generazione di spiegazioni, ranking relativo, punteggio indipendente, rilevamento di anomalie multiple.
- Scoperta centrale: asimmetria coerente tra generazione e valutazione.
- La valutazione delle spiegazioni di serie temporali richiede la verifica delle affermazioni numeriche rispetto ai dati strutturati.
- L'articolo è disponibile su arXiv con identificatore 2604.02118.
Entità
—