CITBench: Nuovo Benchmark per l'Elaborazione Interattiva di Dati Tabellari con LLM
CITBench è stato sviluppato da ricercatori come un benchmark robusto per valutare i modelli linguistici di grandi dimensioni (LLM) nell'ambito delle attività interattive di elaborazione di dati tabellari. A differenza dei benchmark attuali che enfatizzano istruzioni single-turn, esplicitamente definite per il ragionamento su tabelle, CITBench affronta le complessità delle interazioni multi-turn in cui le esigenze degli utenti possono cambiare. Questo benchmark presenta una classificazione in quattro categorie principali: corrispondenza di tabelle, pulizia, aumento e trasformazione, che include 18 tipi di attività e 1.296 esempi provenienti da vari dataset di dominio. CITBench consente valutazioni sia offline che online. La modalità online simula interazioni multi-turn con procedure operative limitate e script di attività strutturati, riflettendo i tratti comportamentali essenziali degli assistenti basati su LLM in contesti pratici. Ulteriori approfondimenti su questa iniziativa sono disponibili in un articolo su arXiv (arXiv:2608.00018).
Fatti principali
- CITBench è un nuovo benchmark per valutare gli LLM sull'elaborazione interattiva di dati tabellari.
- Copre quattro categorie di alto livello: corrispondenza di tabelle, pulizia, aumento e trasformazione.
- Il benchmark include 18 tipi di attività e 1.296 istanze.
- Le istanze sono curate da dataset di diversi domini.
- CITBench supporta sia la valutazione offline che online.
- L'ambiente online modella interazioni multi-turn con requisiti utente in evoluzione.
- Il benchmark mira a superare i limiti dei benchmark esistenti di ragionamento su tabelle single-turn.
- L'articolo è disponibile su arXiv con identificativo 2608.00018.
Entità
Istituzioni
- arXiv