ARTFEED — Contemporary Art Intelligence

CITBench: Nuovo Benchmark per l'Elaborazione Interattiva di Dati Tabellari con LLM

ai-technology · 2026-08-04

CITBench è stato sviluppato da ricercatori come un benchmark robusto per valutare i modelli linguistici di grandi dimensioni (LLM) nell'ambito delle attività interattive di elaborazione di dati tabellari. A differenza dei benchmark attuali che enfatizzano istruzioni single-turn, esplicitamente definite per il ragionamento su tabelle, CITBench affronta le complessità delle interazioni multi-turn in cui le esigenze degli utenti possono cambiare. Questo benchmark presenta una classificazione in quattro categorie principali: corrispondenza di tabelle, pulizia, aumento e trasformazione, che include 18 tipi di attività e 1.296 esempi provenienti da vari dataset di dominio. CITBench consente valutazioni sia offline che online. La modalità online simula interazioni multi-turn con procedure operative limitate e script di attività strutturati, riflettendo i tratti comportamentali essenziali degli assistenti basati su LLM in contesti pratici. Ulteriori approfondimenti su questa iniziativa sono disponibili in un articolo su arXiv (arXiv:2608.00018).

Fatti principali

  • CITBench è un nuovo benchmark per valutare gli LLM sull'elaborazione interattiva di dati tabellari.
  • Copre quattro categorie di alto livello: corrispondenza di tabelle, pulizia, aumento e trasformazione.
  • Il benchmark include 18 tipi di attività e 1.296 istanze.
  • Le istanze sono curate da dataset di diversi domini.
  • CITBench supporta sia la valutazione offline che online.
  • L'ambiente online modella interazioni multi-turn con requisiti utente in evoluzione.
  • Il benchmark mira a superare i limiti dei benchmark esistenti di ragionamento su tabelle single-turn.
  • L'articolo è disponibile su arXiv con identificativo 2608.00018.

Entità

Istituzioni

  • arXiv

Fonti