ARTFEED — Contemporary Art Intelligence

Nuovo framework rileva la contaminazione dei dati nelle valutazioni LLM su dati tabulari

ai-technology · 2026-08-06

Un nuovo framework per valutare la contaminazione dei dati in dataset tabulari utilizzati per valutare i modelli linguistici di grandi dimensioni (LLM) è stato proposto in un preprint su arXiv (arXiv:2510.20351). Gli autori sostengono che i metodi esistenti di rilevamento della contaminazione, che si basano su test di memorizzazione, sono troppo grossolani per identificare i guadagni di prestazione derivanti da una precedente esposizione ai dati di test. Il loro approccio prevede la generazione di domande a scelta multipla controllate che preservano la struttura del compito mentre trasformano sistematicamente i dati sottostanti. Queste trasformazioni interrompono selettivamente le informazioni del dataset mantenendo una conoscenza parziale, consentendo di isolare le prestazioni attribuibili alla contaminazione. Il framework incorpora anche baseline non neurali per fornire prestazioni di riferimento. L'articolo è un aggiornamento (replace-cross) e affronta un'area in gran parte inesplorata, poiché la contaminazione nei dati tabulari ha ricevuto poca attenzione rispetto ai domini di testo e immagini. Il lavoro è significativo per garantire l'affidabilità dei benchmark LLM, in particolare nelle applicazioni con dati strutturati.

Fatti principali

  • Il framework è proposto in arXiv:2510.20351.
  • Si rivolge alla contaminazione dei dati in dataset tabulari.
  • I metodi esistenti si basano su test di memorizzazione, che sono troppo grossolani.
  • Il framework genera domande a scelta multipla controllate.
  • Le trasformazioni interrompono le informazioni del dataset mantenendo una conoscenza parziale.
  • Le baseline non neurali forniscono prestazioni di riferimento.
  • L'articolo è un aggiornamento (replace-cross).
  • Il problema è in gran parte inesplorato nei dati tabulari.

Entità

Istituzioni

  • arXiv

Fonti