Strategie di Campionamento del Contesto per TabPFN su Piccoli Dataset Tabellari
Uno studio su arXiv (2607.26628) indaga come la selezione del contesto influenzi TabPFN, un metodo per la classificazione tramite apprendimento nel contesto su piccoli dataset tabellari. Utilizzando 15 dataset OpenML, i ricercatori hanno esaminato tre domande: se contesti più grandi riducano la variabilità delle previsioni, se l'accuratezza dipenda dalla preservazione della distribuzione di training o dalla copertura dello spazio delle feature, e se metodi di selezione costosi (K-Means, campionamento del punto più lontano) superino il campionamento casuale uniforme. I risultati mostrano che contesti più grandi migliorano sia l'accuratezza che la stabilità, con il coefficiente di variazione dell'AUC che scende dal 6–18% a k=16 a valori inferiori. I metodi di selezione costosi non hanno offerto alcun beneficio rispetto al campionamento casuale. I risultati guidano i professionisti nella scelta della dimensione del contesto e del metodo di campionamento per TabPFN.
Fatti principali
- TabPFN utilizza l'apprendimento nel contesto per la classificazione senza aggiornamenti del gradiente.
- Lo studio è stato condotto su 15 dataset OpenML.
- Contesti più grandi riducono la variabilità delle previsioni e migliorano l'accuratezza.
- Il coefficiente di variazione dell'AUC è diminuito dal 6–18% a k=16.
- K-Means e il campionamento del punto più lontano non hanno fornito vantaggi rispetto al campionamento casuale uniforme.
- L'articolo è disponibile su arXiv con ID 2607.26628.
- La ricerca si concentra su piccoli dataset tabellari.
- La dimensione del contesto e la selezione delle righe sono scelte critiche per i professionisti.
Entità
Istituzioni
- arXiv
- OpenML