I piccoli modelli foundation raggiungono i risultati dei modelli da 70B sui dati del comportamento umano
Uno studio recente pubblicato su arXiv (2608.05224) esplora le caratteristiche di scaling dei piccoli modelli foundation sviluppati utilizzando dati comportamentali umani. I ricercatori hanno creato quattordici modelli, variando da 135M a 14B parametri, utilizzando quattro diverse famiglie architetturali sul dataset Psych-101, che include 10,7 milioni di scelte a livello di prova provenienti da 160 esperimenti. In termini di prestazioni in-distribution, i risultati hanno indicato che la scala aveva un impatto minimo, poiché i modelli si raggruppavano strettamente tra loro, con quelli da 0,6B a 1B parametri che ottenevano risultati paragonabili a un baseline da 70B per i partecipanti trattenuti. Al contrario, le prestazioni out-of-distribution hanno rivelato un gradiente di scaling più ripido, favorendo modelli più grandi per la generalizzazione a nuove strutture di compito. Per analizzare le informazioni utilizzate da questi modelli, sono stati impiegati due diagnostici, rimuovendo sistematicamente quattro canali di prompt: istruzioni del compito, stimoli sperimentali, feedback sui risultati e scelta. I risultati implicano che, mentre i piccoli modelli possono agire come proxy cognitivi efficaci, la loro capacità di generalizzare dipende dalla scala quando incontrano compiti non familiari. Questo studio sollecita ulteriori indagini sul fatto che questi modelli comprendano la struttura del compito o si affidino a scorciatoie statistiche. L'articolo completo è accessibile all'indirizzo https://arxiv.org/abs/2608.05224.
Fatti principali
- Studio su arXiv:2608.05224
- Quattordici modelli addestrati da 135M a 14B parametri
- Quattro famiglie architetturali
- Dataset Psych-101 con 10,7 milioni di scelte a livello di prova provenienti da 160 esperimenti
- In-distribution, la scala conta poco; i modelli rientrano in una fascia ristretta
- Da 0,6B a 1B parametri corrispondono a un baseline da 70B sui partecipanti trattenuti
- Out-of-distribution, i modelli più grandi mostrano un gradiente di scaling più ripido
- Due diagnostici rimuovono quattro canali di prompt: istruzioni del compito, stimoli sperimentali, feedback sui risultati e scelta
Entità
Istituzioni
- arXiv