La Ripetizione Ottimale dei Dati nel Pretraining degli LLM Scala con la Dimensione del Modello
Un recente articolo su arXiv (2608.14071) esplora la strategia ottimale per ripetere dati di dominio di alta qualità durante la fase di pretraining dei grandi modelli linguistici (LLM) mentre sia le dimensioni del modello che i budget di token di addestramento si espandono. I ricercatori hanno scoperto che, inaspettatamente, il numero ideale di ripetizioni per un dominio specifico aumenta leggermente con la dimensione del modello quando si mantiene un rapporto costante di token per parametro (TPP). Inoltre, in vari domini, esiste una forte correlazione negativa tra il numero ottimale di ripetizioni e la perdita di validazione finale; i domini con perdita inferiore tipicamente beneficiano di una maggiore ripetizione. Questo studio affronta il problema della limitata disponibilità di dati di dominio di alta qualità, che diminuisce in proporzione all'aumentare dei budget, suggerendo la ripetizione come soluzione, ma avvertendo del rischio di overfitting. L'articolo è stato annunciato come nuova sottomissione su arXiv.
Fatti principali
- Articolo arXiv:2608.14071
- Tipo di annuncio: nuovo
- Studia la scalabilità della ripetizione dei dati di dominio nel pretraining degli LLM
- Il numero ottimale di ripetizioni aumenta leggermente con la dimensione del modello a TPP fisso
- Il numero ottimale di ripetizioni è fortemente correlato negativamente con la perdita di validazione finale
- I dati di dominio di alta qualità sono più difficili da scalare rispetto ai dati web generali
- Una ripetizione eccessiva può portare a overfitting
- Il budget di token di addestramento cresce proporzionalmente con la dimensione del modello
Entità
Istituzioni
- arXiv