Nuove leggi di scala per il pre-addestramento ottimale in termini di calcolo e dati
Un nuovo articolo su arXiv propone le leggi di scala Compute-Data (CD) per affrontare il crescente squilibrio tra potenza di calcolo e dati di pre-addestramento di alta qualità. Le leggi di scala classiche presuppongono una quantità illimitata di dati freschi, ma poiché la potenza di calcolo supera la disponibilità di dati, la scala CD colma il divario tra i regimi ottimali per il calcolo (i dati scalano con il calcolo) e per i dati (corpus fisso, calcolo illimitato). Il framework introduce una funzione di efficacia dei token η, che quantifica il valore dei token derivati da ripetizioni multi-epoca o parafrasi rispetto ai token freschi. Esperimenti sul corpus Dolma-3 con modelli da 14M a 600M parametri mostrano che l'efficacia dei token è lontana dall'ideale.
Fatti principali
- Titolo dell'articolo: Bridging Compute- and Data-Optimal Pretraining
- ID arXiv: 2607.25271
- Le leggi di scala classiche presuppongono dati freschi illimitati
- La scala CD unifica le scale ottimali per calcolo e dati
- Introduce la funzione di efficacia dei token η
- η misura il valore dei token derivati rispetto ai token freschi
- Testato sul corpus Dolma-3
- Dimensioni dei modelli: da 14M a 600M parametri
- Strategie di espansione dei dati: ripetizione multi-epoca e parafrasi
- Efficacia dei token lontana dalla perfezione
Entità
Istituzioni
- arXiv