Leggi di scala prevedono le prestazioni dei transformer sui getti dei collider
Un nuovo studio dimostra che le leggi di scala possono prevedere le prestazioni dei modelli transformer nella fisica delle particelle prima del completo addestramento. I ricercatori hanno adattato una legge di scala congiunta modello-dati su modelli piccoli che coprono tre ordini di grandezza di calcolo di addestramento, quindi hanno previsto la perdita di modelli più grandi addestrati con oltre 100 volte più calcolo con un margine dell'uno percento. Lo studio collega la perdita di pre-addestramento alle prestazioni fisiche a valle: su due benchmark standard di tagging, una minore perdita di pre-addestramento produce una minore perdita di fine-tuning e una maggiore reiezione del fondo. Ciò consente di tradurre i budget di calcolo in prestazioni attese per questa famiglia di modelli e compiti.
Fatti principali
- Leggi di scala prevedono le prestazioni dei transformer sui getti dei collider
- Legge di scala congiunta modello-dati adattata su modelli piccoli
- Copre tre ordini di grandezza di calcolo di addestramento
- Prevede la perdita di modelli più grandi con oltre 100x più calcolo entro l'1%
- Minore perdita di pre-addestramento produce minore perdita di fine-tuning
- Maggiore reiezione del fondo dopo il fine-tuning
- Due benchmark standard di tagging utilizzati
- Il budget di calcolo può essere tradotto in prestazioni attese
Entità
—