Mixture of Training: Pre-addestramento Modulare per Modelli Linguistici
Uno studio recente pubblicato su arXiv (2608.13277) presenta Mixture of Training (MoT), una tecnica progettata per suddividere il pre-addestramento dei modelli linguistici in compiti più piccoli e addestrabili in modo indipendente, che possono successivamente essere integrati in un modello unificato. Questo metodo divide un Transformer target in blocchi sequenziali di layer, addestrando ciascun blocco all'interno di un framework di allineamento statico pre-addestrato, e successivamente ricombina i blocchi addestrati con una fase facoltativa di adattamento end-to-end di breve durata. Gli autori forniscono una prova di concetto utilizzando un modello in stile Gemma da 1,3 miliardi di parametri addestrato su C4, dimostrando che fette di profondità addestrate in modo indipendente possono formare un modello linguistico funzionale. Uno schema di parità di qualità raggiunge la stessa perplessità del baseline monolitico, elaborando un numero maggiore di token e mostrando un percorso critico idealizzato equivalente a livello di layer più breve dopo la preparazione dell'allineatore. Il vantaggio computazionale effettivo dipende dal riutilizzo dell'allineatore in diverse sessioni di addestramento. Questo articolo funge da annuncio di tipo incrociato e può essere consultato tramite l'URL fornito.
Fatti principali
- Articolo su arXiv:2608.13277
- Introduce Mixture of Training (MoT)
- Partiziona il Transformer in blocchi di layer contigui
- Addestra ciascun blocco all'interno di uno scaffold di allineamento pre-addestrato e congelato
- Ricompone i blocchi addestrati con un adattamento end-to-end facoltativo
- Prova di meccanismo su un modello in stile Gemma da 1,3 miliardi di parametri
- Addestrato sul dataset C4
- Lo schema di parità di qualità corrisponde alla perplessità del baseline monolitico
- Elabora più token aggregati
- Il vantaggio computazionale effettivo dipende dal riutilizzo dell'allineatore
Entità
Istituzioni
- arXiv