Il framework di addestramento Matryoshka migliora l'efficienza dei modelli linguistici
Un nuovo framework di addestramento per modelli linguistici, chiamato Matryoshka, integra sottomodelli di dimensioni variabili in un'unica struttura annidata. Questo design minimizza il numero complessivo di parametri e facilita una distillazione a basso costo dal sottomodello più grande a tutte le versioni più piccole in ogni fase di addestramento. Inoltre, risulta vantaggioso per la decodifica speculativa poiché il modello bozza è incorporato nel verificatore. I ricercatori hanno dimostrato il loro approccio addestrando sottomodelli da 500M, 1.5B e 3B di parametri, eguagliando le prestazioni dei modelli di base addestrati indipendentemente su compiti benchmark e perplessità, consumando il 36% in meno di calcolo di addestramento e migliorando la produttività della decodifica speculativa del 14-26%. Sono state anche analizzate le principali decisioni architetturali, fornendo spunti per costruire suite Matryoshka efficaci. Questa ricerca è dettagliata in arXiv:2608.09703, presentato il 26 agosto 2026.
Fatti principali
- Il framework di addestramento Matryoshka impila sottomodelli di dimensioni crescenti in un'unica architettura annidata.
- Il framework riduce il numero totale di parametri della suite.
- Consente una distillazione a basso costo dal sottomodello più grande a tutti i sottomodelli più piccoli ad ogni passo di addestramento.
- È particolarmente adatto per la decodifica speculativa poiché il modello bozza è contenuto nel verificatore.
- La suite comprende sottomodelli da 500M, 1.5B e 3B.
- Le prestazioni sono alla pari con i modelli di base addestrati indipendentemente su benchmark e perplessità di validazione e fuori distribuzione.
- Il calcolo di addestramento è ridotto del 36%.
- La produttività della decodifica speculativa è migliorata del 14-26%.
- L'articolo ha analizzato le scelte architetturali chiave.
- L'articolo è disponibile su arXiv con identificativo 2608.09703.
Entità
Istituzioni
- arXiv