AdaMTP: Paradigma di Addestramento Adattivo per la Predizione Multi-Token
È stato sviluppato un nuovo framework di addestramento adattivo, noto come AdaMTP, per la Predizione Multi-Token (MTP) all'interno di modelli linguistici di grandi dimensioni. MTP potenzia un backbone comune aggiungendo teste ausiliarie che consentono la previsione simultanea di più token futuri, migliorando così la supervisione e accelerando l'inferenza. I modelli attuali, tuttavia, utilizzano un orizzonte di previsione statico, trascurando la diversa densità informativa presente nel linguaggio naturale e nel codice. Questa limitazione costringe le teste ausiliarie a fare previsioni attraverso confini semantici complessi, introducendo rumore disturbante che ostacola le funzioni essenziali. AdaMTP affronta questo problema adattando l'orizzonte di previsione alla prevedibilità intrinseca della sequenza, impiegando una tecnica di segmentazione basata sull'entropia che utilizza il modello di base. La ricerca è disponibile su arXiv con l'identificatore 2608.00434.
Fatti principali
- AdaMTP è un paradigma di addestramento adattivo per la Predizione Multi-Token (MTP).
- MTP potenzia un backbone condiviso di modelli linguistici di grandi dimensioni con teste ausiliarie.
- I framework di addestramento esistenti utilizzano un orizzonte di previsione a lunghezza fissa.
- Gli orizzonti fissi ignorano la densità informativa non uniforme nel linguaggio e nel codice.
- Prevedere attraverso confini semantici ad alta entropia inietta segnali di addestramento rumorosi.
- AdaMTP allinea dinamicamente l'orizzonte di previsione con la prevedibilità della sequenza.
- Un algoritmo di segmentazione basato sull'entropia rileva la prevedibilità.
- Articolo disponibile su arXiv:2608.00434.
Entità
Istituzioni
- arXiv