La predizione multi-byte accelera i modelli linguistici gerarchici
Un nuovo articolo di ricerca su arXiv (2608.15454) introduce la predizione multi-byte (MBP), un metodo per accelerare l'inferenza nei modelli linguistici gerarchici a livello di byte. Questi modelli, che generano testo byte per byte, sono emersi come una robusta alternativa ai modelli basati su tokenizzazione in sottoparole, ma la loro velocità di inferenza è un collo di bottiglia. MBP genera più byte in parallelo, migliorando la velocità con un impatto minimo sulle prestazioni e senza parametri aggiuntivi. Si basa sulla predizione multi-token (MTP) con due innovazioni chiave: una finestra di predizione a lunghezza variabile allineata con i token latenti (segmenti) del modello gerarchico, e un nuovo schema di mascheramento dell'attenzione che consente la predizione parallela dei byte senza violare la causalità. Gli autori dimostrano che MBP raggiunge un compromesso Pareto-ottimale in compiti generativi tra cui il seguire istruzioni, la risposta a domande, la sintesi e la traduzione automatica. L'articolo è annunciato come una nuova sottomissione ed è disponibile all'URL fornito.
Fatti principali
- L'articolo arXiv:2608.15454 introduce la predizione multi-byte (MBP).
- MBP si rivolge a modelli linguistici gerarchici a livello di byte.
- MBP genera più byte in parallelo per accelerare l'inferenza.
- MBP si basa sul paradigma della predizione multi-token (MTP).
- Due innovazioni: finestra di predizione a lunghezza variabile e schema di mascheramento dell'attenzione.
- MBP mostra un compromesso Pareto-ottimale in molteplici compiti generativi.
- I compiti includono seguire istruzioni, risposta a domande, sintesi e traduzione automatica.
- MBP non richiede parametri aggiuntivi.
Entità
Istituzioni
- arXiv