ARTFEED — Contemporary Art Intelligence

La predizione multi-byte accelera i modelli linguistici gerarchici

ai-technology · 2026-08-18

Un nuovo articolo di ricerca su arXiv (2608.15454) introduce la predizione multi-byte (MBP), un metodo per accelerare l'inferenza nei modelli linguistici gerarchici a livello di byte. Questi modelli, che generano testo byte per byte, sono emersi come una robusta alternativa ai modelli basati su tokenizzazione in sottoparole, ma la loro velocità di inferenza è un collo di bottiglia. MBP genera più byte in parallelo, migliorando la velocità con un impatto minimo sulle prestazioni e senza parametri aggiuntivi. Si basa sulla predizione multi-token (MTP) con due innovazioni chiave: una finestra di predizione a lunghezza variabile allineata con i token latenti (segmenti) del modello gerarchico, e un nuovo schema di mascheramento dell'attenzione che consente la predizione parallela dei byte senza violare la causalità. Gli autori dimostrano che MBP raggiunge un compromesso Pareto-ottimale in compiti generativi tra cui il seguire istruzioni, la risposta a domande, la sintesi e la traduzione automatica. L'articolo è annunciato come una nuova sottomissione ed è disponibile all'URL fornito.

Fatti principali

  • L'articolo arXiv:2608.15454 introduce la predizione multi-byte (MBP).
  • MBP si rivolge a modelli linguistici gerarchici a livello di byte.
  • MBP genera più byte in parallelo per accelerare l'inferenza.
  • MBP si basa sul paradigma della predizione multi-token (MTP).
  • Due innovazioni: finestra di predizione a lunghezza variabile e schema di mascheramento dell'attenzione.
  • MBP mostra un compromesso Pareto-ottimale in molteplici compiti generativi.
  • I compiti includono seguire istruzioni, risposta a domande, sintesi e traduzione automatica.
  • MBP non richiede parametri aggiuntivi.

Entità

Istituzioni

  • arXiv

Fonti