Decodifica Draft-then-Refine Migliora i Modelli Linguistici a Diffusione
Un nuovo metodo di inferenza chiamato decodifica draft-then-refine migliora le prestazioni dei modelli linguistici a diffusione (DLM) riducendo la latenza. L'approccio, introdotto in un articolo su arXiv, prevede la generazione di una bozza completa di risposta e il suo successivo perfezionamento tramite diffusione bidirezionale. Lo studio valuta due configurazioni: Flash-Flash, in cui lo stesso modello (LLaDA2.1-Flash) funge sia da bozzettista che da perfezionatore, e Mini-Flash, in cui un modello più piccolo (LLaDA2.1-Mini) redige la bozza e Flash la rivede. In Flash-Flash, l'accuratezza su GSM8K-384 è migliorata da 0,848 a 0,899, e su MBPP-384 da 0,545 a 0,693, con una velocità 1,20 volte superiore rispetto alla baseline. La configurazione Mini-Flash, ispirata alla decodifica speculativa, è definita correzione speculativa. L'articolo è disponibile su arXiv:2608.02625.
Fatti principali
- La decodifica draft-then-refine è un pattern di inferenza plug-and-play per i modelli linguistici a diffusione.
- Il metodo genera prima una bozza completa, poi perfeziona l'intera risposta utilizzando la diffusione bidirezionale.
- Vengono valutate due configurazioni: Flash-Flash e Mini-Flash.
- Flash-Flash utilizza LLaDA2.1-Flash sia come bozzettista che come perfezionatore.
- Mini-Flash utilizza LLaDA2.1-Mini come bozzettista e LLaDA2.1-Flash come perfezionatore.
- Flash-Flash migliora l'accuratezza su GSM8K-384 da 0,848 a 0,899.
- Flash-Flash migliora l'accuratezza su MBPP-384 da 0,545 a 0,693.
- Flash-Flash è 1,20 volte più veloce rispetto alla baseline selezionata di Flash block-autoregressive.
- L'articolo è disponibile su arXiv con ID 2608.02625.
Entità
Istituzioni
- arXiv