ARTFEED — Contemporary Art Intelligence

Decodifica Draft-then-Refine Migliora i Modelli Linguistici a Diffusione

ai-technology · 2026-08-06

Un nuovo metodo di inferenza chiamato decodifica draft-then-refine migliora le prestazioni dei modelli linguistici a diffusione (DLM) riducendo la latenza. L'approccio, introdotto in un articolo su arXiv, prevede la generazione di una bozza completa di risposta e il suo successivo perfezionamento tramite diffusione bidirezionale. Lo studio valuta due configurazioni: Flash-Flash, in cui lo stesso modello (LLaDA2.1-Flash) funge sia da bozzettista che da perfezionatore, e Mini-Flash, in cui un modello più piccolo (LLaDA2.1-Mini) redige la bozza e Flash la rivede. In Flash-Flash, l'accuratezza su GSM8K-384 è migliorata da 0,848 a 0,899, e su MBPP-384 da 0,545 a 0,693, con una velocità 1,20 volte superiore rispetto alla baseline. La configurazione Mini-Flash, ispirata alla decodifica speculativa, è definita correzione speculativa. L'articolo è disponibile su arXiv:2608.02625.

Fatti principali

  • La decodifica draft-then-refine è un pattern di inferenza plug-and-play per i modelli linguistici a diffusione.
  • Il metodo genera prima una bozza completa, poi perfeziona l'intera risposta utilizzando la diffusione bidirezionale.
  • Vengono valutate due configurazioni: Flash-Flash e Mini-Flash.
  • Flash-Flash utilizza LLaDA2.1-Flash sia come bozzettista che come perfezionatore.
  • Mini-Flash utilizza LLaDA2.1-Mini come bozzettista e LLaDA2.1-Flash come perfezionatore.
  • Flash-Flash migliora l'accuratezza su GSM8K-384 da 0,848 a 0,899.
  • Flash-Flash migliora l'accuratezza su MBPP-384 da 0,545 a 0,693.
  • Flash-Flash è 1,20 volte più veloce rispetto alla baseline selezionata di Flash block-autoregressive.
  • L'articolo è disponibile su arXiv con ID 2608.02625.

Entità

Istituzioni

  • arXiv

Fonti