d3LLM: LLM a Diffusione Pseudo-Distillato Bilancia Accuratezza e Parallelismo
Uno studio recente pubblicato su arXiv (2601.07568) presenta d3LLM (Pseudo-Distilled Diffusion Large Language Model), un approccio innovativo volto ad affrontare il dilemma accuratezza-parallelismo nei modelli di linguaggio di grandi dimensioni a diffusione (dLLM). Mentre i dLLM offrono vantaggi come la decodifica parallela e la generazione in ordine casuale rispetto ai LLM autoregressivi (AR), implementare questi vantaggi è spesso problematico. I metodi tradizionali di solito privilegiano l'efficienza o l'accuratezza, ma d3LLM combina innovativamente entrambi utilizzando la distillazione di pseudo-traiettorie nell'addestramento, guidando il modello su quali token decodificare con sicurezza nelle fasi iniziali per migliorare il parallelismo. Per l'inferenza, incorpora la decodifica multi-blocco basata sull'entropia insieme a un meccanismo di aggiornamento della cache KV per garantire un elevato parallelismo senza sacrificare l'accuratezza. Inoltre, l'articolo introduce AUP (Accuracy under Parallelism) come nuova metrica per valutare i dLLM. Questa ricerca è stata categorizzata come tipo replace-cross su arXiv.
Fatti principali
- ID articolo: arXiv:2601.07568v3
- Tipo di annuncio: replace-cross
- Propone d3LLM (Pseudo-Distilled Diffusion Large Language Model)
- Introduce la distillazione di pseudo-traiettorie durante l'addestramento
- Utilizza la decodifica multi-blocco basata sull'entropia con aggiornamento della cache KV durante l'inferenza
- Introduce AUP (Accuracy under Parallelism) come nuova metrica di valutazione
- Affronta il compromesso accuratezza-parallelismo nei LLM a diffusione
- Pubblicato su arXiv
Entità
Istituzioni
- arXiv