Decodifica Speculativa Approssimata: Un Nuovo Verificatore per un'Inferenza LLM più Veloce
Un recente articolo su arXiv presenta la Decodifica Speculativa Approssimata (ASD), un verificatore che non richiede addestramento e mira a migliorare la velocità di generazione autoregressiva nei grandi modelli linguistici. A differenza della decodifica speculativa convenzionale, che controlla un blocco di bozza contro un modello target in parallelo ma si ferma al primo token che diverge dall'argmax del target, ASD impiega un approccio di selezione del prefisso più lungo con budget. Consente alcune discrepanze basate su un gate di rimpianto logit-target locale, un limite alle eccezioni per blocco e un budget di rimpianto sostenuto a livello di richiesta. Questa innovazione consente il riutilizzo di un suffisso target-greedy contiguo senza bisogno di decisioni approssimative extra o passaggi in avanti del modello target. Non è necessario alcun nuovo modello di bozza, rendendolo un miglioramento prezioso per gli attuali sistemi di inferenza. L'articolo è disponibile su arXiv con l'identificatore 2608.03447.
Fatti principali
- ASD è un verificatore senza addestramento per la decodifica speculativa.
- Utilizza la selezione del prefisso più lungo con budget invece del troncamento binario al primo disallineamento.
- ASD accetta discrepanze basate su un gate di rimpianto logit-target locale, un limite alle eccezioni per blocco e un budget di rimpianto a livello di richiesta.
- Riutilizza suffissi target-greedy contigui senza passaggi aggiuntivi del modello target.
- Non è richiesto alcun nuovo modello di bozza.
- L'articolo è pubblicato su arXiv con ID 2608.03447.
- Il metodo accelera la generazione autoregressiva.
- L'approccio è descritto nell'abstract dell'articolo.
Entità
Istituzioni
- arXiv