Retrofit della Profondità Ricorrente nei Modelli Linguistici Pre-addestrati: Una Nuova Tecnica di IA
Uno studio recente pubblicato su arXiv (2608.11233) introduce una tecnica per migliorare un modello linguistico denso e pre-addestrato incorporando profondità ricorrente, permettendogli di cogliere una transizione latente iterativa che rimane efficace anche dopo un annealing basato solo sui risultati. La ricerca utilizza Qwen2.5-0.5B-Instruct, dividendolo in tre componenti: un Preludio, un Blocco Ricorrente a pesi condivisi e una Coda, con un percorso a ciclo singolo che preserva l'identità e un ponte di rientro per i cicli successivi. Nel ciclo 1, il retrofit si comporta in modo comparabile alla base su una batteria ARC preregistrata. Questo meccanismo adattabile opera come un processo riutilizzabile piuttosto che come una ricerca di risposta finale, funzionando con due budget di parametri: 6M di parametri addestrati con pesi base congelati e 180M per il blocco completo. Con supervisione ai passi intermedi, il modello esegue un passo di compito per ciclo, mantenendo le prestazioni quando vengono valutate solo le risposte finali. L'adattatore ha raggiunto una precisione complessiva dell'83,8% rispetto all'84,0% del blocco completo, eccellendo alla profondità 11 ma perdendo terreno successivamente. La messa a punto verbale ha prodotto il 79-86% su output verbali controllati, con un trasferimento zero-shot minimo. La classificazione dell'articolo come cross-type su arXiv suggerisce la sua potenziale importanza in vari domini dell'IA, contribuendo ai progressi nella tecnologia dell'IA migliorando i modelli linguistici pre-addestrati attraverso potenziamenti architetturali.
Fatti principali
- L'articolo è disponibile su arXiv con ID 2608.11233.
- Il metodo adatta un modello linguistico pre-addestrato con profondità ricorrente.
- Il modello utilizzato è Qwen2.5-0.5B-Instruct.
- Il retrofit è suddiviso in Preludio, Blocco Ricorrente e Coda.
- Due budget di parametri: 6M di parametri addestrati e 180M per il blocco completo.
- L'adattatore ha eguagliato il blocco completo complessivamente (83,8% vs 84,0%).
- La messa a punto verbale ha raggiunto il 79-86% su resi verbali controllati.
- Il tipo di annuncio è cross.
Entità
Istituzioni
- arXiv