Training a Ripetizione Spaziata: Pianificazione Adattiva del Replay per il Pre-Training Continuo dei LLM
L'articolo di ricerca intitolato "When to Review: Spaced Repetition for Continual Pre-Training of Language Models" (arXiv: 2608.17530) introduce il Training a Ripetizione Spaziata (SRT), un framework progettato per l'apprendimento continuo nei grandi modelli linguistici. Affronta il problema di preservare le conoscenze apprese in precedenza mentre si assimilano nuovi dati. A differenza degli approcci tradizionali che si basano su una miscela statica di informazioni vecchie e nuove, SRT tratta il pre-training continuo come una sfida di pianificazione adattiva, impiegando l'algoritmo SuperMemo-2 (SM-2) per organizzare le revisioni degli esempi di training. Tiene traccia degli stati di revisione per ogni esempio e traduce la perplessità in un segnale della qualità del richiamo. Le valutazioni condotte su dataset di Wikipedia e codice indicano che SRT migliora il bilancio stabilità-plasticità rispetto ai metodi standard, sottolineando l'importanza delle strategie di pianificazione della memoria.
Fatti principali
- L'articolo è intitolato "When to Review: Spaced Repetition for Continual Pre-Training of Language Models".
- È disponibile su arXiv con identificativo 2608.17530.
- SRT è un framework di apprendimento continuo ispirato alle scienze cognitive.
- SRT utilizza l'algoritmo SuperMemo-2 (SM-2) per pianificare la ripetizione dei campioni.
- SRT mantiene lo stato di revisione per ogni esempio e mappa la perplessità di ogni esempio in un segnale di qualità del richiamo.
- SRT pianifica esempi storici per la ritenzione e nuovi esempi per il consolidamento.
- SRT lascia invariati modello, obiettivo e ottimizzatore.
- SRT migliora il compromesso stabilità-plasticità sui corpora di Wikipedia e di codice.
- I metodi di replay esistenti ignorano che gli esempi differiscono nella velocità con cui vengono dimenticati.
Entità
Istituzioni
- arXiv
- Wikipedia