I dati finali del pre-addestramento influenzano il comportamento del modello dopo SFT
Un nuovo studio su arXiv (2607.25063) esamina come l'ultima parte dei dati di pre-addestramento possa influenzare i checkpoint del modello linguistico anche dopo essere stati sottoposti a supervised fine-tuning (SFT). I ricercatori hanno preso un checkpoint parzialmente pre-addestrato e ne hanno creato sei versioni diverse, ciascuna utilizzando un dataset unico di 500 milioni di token. Questi dataset includevano cose come testo web generico e testo di sicurezza. Dopo che tutti sono stati sottoposti allo stesso SFT, hanno scoperto che, sebbene i checkpoint ottenessero punteggi simili nei benchmark, rispondevano in modo diverso a ulteriori compiti di allineamento, come l'ottimizzazione delle preferenze. Ciò suggerisce che gli ultimi dati che i modelli vedono prima dell'addestramento possono influenzare il loro comportamento in modi che le valutazioni tipiche potrebbero non cogliere, sollevando domande su quanto questi checkpoint siano realmente intercambiabili.
Fatti principali
- Articolo arXiv 2607.25063
- Sei rami da un checkpoint parzialmente pre-addestrato
- Ogni ramo addestrato su 500 milioni di token da una singola fonte di dati
- Fonti di dati: testo web generico, testo web filtrato, discorso normativo, testo di sicurezza, testo matematico, testo educativo sintetico
- SFT e post-addestramento identici tra i rami
- I checkpoint hanno performato in modo simile nei benchmark dopo SFT
- Differenze emerse in risposta a ulteriore allineamento (ottimizzazione delle preferenze)
- La finestra finale di pre-addestramento influenza il post-addestramento oltre SFT
Entità
Istituzioni
- arXiv