ARTFEED — Contemporary Art Intelligence

I dati finali del pre-addestramento influenzano il comportamento del modello dopo SFT

ai-technology · 2026-07-29

Un nuovo studio su arXiv (2607.25063) esamina come l'ultima parte dei dati di pre-addestramento possa influenzare i checkpoint del modello linguistico anche dopo essere stati sottoposti a supervised fine-tuning (SFT). I ricercatori hanno preso un checkpoint parzialmente pre-addestrato e ne hanno creato sei versioni diverse, ciascuna utilizzando un dataset unico di 500 milioni di token. Questi dataset includevano cose come testo web generico e testo di sicurezza. Dopo che tutti sono stati sottoposti allo stesso SFT, hanno scoperto che, sebbene i checkpoint ottenessero punteggi simili nei benchmark, rispondevano in modo diverso a ulteriori compiti di allineamento, come l'ottimizzazione delle preferenze. Ciò suggerisce che gli ultimi dati che i modelli vedono prima dell'addestramento possono influenzare il loro comportamento in modi che le valutazioni tipiche potrebbero non cogliere, sollevando domande su quanto questi checkpoint siano realmente intercambiabili.

Fatti principali

  • Articolo arXiv 2607.25063
  • Sei rami da un checkpoint parzialmente pre-addestrato
  • Ogni ramo addestrato su 500 milioni di token da una singola fonte di dati
  • Fonti di dati: testo web generico, testo web filtrato, discorso normativo, testo di sicurezza, testo matematico, testo educativo sintetico
  • SFT e post-addestramento identici tra i rami
  • I checkpoint hanno performato in modo simile nei benchmark dopo SFT
  • Differenze emerse in risposta a ulteriore allineamento (ottimizzazione delle preferenze)
  • La finestra finale di pre-addestramento influenza il post-addestramento oltre SFT

Entità

Istituzioni

  • arXiv

Fonti