CuraWeb: Ottimizzazione Congiunta di Qualità, Ridondanza e Diversità per i Dati di Pre-addestramento dei LLM
CuraWeb introduce un approccio innovativo alla cura dei dati di pre-addestramento su scala web, allontanandosi dalla tradizionale potatura lineare verso un metodo che ottimizza congiuntamente qualità, ridondanza e diversità. Questo framework integra una pulizia a doppio binario — sia basata su regole che guidata da modelli — con tecniche di deduplicazione ibride, utilizzando metodi n-gram e semantici. Un campionatore multi-obiettivo garantisce un equilibrio tra qualità informativa e varietà distribuzionale. Applicato a Common Crawl, CuraWeb genera un corpus inglese di 2T token. Questa metodologia supera le carenze di filtri selettivi come FineWeb-Edu e DCLM, che limitano la diversità distribuzionale e trascurano la conoscenza a coda lunga, massimizzando così il potenziale del web aperto. I risultati sono dettagliati in arXiv:2607.22662v1.
Fatti principali
- CuraWeb è un nuovo paradigma di cura per i dati di pre-addestramento dei LLM.
- Ottimizza congiuntamente qualità, ridondanza e diversità.
- Il framework utilizza una pulizia a doppio binario: basata su regole e guidata da modelli.
- La deduplicazione ibrida combina metodi n-gram e semantici.
- Un campionatore multi-obiettivo bilancia qualità e ampiezza distribuzionale.
- CuraWeb è applicato a Common Crawl, producendo un corpus inglese di 2T token.
- Affronta le limitazioni dei filtri FineWeb-Edu e DCLM.
- L'articolo è arXiv:2607.22662v1.
Entità
Istituzioni
- arXiv