ARTFEED — Contemporary Art Intelligence

CuraWeb: Ottimizzazione Congiunta di Qualità, Ridondanza e Diversità per i Dati di Pre-addestramento dei LLM

ai-technology · 2026-07-29

CuraWeb introduce un approccio innovativo alla cura dei dati di pre-addestramento su scala web, allontanandosi dalla tradizionale potatura lineare verso un metodo che ottimizza congiuntamente qualità, ridondanza e diversità. Questo framework integra una pulizia a doppio binario — sia basata su regole che guidata da modelli — con tecniche di deduplicazione ibride, utilizzando metodi n-gram e semantici. Un campionatore multi-obiettivo garantisce un equilibrio tra qualità informativa e varietà distribuzionale. Applicato a Common Crawl, CuraWeb genera un corpus inglese di 2T token. Questa metodologia supera le carenze di filtri selettivi come FineWeb-Edu e DCLM, che limitano la diversità distribuzionale e trascurano la conoscenza a coda lunga, massimizzando così il potenziale del web aperto. I risultati sono dettagliati in arXiv:2607.22662v1.

Fatti principali

  • CuraWeb è un nuovo paradigma di cura per i dati di pre-addestramento dei LLM.
  • Ottimizza congiuntamente qualità, ridondanza e diversità.
  • Il framework utilizza una pulizia a doppio binario: basata su regole e guidata da modelli.
  • La deduplicazione ibrida combina metodi n-gram e semantici.
  • Un campionatore multi-obiettivo bilancia qualità e ampiezza distribuzionale.
  • CuraWeb è applicato a Common Crawl, producendo un corpus inglese di 2T token.
  • Affronta le limitazioni dei filtri FineWeb-Edu e DCLM.
  • L'articolo è arXiv:2607.22662v1.

Entità

Istituzioni

  • arXiv

Fonti