CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for LLM Pretraining Data
CuraWeb introduces a novel approach to web-scale pretraining data curation, moving away from traditional linear pruning towards a method that jointly optimizes quality, redundancy, and diversity. This framework integrates dual-track cleaning—both rule-based and model-driven—with hybrid deduplication techniques, utilizing n-gram and semantic methods. A multi-objective sampler ensures a balance between informational quality and distributional variety. When applied to Common Crawl, CuraWeb generates a 2T-token English corpus. This methodology overcomes the shortcomings of selective filters such as FineWeb-Edu and DCLM, which limit distributional diversity and overlook long-tail knowledge, thereby maximizing the potential of the open web. The findings are detailed in arXiv:2607.22662v1.
Key facts
- CuraWeb is a new curation paradigm for LLM pretraining data.
- It jointly optimizes quality, redundancy, and diversity.
- The framework uses dual-track cleaning: rule-based and model-driven.
- Hybrid deduplication combines n-gram and semantic methods.
- A multi-objective sampler balances quality with distributional breadth.
- CuraWeb is applied to Common Crawl, producing a 2T-token English corpus.
- It addresses limitations of FineWeb-Edu and DCLM filters.
- The paper is arXiv:2607.22662v1.
Entities
Institutions
- arXiv