Sampled-BPE: Verifica dei corpora web cinesi per l'inquinamento dei LLM
Uno studio recente pubblicato su arXiv introduce una nuova tecnica di verifica chiamata Sampled-BPE. Questo approccio innovativo mira a identificare la contaminazione all'interno di grandi dataset cinesi comunemente utilizzati nell'addestramento di modelli linguistici di grandi dimensioni (LLM). Campionando una piccola frazione dei dati e impiegando un tokenizer BPE, i ricercatori hanno rilevato efficacemente token inquinati, gestendo le complessità della scala e adattandosi alla natura dinamica dell'inquinamento web. Il metodo ha portato a miglioramenti notevoli, raggiungendo un aumento di velocità di 148,4 volte e riducendo i requisiti di memoria di 35,8 volte, con un tasso di errore di appena il 4,25% nelle valutazioni di più corpora cinesi dal 2021 al 2026.
Fatti principali
- Il documento arXiv:2608.10678 introduce Sampled-BPE, una pipeline di verifica a livello di token per i corpora web cinesi.
- Sampled-BPE campiona un piccolo sottoinsieme e addestra un tokenizer BPE per far emergere token inquinati.
- Gli esperimenti mostrano un aumento di velocità di 148,4 volte e una riduzione della memoria di 35,8 volte con solo il 4,25% di errore relativo.
- La pipeline è stata applicata a 11 corpora cinesi aperti e 6 snapshot di Common Crawl cinesi dal 2021 al 2026.
- La verifica rivela un inquinamento diffuso ma disomogeneo nei corpora aperti.
- Il contenuto web cinese è altamente inquinato e in cambiamento temporale.
- Il documento affronta le sfide di scala, granularità e inquinamento implicito nei corpora web cinesi.
- La ricerca è rilevante per la qualità dei dati di addestramento dei LLM e per la verifica.
Entità
Istituzioni
- arXiv
- Common Crawl
Luoghi
- China