ARTFEED — Contemporary Art Intelligence

Sampled-BPE: Verifica dei corpora web cinesi per l'inquinamento dei LLM

ai-technology · 2026-08-13

Uno studio recente pubblicato su arXiv introduce una nuova tecnica di verifica chiamata Sampled-BPE. Questo approccio innovativo mira a identificare la contaminazione all'interno di grandi dataset cinesi comunemente utilizzati nell'addestramento di modelli linguistici di grandi dimensioni (LLM). Campionando una piccola frazione dei dati e impiegando un tokenizer BPE, i ricercatori hanno rilevato efficacemente token inquinati, gestendo le complessità della scala e adattandosi alla natura dinamica dell'inquinamento web. Il metodo ha portato a miglioramenti notevoli, raggiungendo un aumento di velocità di 148,4 volte e riducendo i requisiti di memoria di 35,8 volte, con un tasso di errore di appena il 4,25% nelle valutazioni di più corpora cinesi dal 2021 al 2026.

Fatti principali

  • Il documento arXiv:2608.10678 introduce Sampled-BPE, una pipeline di verifica a livello di token per i corpora web cinesi.
  • Sampled-BPE campiona un piccolo sottoinsieme e addestra un tokenizer BPE per far emergere token inquinati.
  • Gli esperimenti mostrano un aumento di velocità di 148,4 volte e una riduzione della memoria di 35,8 volte con solo il 4,25% di errore relativo.
  • La pipeline è stata applicata a 11 corpora cinesi aperti e 6 snapshot di Common Crawl cinesi dal 2021 al 2026.
  • La verifica rivela un inquinamento diffuso ma disomogeneo nei corpora aperti.
  • Il contenuto web cinese è altamente inquinato e in cambiamento temporale.
  • Il documento affronta le sfide di scala, granularità e inquinamento implicito nei corpora web cinesi.
  • La ricerca è rilevante per la qualità dei dati di addestramento dei LLM e per la verifica.

Entità

Istituzioni

  • arXiv
  • Common Crawl

Luoghi

  • China

Fonti