ARTFEED — Contemporary Art Intelligence

Identificazione Dimostrabile dei Dati di Addestramento per Modelli Linguistici di Grandi Dimensioni

ai-technology · 2026-08-10

È stata introdotta una nuova tecnica nota come Identificazione Dimostrabile dei Dati di Addestramento (PTDI) per individuare in modo affidabile i dati di addestramento di modelli estesi con garanzie statistiche. Questo metodo ridefinisce l'identificazione dei dati di addestramento come una sfida di inferenza a livello di insieme, consentendo un controllo rigoroso sui tassi di falsa identificazione. PTDI calcola i p-value conformali per ogni istanza di dati utilizzando dati noti non visti e introduce uno stimatore di confine Beta corretto con Jackknife (JKBB) per valutare la proporzione di dati di addestramento all'interno del set di test. Utilizzando la procedura Benjamini-Hochberg (BH) sui p-value scalati, identifica un gruppo di punti dati con tassi di errore regolati. Questa ricerca affronta le carenze delle attuali tecniche di identificazione istanza per istanza che mancano di controllo del tasso di errore, essenziale per controversie sul copyright, valutazioni della privacy e valutazioni eque. L'articolo è disponibile su arXiv con l'identificatore 2510.09717.

Fatti principali

  • PTDI è un approccio senza distribuzione per l'identificazione dei dati di addestramento.
  • Fornisce un controllo dimostrabile e rigoroso del tasso di falsa identificazione.
  • Il metodo utilizza p-value conformali e uno stimatore di confine Beta corretto con Jackknife.
  • Applica la procedura Benjamini-Hochberg ai p-value scalati.
  • L'approccio è rilevante per controversie sul copyright, audit della privacy e valutazione equa.
  • L'articolo è disponibile su arXiv (2510.09717).
  • Il metodo affronta i limiti dei metodi di identificazione istanza per istanza.
  • Formalizza l'identificazione dei dati di addestramento come un problema di inferenza a livello di insieme.

Entità

Istituzioni

  • arXiv

Fonti