PANOPTICON: Nuovo Dataset Espone Perdite di Privacy nelle Finestre di Contesto degli LLM
I ricercatori hanno introdotto la pipeline e il dataset PANOPTICON per indagare la fuga di privacy nelle finestre di contesto dei modelli linguistici di grandi dimensioni (LLM). Il dataset, generato dal modello Llama-3.1-8B-Instruct di Meta, contiene 67.718 prompt con porzioni di Informazioni Personali Identificabili (PII) derivanti da 9.674 profili utente sintetici pubblicamente disponibili. Ciò affronta la mancanza di un dataset pubblico e autentico di PII a causa di vincoli etici. Lo studio misura la diversità lessicale e S-BERT per valutare il realismo e presenta un caso di studio che dimostra i rischi per la privacy. Il lavoro evidenzia la tensione tra utilità degli LLM e preoccupazioni per la privacy, fornendo uno strumento per quantificare tali rischi.
Fatti principali
- Pipeline e dataset PANOPTICON introdotti per indagare la fuga di privacy negli LLM
- Dataset generato dal modello Llama-3.1-8B-Instruct di Meta
- Contiene 67.718 prompt con porzioni di PII
- Derivato da 9.674 profili utente sintetici pubblicamente disponibili
- Misura la diversità lessicale e S-BERT per la valutazione del realismo
- Include un caso di studio che mostra i rischi per la privacy
- Affronta la mancanza di un dataset pubblico autentico di PII a causa dell'etica
- Si concentra sulle PII all'interno della finestra di contesto degli LLM
Entità
Istituzioni
- Meta
- arXiv