ARTFEED — Contemporary Art Intelligence

PANOPTICON: Nuovo Dataset Espone Perdite di Privacy nelle Finestre di Contesto degli LLM

ai-technology · 2026-07-29

I ricercatori hanno introdotto la pipeline e il dataset PANOPTICON per indagare la fuga di privacy nelle finestre di contesto dei modelli linguistici di grandi dimensioni (LLM). Il dataset, generato dal modello Llama-3.1-8B-Instruct di Meta, contiene 67.718 prompt con porzioni di Informazioni Personali Identificabili (PII) derivanti da 9.674 profili utente sintetici pubblicamente disponibili. Ciò affronta la mancanza di un dataset pubblico e autentico di PII a causa di vincoli etici. Lo studio misura la diversità lessicale e S-BERT per valutare il realismo e presenta un caso di studio che dimostra i rischi per la privacy. Il lavoro evidenzia la tensione tra utilità degli LLM e preoccupazioni per la privacy, fornendo uno strumento per quantificare tali rischi.

Fatti principali

  • Pipeline e dataset PANOPTICON introdotti per indagare la fuga di privacy negli LLM
  • Dataset generato dal modello Llama-3.1-8B-Instruct di Meta
  • Contiene 67.718 prompt con porzioni di PII
  • Derivato da 9.674 profili utente sintetici pubblicamente disponibili
  • Misura la diversità lessicale e S-BERT per la valutazione del realismo
  • Include un caso di studio che mostra i rischi per la privacy
  • Affronta la mancanza di un dataset pubblico autentico di PII a causa dell'etica
  • Si concentra sulle PII all'interno della finestra di contesto degli LLM

Entità

Istituzioni

  • Meta
  • arXiv

Fonti