Perdita di Istruzioni di Sistema nei LLM tramite Attacchi di Codifica: Quadro di Valutazione
Un articolo arXiv (2604.01039v4) presenta un quadro di valutazione automatizzata progettato per valutare la riservatezza delle istruzioni di sistema nei Large Language Models (LLM) quando le richieste di estrazione vengono riformulate come compiti di output strutturato o di codifica. Le istruzioni di sistema svolgono un ruolo cruciale nell'implementazione dei protocolli di sicurezza, nel modellare il comportamento degli agenti e nella salvaguardia di contesti operativi sensibili nelle applicazioni di intelligenza artificiale, spesso contenendo dati critici come chiavi API, linee guida interne e definizioni di flussi di lavoro riservati. L'articolo identifica la perdita di istruzioni di sistema come una minaccia significativa per la sicurezza, come evidenziato nell'OWASP Top 10 per le applicazioni LLM. Il quadro testa sette modelli prevalenti e 46 istruzioni di sistema validate per valutare la loro suscettibilità agli attacchi di estrazione basati su codifica, con l'obiettivo di migliorare le strategie di sicurezza dei LLM.
Fatti principali
- L'articolo arXiv 2604.01039v4 introduce un quadro di valutazione automatizzata per testare la riservatezza delle istruzioni di sistema nei LLM.
- Il quadro testa l'estrazione tramite compiti di codifica o output strutturato.
- Le istruzioni di sistema possono contenere dati sensibili come credenziali API, politiche interne e definizioni di flussi di lavoro privilegiati.
- La perdita di istruzioni di sistema è un rischio di sicurezza critico evidenziato nell'OWASP Top 10 per le applicazioni LLM.
- Molte applicazioni LLM si affidano a istruzioni basate sul rifiuto per bloccare richieste dirette.
- Il quadro valuta sette modelli comuni e 46 istruzioni di sistema verificate.
- L'articolo mira a informare le strategie di rafforzamento per le istruzioni di sistema dei LLM.
- L'articolo è disponibile su arXiv all'URL https://arxiv.org/abs/2604.01039.
Entità
Istituzioni
- arXiv
- OWASP