Iniezione di Prompt Visiva Impercettibile Minaccia i LLM Multimodali Commerciali
Uno studio recente pubblicato su arXiv (ID: 2603.29418) presenta una nuova tecnica per l'iniezione di prompt visiva occulta rivolta ai modelli linguistici multimodali (MLLM) commerciali. A differenza dei metodi tradizionali che dipendono da testo o immagini visibili, questa strategia incorpora discretamente istruzioni dannose all'interno del contenuto visivo. Utilizza una sovrapposizione di testo limitata per la direzione semantica, mentre ottimizza iterativamente un'alterazione visiva impercettibile per sincronizzare la rappresentazione delle caratteristiche dell'immagine target con obiettivi visivi e testuali dannosi a diversi livelli di dettaglio. Il target visivo si manifesta come un'immagine renderizzata con testo, e l'attacco si svolge in fasi. Questa ricerca rivela una vulnerabilità critica di sicurezza nei MLLM, che sono sempre più utilizzati in scenari pratici. Questo articolo è una versione aggiornata (replace-cross) della sottomissione iniziale, riflettendo miglioramenti continui ed enfatizzando l'urgente necessità di difese robuste contro tali minacce occulte nei sistemi di intelligenza artificiale.
Fatti principali
- ID dell'articolo: arXiv:2603.29418
- Tipo di annuncio: replace-cross
- Focus: iniezione di prompt visiva impercettibile contro MLLM closed-source
- Metodo: incorporamento adattivo del prompt dannoso tramite sovrapposizione di testo limitata
- Ottimizzazione: perturbazione iterativa che allinea le rappresentazioni delle caratteristiche a livelli grossolani e fini
- Target visivo: immagine renderizzata con testo
- Minaccia: il comportamento di seguire le istruzioni dei MLLM è vulnerabile all'iniezione di prompt
- Contesto: i MLLM sono sempre più implementati in applicazioni del mondo reale
Entità
Istituzioni
- arXiv