MAFIA: Nuovo Framework di Attacco alla Memoria Solo-Query Prende di Mira gli Agenti LLM Sottoposti a Audit
Un nuovo articolo di ricerca su arXiv (2608.03844) introduce MAFIA, un framework di attacco alla memoria solo-query progettato per compromettere gli agenti di modelli linguistici di grandi dimensioni (LLM) con memoria aumentata. Il framework affronta i limiti degli attacchi solo-query esistenti, che spesso falliscono in contesti realistici che coinvolgono pool di memoria benigni su larga scala e audit attivi degli input. MAFIA impiega una strategia di posizionamento che garantisce un'iniezione competitiva per il recupero attraverso il probing della memoria, l'allocazione del budget e la pianificazione, insieme a un design del payload che bypassa gli audit utilizzando rivestimenti fattuali compatti. La ricerca evidenzia la superficie di attacco persistente dei moduli di memoria negli agenti LLM e sottolinea la necessità di difese robuste. L'articolo è stato annunciato come nuova sottomissione su arXiv.
Fatti principali
- MAFIA è un framework di attacco alla memoria solo-query per agenti LLM.
- Prende di mira agenti LLM con memoria aumentata che si affidano a un contesto ricco per il ragionamento.
- Gli attacchi solo-query esistenti falliscono in pool di memoria benigni su larga scala e con audit attivi degli input.
- MAFIA introduce una strategia di posizionamento che utilizza probing della memoria, allocazione del budget e pianificazione.
- Utilizza rivestimenti fattuali compatti nel design del payload per bypassare gli audit.
- L'articolo è disponibile su arXiv con ID 2608.03844.
- La superficie di attacco dei moduli di memoria è evidenziata come persistente.
- La ricerca sottolinea la necessità di studiare le minacce di avvelenamento della memoria.
Entità
Istituzioni
- arXiv