Dirottamento Convergente con Deviazione: Nuovo Attacco alla Selezione delle Competenze degli Agenti LLM
Un nuovo articolo di ricerca su arXiv (2608.12273v1) introduce il Dirottamento Convergente con Deviazione (CDH), un attacco testuale, indipendente dal runtime, che mira agli agenti LLM che si affidano a competenze di terze parti. L'attacco sfrutta il design a divulgazione progressiva di tali agenti, che utilizzano descrizioni in linguaggio naturale per la selezione delle competenze e corpi di istruzioni per la pianificazione. Il CDH accoppia due punti di controllo sequenziali: una descrizione statica della competenza stabilisce la rilevanza durante la selezione, mentre un corpo allineato fabbrica dipendenze plausibili durante la pianificazione. Ciò consente a un coordinatore controllato dall'attaccante di essere attratto insieme a competenze legittime, reclutando competenze benigne non necessarie in una deviazione limitata, e poi ri-... (troncato a causa della fonte interrotta). L'articolo evidenzia che i lavori precedenti hanno studiato separatamente la manipolazione della selezione, le istruzioni dannose delle competenze e l'amplificazione delle risorse della catena di strumenti, lasciando poco chiara la loro composizione end-to-end. Il CDH affronta questa lacuna combinando queste fasi sotto una copertura semantica condivisa. La ricerca è rilevante per la sicurezza dei sistemi di intelligenza artificiale, in particolare mentre gli agenti LLM diventano sempre più diffusi in varie applicazioni.
Fatti principali
- L'articolo introduce il Dirottamento Convergente con Deviazione (CDH), un attacco testuale, indipendente dal runtime, contro gli agenti LLM.
- Il CDH mira agli agenti LLM che utilizzano competenze di terze parti con descrizioni in linguaggio naturale per la selezione e corpi di istruzioni per la pianificazione.
- L'attacco sfrutta due punti di controllo sequenziali: la descrizione della competenza e il corpo delle istruzioni.
- Il CDH combina la manipolazione della selezione e l'amplificazione delle risorse, che in precedenza erano studiate separatamente.
- L'attacco attira un coordinatore controllato dall'attaccante insieme a competenze legittime.
- Recluta competenze benigne non necessarie in una deviazione limitata.
- L'articolo è disponibile su arXiv con ID 2608.12273v1.
- La ricerca affronta una lacuna nella comprensione della composizione end-to-end degli attacchi agli agenti LLM.
Entità
Istituzioni
- arXiv