ARTFEED — Contemporary Art Intelligence

Dirottamento Convergente con Deviazione: Nuovo Attacco alla Selezione delle Competenze degli Agenti LLM

ai-technology · 2026-08-13

Un nuovo articolo di ricerca su arXiv (2608.12273v1) introduce il Dirottamento Convergente con Deviazione (CDH), un attacco testuale, indipendente dal runtime, che mira agli agenti LLM che si affidano a competenze di terze parti. L'attacco sfrutta il design a divulgazione progressiva di tali agenti, che utilizzano descrizioni in linguaggio naturale per la selezione delle competenze e corpi di istruzioni per la pianificazione. Il CDH accoppia due punti di controllo sequenziali: una descrizione statica della competenza stabilisce la rilevanza durante la selezione, mentre un corpo allineato fabbrica dipendenze plausibili durante la pianificazione. Ciò consente a un coordinatore controllato dall'attaccante di essere attratto insieme a competenze legittime, reclutando competenze benigne non necessarie in una deviazione limitata, e poi ri-... (troncato a causa della fonte interrotta). L'articolo evidenzia che i lavori precedenti hanno studiato separatamente la manipolazione della selezione, le istruzioni dannose delle competenze e l'amplificazione delle risorse della catena di strumenti, lasciando poco chiara la loro composizione end-to-end. Il CDH affronta questa lacuna combinando queste fasi sotto una copertura semantica condivisa. La ricerca è rilevante per la sicurezza dei sistemi di intelligenza artificiale, in particolare mentre gli agenti LLM diventano sempre più diffusi in varie applicazioni.

Fatti principali

  • L'articolo introduce il Dirottamento Convergente con Deviazione (CDH), un attacco testuale, indipendente dal runtime, contro gli agenti LLM.
  • Il CDH mira agli agenti LLM che utilizzano competenze di terze parti con descrizioni in linguaggio naturale per la selezione e corpi di istruzioni per la pianificazione.
  • L'attacco sfrutta due punti di controllo sequenziali: la descrizione della competenza e il corpo delle istruzioni.
  • Il CDH combina la manipolazione della selezione e l'amplificazione delle risorse, che in precedenza erano studiate separatamente.
  • L'attacco attira un coordinatore controllato dall'attaccante insieme a competenze legittime.
  • Recluta competenze benigne non necessarie in una deviazione limitata.
  • L'articolo è disponibile su arXiv con ID 2608.12273v1.
  • La ricerca affronta una lacuna nella comprensione della composizione end-to-end degli attacchi agli agenti LLM.

Entità

Istituzioni

  • arXiv

Fonti