Rilevamento Precoce di Backdoor Distribuite in Sistemi Multi-Agente LLM
Uno studio recente pubblicato su arXiv (2607.24893) esamina gli attacchi backdoor distribuiti mirati ai sistemi multi-agente LLM. In questo scenario, uno strumento compromesso nasconde segmenti crittografati tra gli agenti, che vengono ricostruiti dopo l'esecuzione. I controlli di sicurezza effettuati ad ogni passo non rivelano l'intero payload. La ricerca sviluppa un esempio funzionale all'interno di un framework multi-agente gerarchico, valutando cinque modelli linguistici in due domini di attività. Rilevare l'attacco è una sfida che deve avvenire prima che il frammento iniziale venga introdotto, poiché sia le esecuzioni attaccate che quelle benigne appaiono identiche. Lo studio esplora anche il rilevamento precoce durante l'esecuzione in corso e la resilienza del sistema quando gli indizi vengono rimossi.
Fatti principali
- Il paper arXiv 2607.24893 caratterizza gli attacchi backdoor distribuiti sui sistemi multi-agente LLM.
- Uno strumento avvelenato nasconde frammenti crittografati nelle osservazioni, diffondendoli tra gli agenti.
- Un passaggio esterno riassembla ed esegue il payload dopo l'esecuzione.
- I controlli di sicurezza per passo non riescono a riconoscere il payload distribuito completo.
- Lo studio costruisce un'istanza funzionante su un sistema multi-agente gerarchico.
- I test sono condotti su cinque modelli linguistici e due domini di attività.
- Il rilevamento è una corsa contro l'assemblaggio; prima della prima iniezione, le esecuzioni attaccate e benigne sono indistinguibili.
- La ricerca indaga il rilevamento precoce durante l'esecuzione in corso e la robustezza quando gli indizi vengono rimossi.
Entità
Istituzioni
- arXiv