ARTFEED — Contemporary Art Intelligence

Sondare gli Stati Nascosti Rivela l'Esposizione Indiretta all'Iniezione di Prompt negli LLM Agentici

ai-technology · 2026-08-06

Un recente preprint su arXiv (2608.02657) esplora come i modelli linguistici di grandi dimensioni (LLM) agentici rispondono agli attacchi di iniezione indiretta di prompt (IPI), un fenomeno denominato 'esposizione IPI'. La ricerca, che ha esaminato sei modelli, incluso il GLM-5.2 con 753 miliardi di parametri, rivela che semplici sonde lineari addestrate sugli stati nascosti prima della generazione possono raggiungere oltre il 90% di AUROC nel prevedere attacchi IPI non visti, istruzioni per agenti e suite di compiti. Queste sonde mantengono una robustezza significativa contro attacchi adattivi e in contesti multilingue. Inoltre, lo studio scopre un 'divario riconoscimento-azione' tramite metriche di catena di pensiero (CoT), indicando che mentre i modelli possono rilevare i segnali di esposizione IPI, spesso non agiscono in modo sicuro. Per mitigare questo problema, gli autori propongono AGRI, un meccanismo di difesa che incorpora un passaggio di ragionamento prima della generazione, attivato dal rilevamento della sonda. Questo articolo è classificato come cross-submission ed è accessibile su arXiv, sottolineando l'importanza di monitorare gli stati interni per rafforzare la sicurezza degli LLM contro gli attacchi IPI.

Fatti principali

  • L'articolo è intitolato 'Your Agentic LLMs Secretly Encode Latent Signals of Indirect Prompt-Injection Exposure.'
  • È un preprint arXiv con identificatore 2608.02657.
  • Lo studio copre sei modelli, incluso GLM-5.2 con 753 miliardi di parametri.
  • Le sonde lineari addestrate sugli stati nascosti pre-generazione prevedono l'esposizione IPI con oltre il 90% di AUROC.
  • Le sonde sono robuste sotto attacchi adattivi e in contesti multilingue.
  • Viene identificato un divario riconoscimento-azione: i modelli codificano segnali ma non agiscono in modo sicuro.
  • AGRI è introdotto come difesa basata sul ragionamento e controllata da sonda.
  • La difesa antepone un passaggio di ragionamento prima della generazione, controllato dal rilevamento della sonda.

Entità

Istituzioni

  • arXiv

Fonti