ARTFEED — Contemporary Art Intelligence

L'Activation Watermarking protegge gli LLM da attacchi adattivi

ai-technology · 2026-07-30

I ricercatori propongono l'Activation Watermarking (AWM), un metodo per proteggere il monitoraggio degli LLM da attaccanti adattivi che possiedono copie locali e possono cercare offline prompt che innescano risposte dannose eludendo il rilevamento. L'AWM randomizza il monitoraggio ottimizzando l'LLM in modo che i suoi stati nascosti si allineino con una direzione derivata da una chiave segreta ogni volta che una risposta viola la policy. Il rilevamento si basa su un test di similarità delle attivazioni già calcolate dal provider. Gli attaccanti che conoscono tutto tranne la chiave devono ottimizzare contro rilevatori surrogati con chiavi diverse. L'approccio mantiene i tassi di rilevamento per gli utenti non adattivi mentre resiste all'evasione adattiva. Il paper è disponibile su arXiv con ID 2603.23171.

Fatti principali

  • ID arXiv: 2603.23171
  • Tipo di annuncio: replace-cross
  • Metodo proposto: Activation Watermarking (AWM)
  • L'AWM utilizza un fine-tuning limitato per allineare gli stati nascosti con una direzione derivata da una chiave segreta
  • Il rilevamento è un test di similarità sulle attivazioni
  • Gli attaccanti adattivi hanno copie locali e possono cercare offline
  • Gli attaccanti devono ottimizzare contro rilevatori surrogati con chiavi diverse
  • L'AWM mantiene i tassi di rilevamento per gli utenti non adattivi

Entità

Istituzioni

  • arXiv

Fonti