ARTFEED — Contemporary Art Intelligence

LoRAScan: Rilevamento di Prompt Backdoor in Adattatori a Basso Rango tramite Picchi di Attivazione

ai-technology · 2026-08-10

Uno studio recente pubblicato su arXiv (2608.06795) presenta LoRAScan, una tecnica volta a identificare prompt backdoor in adattatori a basso rango (LoRA) utilizzati in modelli linguistici di grandi dimensioni. Questa sottomissione di tipo cross evidenzia una vulnerabilità nella catena di approvvigionamento in cui adattatori non affidabili possono portare i modelli a produrre output dannosi, come codice malevolo, propaganda politica o pubblicità nascoste, quando attivati da input occulti. Le difese attuali o indeboliscono i segnali backdoor integrando gli adattatori con i modelli base, o gestiscono in modo inadeguato gli adattatori potenzialmente compromessi. LoRAScan rileva firme uniche nello spazio latente, in particolare picchi di attivazione nella proiezione verso il basso, associati a input trigger per identificare adattatori dannosi. Questo metodo è consapevole degli adattatori ed elimina la necessità di una mitigazione separata. Scritto da ricercatori anonimi, l'articolo migliora la sicurezza dell'IA nelle catene di approvvigionamento dei modelli linguistici di grandi dimensioni.

Fatti principali

  • ID dell'articolo: arXiv:2608.06795
  • Tipo di annuncio: cross
  • Titolo: LoRAScan: Rilevamento di Prompt Backdoor in Adattatori a Basso Rango per Modelli Linguistici di Grandi Dimensioni tramite Picchi di Attivazione nella Proiezione verso il Basso
  • Focus: rilevamento di prompt backdoor in adattatori LoRA
  • Minaccia: adattatori non affidabili possono causare output dannosi
  • Difese esistenti: i metodi agnostici e consapevoli degli adattatori hanno limitazioni
  • LoRAScan utilizza picchi di attivazione nella proiezione verso il basso come firma
  • Pubblicato su arXiv (URL sorgente: https://arxiv.org/abs/2608.06795)

Entità

Istituzioni

  • arXiv

Fonti