ARTFEED — Contemporary Art Intelligence

Il framework STAR rivela fallimenti di sicurezza dipendenti dallo stato nelle interazioni LLM multi-turno

ai-technology · 2026-07-30

Un nuovo studio da arXiv (paper 2603.15684) introduce STAR, un framework diagnostico orientato allo stato che rivela come i fallimenti di sicurezza nei modelli linguistici di grandi dimensioni emergano dall'evoluzione contestuale dello stato attraverso più turni conversazionali, piuttosto che da prompt isolati. I ricercatori dimostrano che le attuali valutazioni di allineamento della sicurezza, che tipicamente testano query singole, non riescono a catturare le vulnerabilità che emergono con l'accumulo della cronologia del dialogo. STAR tratta la cronologia del dialogo come un operatore di transizione di stato, consentendo un'analisi controllata dell'attraversamento dei confini di sicurezza sotto condizionamento autoregressivo. Il framework fornisce una sonda basata su principi per comprendere come i modelli allineati si comportano lungo le traiettorie di interazione, senza ottimizzare la forza dell'attacco. I risultati evidenziano una lacuna fondamentale nelle metodologie esistenti di allineamento della sicurezza per interazioni multi-turno.

Fatti principali

  • Il paper arXiv 2603.15684 introduce il framework STAR
  • STAR tratta la cronologia del dialogo come un operatore di transizione di stato
  • I fallimenti di sicurezza emergono dall'evoluzione contestuale dello stato in interazioni multi-turno
  • Le attuali valutazioni di allineamento della sicurezza utilizzano query isolate
  • STAR non ottimizza la forza dell'attacco ma sonda l'attraversamento dei confini di sicurezza
  • Lo studio si concentra su modelli linguistici all'avanguardia
  • I jailbreak multi-turno sono empiricamente efficaci ma poco compresi
  • STAR consente un'analisi controllata del comportamento di sicurezza lungo le traiettorie di interazione

Entità

Istituzioni

  • arXiv

Fonti