ARTFEED — Contemporary Art Intelligence

Studio Meccanicistico Rivela un Circuito di Sicurezza Universale per le Lingue in un Modello AI Multilingue

ai-technology · 2026-08-11

Uno studio recente pubblicato su arXiv (2608.08032) esplora le ragioni per cui i modelli AI multilingue non riescono a rifiutare richieste dannose in lingue meno diffuse, anche quando sono allineati in inglese. La ricerca si concentra su sarvam, un modello di ragionamento multilingue indico a miscela di esperti (MoE). Si è scoperto che il problema non è la rilevazione del danno; invece, il modello rappresenta il danno come una direttiva interna che rimane in gran parte coerente tra le lingue (coseno inglese-indico ≈0.9 a L11). Tuttavia, la direzione di rilevazione è separata dal meccanismo che genera il rifiuto, che avviene più avanti nel processo. Questa generazione è collegata a un circuito specifico: uno scrittore a miscela di esperti regolato da un oppositore di attenzione. Gli autori valutano vari metodi di intervento su questo circuito, concludendo che ridurre l'influenza dell'oppositore è sia economico che efficace, mentre potenziare lo scrittore è fattibile ma più costoso. Questa ricerca fa luce sui meccanismi alla base delle lacune di sicurezza cross-linguistiche e suggerisce strategie pratiche per allineare meglio i modelli multilingue.

Fatti principali

  • Il documento arXiv:2608.08032 esamina il rifiuto cross-linguistico nel modello MoE multilingue sarvam.
  • La rilevazione del danno è invariante rispetto alla lingua negli strati intermedi della rete (coseno ≈0.9 a L11).
  • La scrittura del rifiuto avviene in ritardo e viene assemblata durante la generazione, non in un singolo passaggio in avanti.
  • Un circuito localizzabile: uno scrittore a miscela di esperti e un oppositore di attenzione controllano il rifiuto.
  • Smorzare l'oppositore è un intervento economico ed efficace.
  • Amplificare lo scrittore è anche efficace ma più costoso.
  • Lo studio si concentra sulle lingue indiche e sull'inglese.
  • I risultati potrebbero migliorare l'allineamento della sicurezza nei modelli multilingue.

Entità

Istituzioni

  • arXiv

Fonti