Revisione Sistematica Rileva che l'Allineamento di Sicurezza dei LLM è Debole nelle Lingue a Basse Risorse
Una recente revisione della letteratura disponibile su arXiv esamina le sfide affrontate dai modelli linguistici di grandi dimensioni (LLM) riguardo all'allineamento di sicurezza in ambienti multilingue e a basse risorse. Utilizzando il quadro PRISMA 2020, i ricercatori hanno analizzato circa 1.500 studi provenienti da piattaforme come Semantic Scholar e arXiv, restringendo infine l'analisi a 50 opere fondamentali. I risultati sono categorizzati in quattro temi chiave: tecniche di allineamento di sicurezza, rischi in contesti multilingue, standard di valutazione e adattabilità cross-linguistica. Gli autori sottolineano l'inadeguatezza della traduzione dei benchmark inglesi, evidenziando l'urgente necessità di protocolli di sicurezza potenziati, adattati a diversi contesti culturali, in particolare per le lingue con meno supporto.
Fatti principali
- Revisione sistematica della letteratura sull'allineamento di sicurezza dei LLM nelle lingue a basse risorse
- Adotta la metodologia PRISMA 2020
- Screening di circa 1.500 articoli da Semantic Scholar, arXiv e OpenAlex
- Selezionati 50 studi pertinenti per l'analisi
- Organizzata attorno a quattro temi: metodi di allineamento di sicurezza, rischi di sicurezza multilingue, benchmark di valutazione e trasferibilità cross-linguistica
- Propone una tassonomia degli approcci di allineamento di sicurezza: adattamento dei dati, ottimizzazione degli obiettivi, allineamento meccanico
- I benchmark inglesi tradotti non rappresentano adeguatamente i danni radicati culturalmente
- Pubblicato su arXiv con ID 2608.14626
Entità
Istituzioni
- Semantic Scholar
- arXiv
- OpenAlex