Valutazione SomaliBench: Divari di Rifiuto dall'Inglese al Somalo nei Modelli Linguistici Open-Weight
L'introduzione di SomaliBench v0 ha rivelato gravi carenze di sicurezza nei modelli linguistici open-weight quando elaborano prompt in somalo. Questa ricerca, pubblicata su arXiv (2605.25420), valuta quattro modelli addestrati con istruzioni—Llama-3.1-8B-Instruct, Gemma-2-9B-Instruct, Qwen-2.5-7B-Instruct e Aya-23-8B—utilizzando 100 prompt con intento dannoso sia in inglese che in somalo, tutti validati da madrelingua. Ogni modello è stato testato localmente con una temperatura di 0 e lo stesso prompt inglese per 'utile, innocuo e onesto' (HHH). I risultati indicano significativi divari di rifiuto dall'inglese al somalo, che vanno da 0.40 a 0.93, confermati da test bootstrap accoppiati e test esatti di McNemar. Per tre modelli, l'output prevalente di non-rifiuto in somalo non era una conformità dannosa fluente, ma piuttosto generazioni incoerenti, fuori tema o in lingua errata. Questo studio sottolinea la natura incentrata sull'inglese delle valutazioni di sicurezza degli LLM, che trascura le lingue a basse risorse, anche nelle implementazioni globali, evidenziando l'urgente necessità di valutazioni di sicurezza più complete in diverse lingue.
Fatti principali
- SomaliBench v0 è un benchmark verificato da autori madrelingua di 100 prompt con intento dannoso, abbinati tra inglese e somalo.
- Sono stati valutati quattro modelli open-weight: Llama-3.1-8B-Instruct, Gemma-2-9B-Instruct, Qwen-2.5-7B-Instruct e Aya-23-8B.
- Tutti i modelli sono stati eseguiti localmente con temperatura 0 e lo stesso prompt di sistema inglese 'utile, innocuo e onesto' (HHH).
- I divari di rifiuto dall'inglese al somalo variavano da 0.40 a 0.93 tra i modelli.
- I divari di rifiuto erano statisticamente significativi sotto test bootstrap accoppiati e test esatti di McNemar.
- Per tre modelli, la modalità dominante di non-rifiuto in somalo era output poco chiaro: generazioni in lingua errata, incoerenti o fuori tema.
- Lo studio è stato annunciato su arXiv con identificativo 2605.25420.
- La ricerca evidenzia la natura incentrata sull'inglese della valutazione della sicurezza degli LLM.
Entità
Istituzioni
- arXiv