Semalith v1.4: Classificatore di Sicurezza a 184 Milioni di Parametri Supera Llama-Guard-3-8B nel Prompt Injection
Il rilascio di Semalith v1.4 introduce un classificatore DeBERTa-v3-base con 184 milioni di parametri, in grado di effettuare una classificazione di sicurezza su tre assi—iniezione di prompt, danno generale e conformità alle normative dei servizi finanziari—in un unico passaggio in avanti. La sua testa presenta 22 classi, tra cui BENIGN, nove tipi di iniezione di prompt, danno generale e undici etichette BFSI. Questo modello è stato addestrato utilizzando una testa ausiliaria a super-categoria di 4 classi con perdita congiuntamente pesata su un corpus di 76.204 righe provenienti da 49 fonti pubbliche, impiegando deduplicazione SHA-1 rispetto a tutti i set di valutazione esclusi. Sorprendentemente, 21 dei 22 benchmark mostrano contaminazione zero (massimo 0,22%). Nei confronti con Llama-Guard-3-8B su 22 benchmark, Semalith v1.4 supera in ogni valutazione di iniezione di prompt, colmando una lacuna cruciale negli attuali guardrail aperti per i servizi finanziari e i contesti agentici.
Fatti principali
- Semalith v1.4 è un classificatore DeBERTa-v3-base con 184 milioni di parametri.
- Esegue una classificazione di sicurezza simultanea su tre assi: iniezione di prompt, danno generale e conformità normativa dei servizi finanziari.
- Il modello ha una testa a 22 classi con BENIGN, nove sottotipi di iniezione di prompt, danno generale e undici etichette BFSI.
- L'addestramento ha utilizzato una testa ausiliaria a super-categoria di 4 classi con perdita congiuntamente pesata.
- Corpus di addestramento: 76.204 righe da 49 fonti pubbliche con deduplicazione SHA-1.
- 21 dei 22 benchmark hanno contaminazione zero (massimo 0,22%).
- Supera Llama-Guard-3-8B su tutti i 22 benchmark di iniezione di prompt esclusi.
- Colma una lacuna nei guardrail aperti per i servizi finanziari e i contesti agentici.
Entità
—