ARTFEED — Contemporary Art Intelligence

Semalith v1.4: Classificatore di Sicurezza a 184 Milioni di Parametri Supera Llama-Guard-3-8B nel Prompt Injection

ai-technology · 2026-07-29

Il rilascio di Semalith v1.4 introduce un classificatore DeBERTa-v3-base con 184 milioni di parametri, in grado di effettuare una classificazione di sicurezza su tre assi—iniezione di prompt, danno generale e conformità alle normative dei servizi finanziari—in un unico passaggio in avanti. La sua testa presenta 22 classi, tra cui BENIGN, nove tipi di iniezione di prompt, danno generale e undici etichette BFSI. Questo modello è stato addestrato utilizzando una testa ausiliaria a super-categoria di 4 classi con perdita congiuntamente pesata su un corpus di 76.204 righe provenienti da 49 fonti pubbliche, impiegando deduplicazione SHA-1 rispetto a tutti i set di valutazione esclusi. Sorprendentemente, 21 dei 22 benchmark mostrano contaminazione zero (massimo 0,22%). Nei confronti con Llama-Guard-3-8B su 22 benchmark, Semalith v1.4 supera in ogni valutazione di iniezione di prompt, colmando una lacuna cruciale negli attuali guardrail aperti per i servizi finanziari e i contesti agentici.

Fatti principali

  • Semalith v1.4 è un classificatore DeBERTa-v3-base con 184 milioni di parametri.
  • Esegue una classificazione di sicurezza simultanea su tre assi: iniezione di prompt, danno generale e conformità normativa dei servizi finanziari.
  • Il modello ha una testa a 22 classi con BENIGN, nove sottotipi di iniezione di prompt, danno generale e undici etichette BFSI.
  • L'addestramento ha utilizzato una testa ausiliaria a super-categoria di 4 classi con perdita congiuntamente pesata.
  • Corpus di addestramento: 76.204 righe da 49 fonti pubbliche con deduplicazione SHA-1.
  • 21 dei 22 benchmark hanno contaminazione zero (massimo 0,22%).
  • Supera Llama-Guard-3-8B su tutti i 22 benchmark di iniezione di prompt esclusi.
  • Colma una lacuna nei guardrail aperti per i servizi finanziari e i contesti agentici.

Entità

Fonti