ARTFEED — Contemporary Art Intelligence

HarmProfile: Caratterizzazione delle distribuzioni dannose nei LLM all'avanguardia

ai-technology · 2026-08-18

Un dataset di benchmark di recente pubblicazione, denominato HarmProfile, mira a dettagliare gli output dannosi dei modelli linguistici di grandi dimensioni (LLM) avanzati. Come delineato in un articolo su arXiv (2608.14577), questo dataset raccoglie oltre 80.000 artefatti verificati provenienti da 23 LLM all'avanguardia appartenenti a 13 famiglie di modelli, classificati in 15 categorie di danno e 57 sottocategorie. L'idea centrale è che i rischi associati ai modelli possono essere valutati in base al contenuto, alla gravità e alla variabilità dei loro fallimenti di sicurezza, in modo simile all'analisi del comportamento linguistico attraverso un corpus di enunciati. HarmProfile mira a colmare il vuoto di dataset estesi e di alta qualità sul comportamento scorretto dei LLM all'avanguardia, fornendo un quadro incentrato sul contenuto per la valutazione della sicurezza e migliorando la comprensione del comportamento scorretto dei modelli in varie categorie di danno.

Fatti principali

  • HarmProfile è un dataset di benchmark incentrato sul contenuto per caratterizzare gli output dannosi dei LLM all'avanguardia.
  • Contiene oltre 80.000 artefatti validati provenienti da 23 LLM all'avanguardia appartenenti a 13 famiglie di modelli.
  • Il dataset è organizzato in 15 categorie di danno e 57 sottocategorie.
  • L'articolo è disponibile su arXiv con identificativo 2608.14577.
  • Il dataset definisce un profilo di rischio a livello di modello basato sulla distribuzione degli output dannosi.
  • Affronta la mancanza di raccolte su larga scala e di alta qualità del comportamento scorretto dei LLM all'avanguardia.
  • L'approccio è analogo alla caratterizzazione del comportamento linguistico da un corpus di enunciati.
  • Il dataset mira a migliorare la valutazione della sicurezza analizzando il contenuto, la gravità e la variazione dei fallimenti di sicurezza.

Entità

Istituzioni

  • arXiv

Fonti