Deriva delle licenze nell'IA open-source: il 35,5% dei modelli viene ri-licenziato in modo permissivo
Uno studio recente pubblicato su arXiv evidenzia diffuse violazioni delle licenze nella comunità dell'IA open-source. Il team di ricerca ha condotto un audit completo che ha coinvolto 364.000 dataset e 1,6 milioni di modelli ospitati su Hugging Face, insieme a 140.000 progetti su GitHub. I risultati hanno rivelato che il 35,5% delle transizioni dai modelli alle applicazioni bypassa le licenze restrittive adottando termini più permissivi, il che potrebbe comportare rischi legali per le organizzazioni. Inoltre, i ricercatori hanno sviluppato un motore di regole flessibile che incorpora quasi 200 clausole SPDX e specifiche per i modelli, identificando con successo l'86,4% dei conflitti di licenza.
Fatti principali
- Primo audit end-to-end delle licenze per dataset e modelli su Hugging Face e la loro integrazione a valle in progetti GitHub
- Coperti 364.000 dataset, 1,6 milioni di modelli e 140.000 progetti GitHub
- Il 35,5% delle transizioni da modello ad applicazione elimina le clausole di licenza restrittive ri-licenziando con termini permissivi
- Prototipo di un motore di regole estensibile che codifica quasi 200 clausole SPDX e specifiche per i modelli
- Il motore di regole può risolvere l'86,4% dei conflitti di licenza
- I conflitti di licenza nascosti comportano seri rischi legali ed etici
- Studio pubblicato su arXiv con ID 2509.09873
- La ricerca evidenzia una non conformità sistemica nell'IA open-source
Entità
Istituzioni
- Hugging Face
- GitHub
- arXiv