Studio rileva che la ricerca sull'allineamento dell'IA manca di una definizione chiara dei valori umani
Un nuovo articolo su arXiv (2608.10327) esamina il concetto di valori umani nella ricerca sull'allineamento dell'IA, scoprendo che la maggior parte degli studi non definisce i valori e si affida invece alle preferenze come proxy. Gli autori hanno annotato 94 articoli di ricerca sull'allineamento dei valori per discernere la teoria implicita dei valori nell'IA. Hanno scoperto che la maggior parte degli articoli non definisce i valori, con molti che usano le preferenze come sostituto. L'articolo solleva domande su come il campo dell'allineamento dei valori dell'IA concepisce i valori umani, come queste concezioni sono tecnicamente operazionalizzate e valutate, e cosa significa la teoria emergente del valore per il futuro dell'IA. Lo studio evidenzia l'aumento dei danni derivanti dai grandi modelli linguistici (LLM) e dai modelli di fondazione multimodali, inclusi discorsi tossici, allucinazioni e azioni non autorizzate da parte di agenti IA. Questi problemi sono spesso inquadrati come il problema dell'allineamento, o modelli disallineati con i valori umani. L'articolo chiede definizioni più esplicite dei valori nella ricerca sull'allineamento dell'IA.
Fatti principali
- Articolo su arXiv: 2608.10327
- Annotati 94 articoli di ricerca sull'allineamento dei valori
- La maggior parte degli articoli non definisce i valori
- Le preferenze usate come sostituto dei valori
- I danni includono discorsi tossici, allucinazioni, azioni non autorizzate
- LLM e modelli di fondazione multimodali sono il focus
- Il campo della sicurezza dell'IA inquadra questi come problema di allineamento
- Gli autori mettono in discussione l'operazionalizzazione e la valutazione dei valori
Entità
Istituzioni
- arXiv