SkillMisevo-Gym e SkillMisevo-Bench Espongono i Rischi per la Sicurezza negli Agenti LLM Auto-Miglioranti
Un nuovo preprint arXiv (2608.12851) introduce SkillMisevo-Gym e SkillMisevo-Bench, strumenti progettati per misurare ed esporre i rischi per la sicurezza negli agenti LLM (large language model) auto-miglioranti. La ricerca identifica un fenomeno chiamato 'misevoluzione delle abilità', in cui traiettorie di successo non sicure vengono convertite in politiche riutilizzabili, portando a comportamenti compromessi. Gli autori propongono SafeEvolve, un wrapper che ripara contenuti non sicuri e governa il processo di evoluzione. Lo studio fornisce metriche e benchmark sensibili al ciclo di vita per attribuire il rischio alle fasi di creazione, recupero ed esecuzione.
Fatti principali
- Il preprint arXiv 2608.12851 introduce SkillMisevo-Gym e SkillMisevo-Bench.
- La misevoluzione delle abilità si verifica quando successi non sicuri diventano politiche riutilizzabili.
- I benchmark esistenti misurano il comportamento attuale o artefatti statici, non il rischio del ciclo di vita.
- SkillMisevo-Gym versiona lo stato delle abilità attraverso framework di agenti.
- SkillMisevo-Bench include compiti benigni allineati ai concetti e nove metriche del ciclo di vita.
- SafeEvolve è un wrapper che ripara contenuti non sicuri e governa l'evoluzione.
- La ricerca si concentra su agenti LLM auto-miglioranti.
- Il paper è disponibile su https://arxiv.org/abs/2608.12851.
Entità
Istituzioni
- arXiv