DreamGuard: Guardia di sicurezza proattiva in tempo reale per agenti LLM tramite modello del mondo consapevole del rischio
Un nuovo articolo di ricerca su arXiv (2608.05695) introduce DreamGuard, una guardia di sicurezza proattiva in tempo reale per agenti basati su modelli linguistici di grandi dimensioni (LLM). Il sistema utilizza un modello del mondo consapevole del rischio per prevedere gli stati latenti futuri, consentendo di rilevare sia i pericoli immediati che i rischi di prefisso che potrebbero portare a pericoli a lungo orizzonte. A differenza delle guardie reattive che valutano solo l'azione corrente, DreamGuard modella come il rischio evolve lungo la traiettoria, affrontando un punto cieco critico per azioni che appaiono benigne individualmente ma che possono trascinare gli agenti verso stati pericolosi. L'articolo è stato annunciato come nuova sottomissione ed è disponibile all'URL fornito.
Fatti principali
- ID articolo: arXiv:2608.05695
- Tipo di annuncio: nuovo
- Propone DreamGuard, una guardia proattiva per agenti LLM
- Utilizza un modello del mondo consapevole del rischio con uno stato latente ricorrente compatto
- Prevede stati latenti futuri per derivare prove di pericolo immediato e rischio di prefisso
- Affronta i rischi a lungo orizzonte in cui azioni apparentemente benigne possono portare a stati pericolosi
- Si concentra sulla prevenzione di azioni non sicure quando gli agenti LLM interagiscono con strumenti esterni e sistemi del mondo reale
- Disponibile su https://arxiv.org/abs/2608.05695
Entità
Istituzioni
- arXiv