Anthropic rende la Modalità Auto predefinita in Claude Code, citando valutazioni di sicurezza
A partire dal 14 agosto, Anthropic implementerà la modalità auto come impostazione standard per le nuove sessioni in Claude Code per i piani Pro, Max e Team. Questo cambiamento deriva dalla forte convinzione dell'azienda nella sicurezza di questa modalità, come evidenziato durante una Fireside Chat con Cat Wu e Thariq Shihipar alla Fiera Mondiale degli Ingegneri AI del mese scorso. Wu ha notato che quasi tutti i dipendenti Anthropic utilizzano la modalità auto, sottolineando che hanno affrontato significativi vettori di attacco come l'iniezione di prompt e l'esfiltrazione di dati, con rischi inferiori rispetto ai tipici revisori umani. Le valutazioni hanno mostrato che in un test con 1.053 partecipanti pagati, solo il 13,6% ha rifiutato un comando dannoso, mentre la modalità auto avrebbe bloccato l'89%. Una valutazione di Trajectory Labs non ha trovato successo in 720 tentativi di iniezione indiretta di prompt contro Claude Fable 5, Opus 5 e Sonnet 5. Tuttavia, permangono preoccupazioni riguardo ad attacchi da pacchetti dannosi che potrebbero istruire gli agenti a eseguire comandi pericolosi, che la modalità auto potrebbe non fermare. Simon Willison, autore del post, sollecita ulteriori validazioni indipendenti, mantenendo un cauto ottimismo.
Fatti principali
- La modalità auto diventa predefinita in Claude Code per i piani Pro, Max e Team il 14 agosto.
- Cat Wu e Thariq Shihipar hanno discusso della modalità auto alla Fiera Mondiale degli Ingegneri AI.
- Anthropic afferma di aver mitigato i rischi di iniezione di prompt e esfiltrazione di dati.
- In un test con 1.053 tester pagati, solo il 13,6% degli umani ha rifiutato un comando pericoloso, mentre la modalità auto avrebbe bloccato l'89%.
- Trajectory Labs ha valutato Claude Fable 5, Opus 5 e Sonnet 5; nessuno dei 720 tentativi di iniezione indiretta di prompt è riuscito.
- Simon Willison evidenzia potenziali vulnerabilità come pacchetti dannosi che la modalità auto potrebbe non intercettare.
- Willison prevede un 'disastro Challenger per la sicurezza degli agenti di codifica' nel 2026.
- Il post è stato pubblicato l'8 agosto 2026.
Entità
Istituzioni
- Anthropic
- Trajectory Labs
- AI Engineer World’s Fair