ARTFEED — Contemporary Art Intelligence

Anthropic rende la Modalità Auto predefinita in Claude Code, citando valutazioni di sicurezza

ai-technology · 2026-08-09

A partire dal 14 agosto, Anthropic implementerà la modalità auto come impostazione standard per le nuove sessioni in Claude Code per i piani Pro, Max e Team. Questo cambiamento deriva dalla forte convinzione dell'azienda nella sicurezza di questa modalità, come evidenziato durante una Fireside Chat con Cat Wu e Thariq Shihipar alla Fiera Mondiale degli Ingegneri AI del mese scorso. Wu ha notato che quasi tutti i dipendenti Anthropic utilizzano la modalità auto, sottolineando che hanno affrontato significativi vettori di attacco come l'iniezione di prompt e l'esfiltrazione di dati, con rischi inferiori rispetto ai tipici revisori umani. Le valutazioni hanno mostrato che in un test con 1.053 partecipanti pagati, solo il 13,6% ha rifiutato un comando dannoso, mentre la modalità auto avrebbe bloccato l'89%. Una valutazione di Trajectory Labs non ha trovato successo in 720 tentativi di iniezione indiretta di prompt contro Claude Fable 5, Opus 5 e Sonnet 5. Tuttavia, permangono preoccupazioni riguardo ad attacchi da pacchetti dannosi che potrebbero istruire gli agenti a eseguire comandi pericolosi, che la modalità auto potrebbe non fermare. Simon Willison, autore del post, sollecita ulteriori validazioni indipendenti, mantenendo un cauto ottimismo.

Fatti principali

  • La modalità auto diventa predefinita in Claude Code per i piani Pro, Max e Team il 14 agosto.
  • Cat Wu e Thariq Shihipar hanno discusso della modalità auto alla Fiera Mondiale degli Ingegneri AI.
  • Anthropic afferma di aver mitigato i rischi di iniezione di prompt e esfiltrazione di dati.
  • In un test con 1.053 tester pagati, solo il 13,6% degli umani ha rifiutato un comando pericoloso, mentre la modalità auto avrebbe bloccato l'89%.
  • Trajectory Labs ha valutato Claude Fable 5, Opus 5 e Sonnet 5; nessuno dei 720 tentativi di iniezione indiretta di prompt è riuscito.
  • Simon Willison evidenzia potenziali vulnerabilità come pacchetti dannosi che la modalità auto potrebbe non intercettare.
  • Willison prevede un 'disastro Challenger per la sicurezza degli agenti di codifica' nel 2026.
  • Il post è stato pubblicato l'8 agosto 2026.

Entità

Istituzioni

  • Anthropic
  • Trajectory Labs
  • AI Engineer World’s Fair

Fonti