Ricercatori Espongono Vulnerabilità nelle Tracce di Ragionamento Proprietarie degli LLM
Un articolo di ricerca intitolato "Rubare Tracce di Ragionamento dalle API LLM Proprietarie" ha scoperto una falla nei blocchi crittografati di catena-di-pensiero (CoT) utilizzati dalle aziende di intelligenza artificiale Anthropic, OpenAI e Google. Lo studio ha dimostrato come queste tracce crittografate potessero essere riutilizzate in diverse sessioni e modelli, consentendo il jailbreak di modelli meno sicuri e il recupero del ragionamento nascosto in chiaro. La vulnerabilità sfruttava chiavi di crittografia condivise all'interno di modelli della stessa famiglia. Nell'articolo sono incluse tracce di ragionamento di GPT-5.5 riguardanti l'architettura CSS. Tutti i fornitori hanno riconosciuto il rapporto e la vulnerabilità è stata successivamente risolta. Claude Haiku 4.5 è stato identificato come il più vulnerabile. Simon Willison ha presentato l'articolo l'11 agosto 2026, e può essere trovato su stolen-thoughts.com.
Fatti principali
- I ricercatori hanno scoperto una vulnerabilità nei blocchi crittografati di catena-di-pensiero di Anthropic, OpenAI e Google.
- L'attacco prevedeva la riproduzione di una traccia da un modello di frontiera in un modello fratello più debole per recuperare il ragionamento nascosto.
- Tutti i modelli della stessa famiglia utilizzavano la stessa chiave di crittografia, consentendo l'attacco.
- Claude Haiku 4.5 era il più facile da attaccare utilizzando un prompt specifico.
- La vulnerabilità è stata corretta; i fornitori hanno riconosciuto il rapporto e gli attacchi non erano più possibili.
- L'articolo include dettagli estesi delle tracce di ragionamento estratte.
- Il ragionamento di GPT-5.5 sull'architettura CSS è stato rivelato.
- Simon Willison ha pubblicato un post sull'articolo l'11 agosto 2026.
Entità
Istituzioni
- Anthropic
- OpenAI
- Simon Willison