ARTFEED — Contemporary Art Intelligence

Ricercatori Espongono Vulnerabilità nelle Tracce di Ragionamento Proprietarie degli LLM

ai-technology · 2026-08-12

Un articolo di ricerca intitolato "Rubare Tracce di Ragionamento dalle API LLM Proprietarie" ha scoperto una falla nei blocchi crittografati di catena-di-pensiero (CoT) utilizzati dalle aziende di intelligenza artificiale Anthropic, OpenAI e Google. Lo studio ha dimostrato come queste tracce crittografate potessero essere riutilizzate in diverse sessioni e modelli, consentendo il jailbreak di modelli meno sicuri e il recupero del ragionamento nascosto in chiaro. La vulnerabilità sfruttava chiavi di crittografia condivise all'interno di modelli della stessa famiglia. Nell'articolo sono incluse tracce di ragionamento di GPT-5.5 riguardanti l'architettura CSS. Tutti i fornitori hanno riconosciuto il rapporto e la vulnerabilità è stata successivamente risolta. Claude Haiku 4.5 è stato identificato come il più vulnerabile. Simon Willison ha presentato l'articolo l'11 agosto 2026, e può essere trovato su stolen-thoughts.com.

Fatti principali

  • I ricercatori hanno scoperto una vulnerabilità nei blocchi crittografati di catena-di-pensiero di Anthropic, OpenAI e Google.
  • L'attacco prevedeva la riproduzione di una traccia da un modello di frontiera in un modello fratello più debole per recuperare il ragionamento nascosto.
  • Tutti i modelli della stessa famiglia utilizzavano la stessa chiave di crittografia, consentendo l'attacco.
  • Claude Haiku 4.5 era il più facile da attaccare utilizzando un prompt specifico.
  • La vulnerabilità è stata corretta; i fornitori hanno riconosciuto il rapporto e gli attacchi non erano più possibili.
  • L'articolo include dettagli estesi delle tracce di ragionamento estratte.
  • Il ragionamento di GPT-5.5 sull'architettura CSS è stato rivelato.
  • Simon Willison ha pubblicato un post sull'articolo l'11 agosto 2026.

Entità

Istituzioni

  • Anthropic
  • OpenAI
  • Google
  • Simon Willison

Fonti