ARTFEED — Contemporary Art Intelligence

Vettori di Steering per la Fedeltà del Chain-of-Thought: Studio di Generalizzazione

ai-technology · 2026-08-03

Un nuovo preprint arXiv (2607.29062) indaga come lo steering dell'attivazione possa migliorare la fedeltà del ragionamento chain-of-thought (CoT) nei modelli linguistici di grandi dimensioni. Gli autori estendono il lavoro precedente esaminando la generalizzazione dei vettori di steering attraverso diversi tipi di cue, dataset e metodi di costruzione. Testano tre modelli: Gemma-3 4B, Qwen-3.5 9B e Gemma-3 12B, in un contesto di domanda-risposta con cue. Lo studio affronta il problema in cui i modelli non riescono a verbalizzare i passaggi di ragionamento strumentale, specialmente quando vengono forniti cue fuorvianti. I risultati indicano che lo steering aumenta in modo affidabile la fedeltà, sebbene il grado di generalizzazione vari. Questa ricerca contribuisce alla sicurezza dell'IA migliorando la trasparenza del ragionamento dei modelli.

Fatti principali

  • Preprint arXiv 2607.29062
  • Studio sui vettori di steering per la fedeltà del chain-of-thought
  • Modelli testati: Gemma-3 4B, Qwen-3.5 9B, Gemma-3 12B
  • Contesto di domanda-risposta con cue
  • Generalizzazione attraverso tipi di cue, dataset e metodi di costruzione dei vettori di steering
  • Lo steering aumenta in modo affidabile la fedeltà
  • Affronta il CoT infedele in cui i modelli omettono passaggi di ragionamento strumentale
  • Il lavoro precedente ha mostrato che lo steering dell'attivazione migliora la fedeltà

Entità

Istituzioni

  • arXiv

Fonti