ARTFEED — Contemporary Art Intelligence

Sparse Autoencoder-Based Steering for Controllable LLM Reasoning

ai-technology · 2026-07-29

Researchers propose SAE-Steering, a method to control reasoning strategies in Large Reasoning Models (LRMs) by leveraging Sparse Autoencoders (SAEs) to decompose entangled hidden states into a disentangled feature space. The approach addresses the inefficiency and errors of autonomous reasoning strategy selection. A two-stage pipeline identifies strategy-specific features from the vast pool of SAE features, enabling fine-grained control over reasoning processes such as backtracking and cross-verification. The work is detailed in arXiv:2601.03595.

Key facts

  • arXiv:2601.03595
  • SAE-Steering uses Sparse Autoencoders to decompose hidden states
  • Two-stage feature identification pipeline
  • Targets reasoning strategies like backtracking and cross-verification
  • Aims to improve reliability and flexibility of LRMs
  • Addresses conceptual entanglement in hidden states
  • Proposed method controls fine-grained reasoning strategies
  • Autonomous selection often leads to inefficient or erroneous paths

Entities

Institutions

  • arXiv

Sources