Sparse Autoencoder-Based Steering for Controllable LLM Reasoning
Researchers propose SAE-Steering, a method to control reasoning strategies in Large Reasoning Models (LRMs) by leveraging Sparse Autoencoders (SAEs) to decompose entangled hidden states into a disentangled feature space. The approach addresses the inefficiency and errors of autonomous reasoning strategy selection. A two-stage pipeline identifies strategy-specific features from the vast pool of SAE features, enabling fine-grained control over reasoning processes such as backtracking and cross-verification. The work is detailed in arXiv:2601.03595.
Key facts
- arXiv:2601.03595
- SAE-Steering uses Sparse Autoencoders to decompose hidden states
- Two-stage feature identification pipeline
- Targets reasoning strategies like backtracking and cross-verification
- Aims to improve reliability and flexibility of LRMs
- Addresses conceptual entanglement in hidden states
- Proposed method controls fine-grained reasoning strategies
- Autonomous selection often leads to inefficient or erroneous paths
Entities
Institutions
- arXiv