Two API settings triple GPT-5.6 scores on ARC-AGI-3 benchmark
OpenAI researchers discovered that enabling two specific API settings—retaining reasoning and enabling compaction—tripled GPT-5.6's performance on the ARC-AGI-3 benchmark. The settings improved both scores and computational efficiency. The finding suggests that model architecture adjustments can significantly boost reasoning capabilities without additional training data. ARC-AGI-3 is a challenging benchmark designed to measure abstract reasoning and generalization in AI systems. The results were published on OpenAI's website.
Key facts
- Two API settings tripled GPT-5.6 scores on ARC-AGI-3
- Settings: retaining reasoning and enabling compaction
- Improved both scores and efficiency
- No additional training data required
- ARC-AGI-3 measures abstract reasoning and generalization
- Results published by OpenAI
Entities
Institutions
- OpenAI