ARTFEED — Contemporary Art Intelligence

Attention-Guided Layer Selection Boosts LLM Factuality

ai-technology · 2026-07-29

Researchers propose three attention-guided strategies—Attention-JSD, Attention-Entropy-Max, and Attention-Entropy-Min—to improve contrastive decoding in large language models. These methods leverage self-attention distributions as a signal for layer selection, outperforming the original DoLa approach on the TruthfulQA benchmark. Significant gains are observed on multi-answer metrics MC2 and MC3, indicating that attention distributions provide a more sensitive signal for factual knowledge retrieval than output vocabulary distributions alone.

Key facts

  • Attention-JSD, Attention-Entropy-Max, and Attention-Entropy-Min are proposed.
  • Methods use self-attention distributions for layer selection.
  • Outperform original DoLa on TruthfulQA.
  • Significant gains on MC2 and MC3 metrics.
  • Attention distributions provide more sensitive signal for factual knowledge.

Entities

Institutions

  • arXiv

Sources