ARTFEED — Contemporary Art Intelligence

AttCal: Calibrazione dell'Attenzione Auto-Supervisionata per Modelli Linguistici Pre-addestrati basati su Transformer

ai-technology · 2026-08-06

Uno studio recente pubblicato su arXiv (2512.20661) presenta AttCal, un nuovo framework per la calibrazione dell'attenzione che opera senza annotazioni ed è auto-supervisionato, specificamente progettato per modelli linguistici pre-addestrati (PLM) basati su Transformer. Questo approccio affronta i problemi di diluizione dell'attenzione e degli effetti di sink dell'attenzione, che portano i modelli a concentrarsi eccessivamente su token irrilevanti. AttCal interpreta le distribuzioni di attenzione come politiche stocastiche per facilitare perturbazioni di eliminazione di token, valuta il significato dei token dipendente dal contesto attraverso cambiamenti semantici e affina i parametri di attenzione utilizzando metodi di gradiente di politica. La spina dorsale del PLM rimane invariata, con solo i livelli di proiezione dell'attenzione aggiornati per l'efficienza dell'addestramento. Le valutazioni su cinque dataset indicano miglioramenti marcati rispetto ai PLM standard. Gli autori, non specificati nell'abstract, hanno annunciato il framework come tipo 'replace' su arXiv, con l'obiettivo di migliorare l'accuratezza della classificazione del testo senza la necessità di costose annotazioni a livello di token o euristiche statiche.

Fatti principali

  • Articolo arXiv:2512.20661v2, annunciato come tipo 'replace'.
  • Propone AttCal, un framework di calibrazione dell'attenzione auto-supervisionato e senza annotazioni.
  • Affronta gli effetti di diluizione dell'attenzione e di sink dell'attenzione nei PLM basati su Transformer.
  • Utilizza il feedback di sensibilità nello spazio del compito tramite politiche stocastiche e perturbazioni di eliminazione di token.
  • Ottimizza i parametri di attenzione tramite gradiente di politica.
  • Congela la spina dorsale del PLM, aggiornando solo i livelli di proiezione dell'attenzione.
  • Valutato su cinque dataset, superando i PLM vanilla.
  • Pubblicato su arXiv, URL: https://arxiv.org/abs/2512.20661

Entità

Istituzioni

  • arXiv

Fonti