ARTFEED — Contemporary Art Intelligence

Il Livello di Decisione Dura dei Transformer Rivela Impegni Improvvisi sulle Risposte

other · 2026-07-27

Una recente indagine ha individuato il Livello di Decisione Dura (HDL) nei modelli linguistici basati su transformer, dove le classifiche delle opzioni di risposta si stabilizzano improvvisamente durante l'inferenza. La validazione attraverso quattro modelli (Qwen, Llama, Granite, Mistral) e quattro dataset di benchmark rivela costantemente l'emergere dell'HDL, indipendentemente dalle politiche di routing apprese. Questo livello rimane invariato anche dopo il fine-tuning. In particolare, i miglioramenti di accuratezza all'HDL possono raggiungere +0,61 (Qwen su CommonsenseQA), dopodiché le prestazioni si stabilizzano. Ablazioni sistematiche riguardanti i formati delle etichette e la complessità del problema confermano che questo fenomeno è intrinseco all'architettura del modello. Questi risultati forniscono approfondimenti sui meccanismi di inferenza dei transformer e evidenziano il potenziale per un ragionamento efficiente e la guida del modello. Tutto il codice e i risultati correlati sono accessibili su arXiv.

Fatti principali

  • Il Livello di Decisione Dura (HDL) è una proprietà architetturale naturale in cui le classifiche delle opzioni di risposta si stabilizzano bruscamente.
  • Validato sui modelli Qwen, Llama, Granite e Mistral.
  • Testato su quattro dataset di benchmark.
  • L'HDL emerge senza politiche di routing apprese.
  • L'HDL è invariante al fine-tuning.
  • Miglioramenti di accuratezza all'HDL fino a +0,61 (Qwen su CommonsenseQA).
  • Il fenomeno è fondamentale per l'architettura del modello.
  • Tutto il codice e i risultati sono disponibili su arXiv.

Entità

Fonti