ARTFEED — Contemporary Art Intelligence

Trasformatore a piena larghezza di banda: feedback latente per modelli autoregressivi

ai-technology · 2026-08-11

Uno studio recente pubblicato su arXiv (2608.08888v1) presenta il trasformatore a piena larghezza di banda, un aggiornamento per i trasformatori autoregressivi. Questa ricerca affronta un difetto riscontrato nei modelli di trasformatore convenzionali: sebbene l'attenzione densa consenta un ampio accesso orizzontale ai token precedenti, il feedback verticale tra i passi di decodifica è limitato, poiché solo il token campionato ritorna alla base dello stack, scartando lo stato nascosto del livello superiore. Il nuovo approccio migliora questo canale di feedback incorporando il feedback latente; ad ogni passo di decodifica, il precedente stato nascosto del livello superiore si fonde con l'embedding del token campionato tramite un'unità lineare gated, che viene poi reintegrato come input successivo. Questo metodo mantiene la struttura originale del trasformatore, la cache KV e l'obiettivo di modellazione del linguaggio, impiegando un obiettivo multi-passaggio programmato per l'addestramento. Il documento completo è accessibile all'indirizzo https://arxiv.org/abs/2608.08888.

Fatti principali

  • ID del documento: arXiv:2608.08888v1
  • Introduce il trasformatore a piena larghezza di banda con feedback latente
  • Il feedback latente fonde il precedente stato nascosto del livello superiore con l'embedding del token campionato tramite un'unità lineare gated
  • Preserva l'architettura standard del trasformatore, la cache KV e l'obiettivo di modellazione del linguaggio
  • Utilizza un obiettivo multi-passaggio programmato per l'addestramento
  • Affronta il canale di feedback verticale ristretto nei trasformatori autoregressivi
  • Disponibile su arXiv

Entità

Istituzioni

  • arXiv

Fonti