ARTFEED — Contemporary Art Intelligence

Nuovo Quadro Teorico Affronta la Ripetizione nei Modelli Linguistici AI

ai-technology · 2026-07-29

I ricercatori hanno proposto un quadro teorico basato su principi per contrastare il collasso dell'attenzione nei modelli linguistici autoregressivi, un problema che causa cicli di token ripetitivi. Il metodo utilizza una costruzione di probabilità condizionale adiacente per confrontare la frequenza osservata di un token con il suo prior del corpus, producendo un rapporto di penalità auto-normalizzante che non richiede standardizzazione ad hoc. Questa correzione viene applicata tramite un offset logit in forma chiusa con errore di approssimazione zero e accumulata in un bias dello strato di output congelato attraverso una media mobile esponenziale. L'approccio può riparare modelli già collassati senza modifiche intrusive alle procedure di addestramento standard.

Fatti principali

  • 1. Il collasso dell'attenzione causa cicli di token ripetitivi nei modelli linguistici autoregressivi.
  • 2. Le euristiche di decodifica esistenti non affrontano la causa principale.
  • 3. Il quadro teorico penalizza la fiducia anomala derivante da schemi di generazione collassati.
  • 4. Utilizza una costruzione di probabilità condizionale adiacente che confronta la frequenza osservata con il prior del corpus.
  • 5. Il rapporto di penalità auto-normalizzante R = f(m,n,p)/f(np,n,p) non richiede standardizzazione ad hoc.
  • 6. La correzione è isolata dal gradiente della funzione di perdita.
  • 7. Viene accumulata in un bias dello strato di output congelato tramite media mobile esponenziale.
  • 8. Il metodo può riparare modelli già collassati senza modifiche intrusive.

Entità

Fonti