ARTFEED — Contemporary Art Intelligence

Generalizzazione della lunghezza nei Transformers caratterizzata per i linguaggi regolari

ai-technology · 2026-08-15

Uno studio teorico recente pubblicato su arXiv (2608.13433) fornisce la prima descrizione completa dei linguaggi regolari per i quali i modelli linguistici basati su transformer possono generalizzare in lunghezza. Introduce un algoritmo decisionale in tempo polinomiale che dipende dalla dimensione del monoide sintattico del linguaggio. Questa ricerca colma una lacuna cruciale, poiché in precedenza non era chiaro quali compiti consentissero tale generalizzazione, anche tra i linguaggi regolari. Gli autori caratterizzano con successo questi linguaggi utilizzando C-RASP, un formalismo che identifica i linguaggi su cui i transformer possono generalizzare in lunghezza. I metodi tradizionali come la decomposizione di Krohn-Rhodes sono inadeguati per C-RASP, rendendo necessarie nuove tecniche algebriche specificamente progettate per esso. Questo lavoro è fondamentale per il campo dell'IA, poiché stabilisce un quadro solido per prevedere la generalizzazione della lunghezza nei transformer, influenzando la progettazione di modelli per compiti con lunghezze di input variabili.

Fatti principali

  • Articolo arXiv:2608.13433, annunciato come tipo cross.
  • Stabilisce la prima caratterizzazione completa dei linguaggi regolari su cui i transformer generalizzano in lunghezza.
  • Fornisce un algoritmo decisionale che opera in tempo polinomiale nella dimensione del monoide sintattico del linguaggio.
  • Si basa su una caratterizzazione effettiva dei linguaggi regolari in C-RASP.
  • La classica teoria della decomposizione di Krohn-Rhodes è insufficiente per C-RASP.
  • L'articolo affronta una classe fondamentale di linguaggi: i linguaggi regolari.
  • La generalizzazione della lunghezza è una capacità nota ma poco compresa dei transformer.
  • Il lavoro offre un quadro teorico per prevedere la generalizzazione della lunghezza.

Entità

Istituzioni

  • arXiv

Fonti