Perdita di Swap-Regret in Modelli di Self-Attention a Singolo Strato
Un nuovo studio rivisita il framework della perdita di regret di Park et al. (2025), applicandolo a politiche su simplesso di probabilità in modelli di self-attention a singolo strato. Gli autori dimostrano che l'addestramento con la perdita di regret produce un punto stazionario il cui forward pass corrisponde al gioco fittizio smussato, garantendo un comportamento senza regret. Introducono anche una funzione di perdita di swap-regret, estendendo il framework oltre il regret esterno per ottimizzare la robustezza agli scambi devianti. Questa perdita di swap-regret ammette un punto stazionario che implementa l'aggiornamento classico di Blum-Mansour per lo swap-regret. Il lavoro collega la teoria delle decisioni e l'apprendimento automatico, offrendo garanzie teoriche per l'addestramento dei modelli.
Fatti principali
- arXiv:2607.23333v1
- Framework della perdita di regret da Park et al. (2025)
- Modello di self-attention a singolo strato
- Politiche su simplesso di probabilità
- Il punto stazionario corrisponde al gioco fittizio smussato
- Introdotta una nuova funzione di perdita di swap-regret
- La perdita di swap-regret consente robustezza agli scambi devianti
- Il punto stazionario implementa l'aggiornamento di Blum-Mansour
Entità
Istituzioni
- arXiv