ARTFEED — Contemporary Art Intelligence

StaQ: Discesa dello Specchio delle Politiche con Memoria Finita per Spazi di Azioni Discreti

ai-technology · 2026-08-03

Un nuovo articolo su arXiv propone StaQ, un algoritmo di Discesa dello Specchio delle Politiche (PMD) per spazi di azioni discreti che conserva in memoria solo le ultime M funzioni Q, affrontando l'intrattabilità del PMD esatto. Gli autori dimostrano teoricamente che per un M finito e sufficientemente grande, l'algoritmo raggiunge garanzie di convergenza, fornendo un'approssimazione pratica che mitiga gli errori di valutazione delle politiche. Il lavoro, pubblicato come arXiv:2506.13862v2, contribuisce all'apprendimento per rinforzo offrendo un'alternativa efficiente in termini di memoria ai metodi di gradiente naturale delle politiche e attore-critico, che possono introdurre errori. L'articolo è disponibile su arXiv ed è rilevante per i ricercatori in IA e machine learning.

Fatti principali

  • Titolo dell'articolo: StaQ: un approccio a memoria finita per la discesa dello specchio delle politiche in spazi di azioni discreti
  • ID arXiv: 2506.13862v2
  • Tipo di annuncio: replace-cross
  • Propone algoritmi simili al PMD per spazi di azioni discreti mantenendo in memoria solo le ultime M funzioni Q
  • Dimostra teoricamente che per un M finito e sufficientemente grande, un algoritmo di RL raggiunge la convergenza
  • Affronta l'intrattabilità del PMD esatto che richiede la somma di tutte le funzioni Q passate
  • Confronta con i metodi di gradiente naturale delle politiche e attore-critico che possono introdurre errori
  • Pubblicato su arXiv (https://arxiv.org/abs/2506.13862)

Entità

Istituzioni

  • arXiv

Fonti