ARTFEED — Contemporary Art Intelligence

Flexer: Mixing Adattivo di Politiche Neurali e MCTS per un Apprendimento per Rinforzo Efficiente

ai-technology · 2026-08-18

È stata introdotta una nuova architettura di apprendimento per rinforzo chiamata Flexer, che mescola in modo adattivo le politiche provenienti da reti neurali e dalla ricerca ad albero Monte Carlo (MCTS) per ridurre il costo computazionale mantenendo le prestazioni. L'approccio, descritto in un articolo presentato su arXiv, affronta l'inefficienza di eseguire la ricerca a una profondità fissa a intervalli regolari. Invece, Flexer regola dinamicamente la profondità di ricerca in base alla qualità delle priorità della rete di policy, riducendo lo sforzo di ricerca quando la rete è sicura. Il fattore di miscelazione favorisce la politica MCTS quando l'errore di imitazione della rete e la varianza del modello ambientale aumentano. In esperimenti su tre problemi simbolici giocattolo, Flexer ha superato le versioni di AlphaZero, DQN e ADP. L'articolo è categorizzato sotto Computer Science > Artificial Intelligence ed è stato presentato su arXiv con l'identificatore 2608.15700. Il lavoro evidenzia un potenziale miglioramento nell'efficienza del campionamento e nell'efficienza computazionale per gli agenti di apprendimento per rinforzo, in particolare in domini in cui la pianificazione è costosa.

Fatti principali

  • Flexer è un'architettura che mescola le politiche di una rete neurale e della ricerca ad albero Monte Carlo.
  • Il fattore di miscelazione favorisce la politica MCTS quando l'errore di imitazione della politica e la varianza del modello ambientale aumentano.
  • Flexer riduce la profondità di ricerca proporzionalmente alla qualità delle priorità della rete di policy.
  • Flexer ha superato AlphaZero, DQN e ADP su tre problemi simbolici giocattolo.
  • L'articolo è categorizzato sotto Computer Science > Artificial Intelligence.
  • L'articolo è stato presentato su arXiv con l'identificatore 2608.15700.
  • L'approccio mira a ridurre il costo computazionale della ricerca nell'apprendimento per rinforzo.
  • L'articolo è disponibile su arXiv e include riferimenti, citazioni e collegamenti a codice/dati.

Entità

Istituzioni

  • arXiv
  • Semantic Scholar

Fonti