Algoritmi Quantistici Migliorati per l'Apprendimento per Rinforzo sotto un Modello Generativo
I ricercatori hanno introdotto nuovi algoritmi quantistici per l'apprendimento per rinforzo, un sottocampo dell'apprendimento automatico in cui un agente interagisce con un ambiente per massimizzare le ricompense. Lo studio si concentra sui Processi Decisionali di Markov (MDP) in contesti sia a orizzonte finito che a orizzonte infinito con sconto. Gli algoritmi proposti combinano l'iterazione del valore standard con subroutine quantistiche come la stima della media quantistica e la ricerca del massimo quantistica, potenziate da tecniche provenienti da algoritmi classici ottimali in termini di campioni. Questi nuovi metodi raggiungono complessità di interrogazione che migliorano i lavori precedenti, avvicinandosi ai limiti inferiori quantistici stabiliti. Il lavoro è disponibile su arXiv con l'identificatore 2608.02826.
Fatti principali
- L'articolo propone nuovi algoritmi quantistici per l'apprendimento per rinforzo.
- Studia i Processi Decisionali di Markov con sconto a orizzonte finito e infinito.
- Gli algoritmi combinano l'iterazione del valore con la stima della media quantistica e la ricerca del massimo quantistica.
- Vengono incorporate tecniche da algoritmi classici ottimali in termini di campioni.
- Le complessità di interrogazione risultanti migliorano i lavori precedenti.
- I miglioramenti si avvicinano ai limiti inferiori quantistici stabiliti.
- L'articolo è disponibile su arXiv con l'identificatore 2608.02826.
- La ricerca è nel campo dell'apprendimento automatico quantistico.
Entità
Istituzioni
- arXiv