ARTFEED — Contemporary Art Intelligence

La proiezione differenziabile impone vincoli rigidi nel DRL per le politiche di inventario

other · 2026-08-04

Un nuovo preprint arXiv (2608.02343) introduce un metodo per apprendere politiche di inventario realizzabili in processi decisionali sequenziali vincolati. L'approccio incorpora un modulo di ottimizzazione convessa differenziabile all'interno di una politica di deep reinforcement learning (DRL). Una rete neurale propone obiettivi di azione continui, che vengono poi proiettati su un insieme ammissibile rilassato tramite un programma quadratico. Una mappatura intera informata dal duale ripristina l'integralità preservando la fattibilità. La politica viene addestrata end-to-end utilizzando gradienti pathwise da traiettorie campionate in un simulatore differenziabile. Questo affronta i limiti dei metodi DRL esistenti che penalizzano i vincoli o si affidano a meccanismi di fattibilità che falliscono quando i vincoli interagiscono. Il lavoro si rivolge a problemi operativi con spazi di azione ampi e combinatori e vincoli di fattibilità interdipendenti, come quelli modellati da programmi lineari a numeri interi misti (MILP), che scalano male in ambienti stocastici. L'articolo è annunciato come una nuova sottomissione su arXiv.

Fatti principali

  • arXiv:2608.02343 è un nuovo preprint.
  • Il metodo utilizza un modulo di ottimizzazione convessa differenziabile all'interno di una politica DRL.
  • Una rete neurale propone obiettivi di azione continui.
  • Un programma quadratico proietta le azioni sull'insieme ammissibile rilassato.
  • Una mappatura intera informata dal duale ripristina l'integralità.
  • L'addestramento utilizza gradienti pathwise da traiettorie campionate.
  • L'approccio gestisce vincoli rigidi senza metodi di penalità.
  • Si rivolge a problemi operativi con ampi spazi di azione e vincoli interdipendenti.

Entità

Istituzioni

  • arXiv

Fonti