ARTFEED — Contemporary Art Intelligence

HOBA: Framework RL Gerarchico per Offerte Pubblicitarie Online Adattive

ai-technology · 2026-07-29

È stato introdotto un nuovo framework di apprendimento per rinforzo gerarchico chiamato HOBA (Hierarchical On-policy Bidding Agents) per superare le limitazioni dei sistemi di offerta pubblicitaria online esistenti. Questi sistemi si basano tipicamente su vari modelli esperti addestrati offline come controllori PID, controllo predittivo basato su modello e politiche RL offline, ma faticano ad adattarsi ai mercati d'asta fluttuanti e spesso richiedono costose regolazioni manuali. HOBA separa il ragionamento strategico, la selezione del modello e l'esecuzione delle offerte in tre scale temporali distinte. Al livello superiore, un grande modello linguistico deduce iperparametri dai segnali contestuali attraverso un ciclo Think-Act-Observe-Reflect che utilizza esperienze passate. Il livello intermedio impiega un agente SARSA che regola la selezione del modello per rimuovere il bias, mentre il livello basso presenta un pool dinamico di esperti, inclusi modelli PID, MPC, IQL e Decision Transformer, consentendo l'adattamento online senza input manuali.

Fatti principali

  • HOBA sta per Hierarchical On-policy Bidding Agents
  • Il framework utilizza tre scale temporali: alta, media, bassa
  • Il livello alto usa un LLM con ciclo Think-Act-Observe-Reflect
  • Il livello medio usa un agente SARSA per la selezione del modello
  • Il livello basso include un pool dinamico di esperti: PID, MPC, IQL, Decision Transformer
  • Affronta la mancanza di adattabilità online nei sistemi attuali
  • Riduce la dipendenza dalla regolazione manuale degli iperparametri
  • L'articolo appare su arXiv con ID 2607.24779

Entità

Istituzioni

  • arXiv

Fonti