ARTFEED — Contemporary Art Intelligence

PROGRESS: RL guidato dalla copertura per agenti LLM potenziati dalla ricerca

ai-technology · 2026-08-04

È stata introdotta una nuova tecnica di apprendimento per rinforzo denominata PROGRESS per migliorare l'addestramento di agenti basati su grandi modelli linguistici (LLM) potenziati dalla ricerca. Questo approccio, descritto in un articolo arXiv (2608.00969), affronta un notevole difetto dei metodi attuali che dipendono da ricompense a livello di risultato, che offrono una guida minima sul comportamento di ricerca e non sfruttano la capacità dell'agente di scomporre query complesse. PROGRESS utilizza ricompense di copertura guidate dall'insegnante per influenzare direttamente la generazione di query scomposte da parte del modello di policy. Durante la fase di addestramento, modelli insegnante statici segmentano query intricate in query di ricerca fondamentali che guidano le azioni di ricerca del modello di policy. Integrato in un framework di addestramento in stile R1, PROGRESS fornisce una guida leggera sulle scelte di scomposizione delle query senza richiedere una supervisione densa a livello di processo. Gli esperimenti indicano che l'RL guidato dalla copertura migliora le prestazioni complessive del compito, sottolineando la necessità di una supervisione esplicita nella scomposizione delle query. L'articolo è stato inviato ad arXiv.

Fatti principali

  • PROGRESS è un nuovo metodo di apprendimento per rinforzo per addestrare agenti LLM potenziati dalla ricerca.
  • Utilizza ricompense di copertura guidate dall'insegnante per modellare la generazione di query scomposte.
  • Modelli insegnante congelati scompongono query complesse in query di ricerca essenziali.
  • Il metodo è integrato in un framework di addestramento in stile R1.
  • Fornisce una guida leggera senza una supervisione densa a livello di processo.
  • Gli esperimenti mostrano che l'RL guidato dalla copertura migliora le prestazioni complessive del compito.
  • L'articolo è su arXiv con ID 2608.00969.
  • Il metodo affronta i limiti delle ricompense a livello di risultato negli approcci esistenti.

Entità

Istituzioni

  • arXiv

Fonti