ARTFEED — Contemporary Art Intelligence

Ottimizzazione della Politica Auto-Distillata a Livello di Passo per Agenti di Ricerca Profonda

ai-technology · 2026-08-15

Uno studio recente pubblicato su arXiv (2608.12764) presenta l'Ottimizzazione della Politica Auto-Distillata a Livello di Passo (SDS-PO), volta a migliorare gli agenti di ricerca profonda fornendo ricompense dense a livello di passo. L'apprendimento per rinforzo tradizionale tipicamente fornisce una singola ricompensa di esito per ogni traiettoria, che risulta insufficiente per un efficace assegnazione del credito in scenari di ricerca multi-step. L'auto-distillazione on-policy (OPSD) sfrutta i logit del modello stesso come insegnanti densi a livello di token; tuttavia, applicare questo agli agenti di ricerca introduce un conflitto poiché l'insegnante possiede informazioni privilegiate (come la risposta corretta), risultando in una distribuzione che diverge dal ragionamento basato sull'esplorazione dello studente. Per affrontare questo, gli autori introducono gli Evidence Anchors—brevi frammenti di evidenza a livello di passo provenienti dal web—che fungono da informazioni privilegiate che incapsulano i passaggi di ragionamento essenziali senza rivelare la risposta completa. Questo approccio consente allo studente di sviluppare migliori strategie di ricerca senza adottare il vantaggio informativo dell'insegnante. L'articolo funge anche da annuncio incrociato su arXiv, suggerendo che potrebbe essere stato presentato altrove in precedenza. Questo metodo affronta un problema critico nell'addestramento di agenti di ricerca profonda, che navigano traiettorie che possono estendersi per numerosi passi, rendendolo significativo per la ricerca sull'IA, specialmente nell'apprendimento per rinforzo e nel ragionamento basato sulla ricerca.

Fatti principali

  • Articolo arXiv:2608.12764
  • Tipo di annuncio: incrociato
  • Introduce l'Ottimizzazione della Politica Auto-Distillata a Livello di Passo (SDS-PO)
  • Affronta il problema della ricompensa sparsa negli agenti di ricerca profonda
  • Utilizza gli Evidence Anchors come informazioni privilegiate
  • Gli Evidence Anchors sono frammenti di evidenza a livello di passo provenienti dal web
  • Risolve la tensione tra le distribuzioni di insegnante e studente
  • Mira a migliorare l'assegnazione del credito in compiti di ricerca multi-step

Entità

Istituzioni

  • arXiv

Fonti