ARTFEED — Contemporary Art Intelligence

SearchMaster: Framework di Self-Play per l'Addestramento di Agenti di Ricerca LLM

ai-technology · 2026-08-04

Un recente articolo pubblicato su arXiv (2608.01822) presenta SearchMaster, un framework di self-play progettato per addestrare agenti di ricerca basati su modelli linguistici di grandi dimensioni (LLM). Questo framework innovativo consente a un singolo LLM di creare, risolvere e validare compiti di ricerca in un ambiente localizzato, affrontando il problema dell'acquisizione di dati di addestramento di alta qualità. I metodi tradizionali dipendono da compiti creati da esseri umani, dimostrazioni di esperti o modelli insegnanti superiori, mentre SearchMaster cerca di eliminare questi vincoli utilizzando compiti auto-generati. Tuttavia, i compiti auto-generati possono portare a segnali fuorvianti, inclusi pseudo-domande multi-hop e stime inaccurate del tasso di successo. Per mitigare questi problemi, SearchMaster implementa tre controlli: un Evidence-Chain Generator (ECG), un Search-Depth Reward (SDR) e un terzo controllo meno dettagliato, probabilmente volto a migliorare la qualità dei rollout. L'articolo descrive questi approcci per avanzare nell'addestramento degli agenti di ricerca.

Fatti principali

  • SearchMaster è un framework di self-play per l'addestramento di agenti di ricerca basati su LLM.
  • Addestra un singolo LLM su compiti di ricerca che genera, risolve e verifica in un ambiente di ricerca locale.
  • Il framework affronta i segnali fuorvianti derivanti da compiti e rollout auto-generati.
  • Vengono introdotti tre controlli: Evidence-Chain Generator (ECG), Search-Depth Reward (SDR) e un terzo controllo.
  • ECG fonda la generazione di compiti su catene di evidenze esplicite tra documenti per ridurre le pseudo-domande multi-hop.
  • SDR valuta la difficoltà del compito in base alla profondità di ricerca.
  • L'articolo è disponibile su arXiv con ID 2608.01822.
  • Il tipo di annuncio è 'nuovo'.

Entità

Istituzioni

  • arXiv

Fonti