SearchMaster: Framework di Self-Play per l'Addestramento di Agenti di Ricerca LLM
Un recente articolo pubblicato su arXiv (2608.01822) presenta SearchMaster, un framework di self-play progettato per addestrare agenti di ricerca basati su modelli linguistici di grandi dimensioni (LLM). Questo framework innovativo consente a un singolo LLM di creare, risolvere e validare compiti di ricerca in un ambiente localizzato, affrontando il problema dell'acquisizione di dati di addestramento di alta qualità. I metodi tradizionali dipendono da compiti creati da esseri umani, dimostrazioni di esperti o modelli insegnanti superiori, mentre SearchMaster cerca di eliminare questi vincoli utilizzando compiti auto-generati. Tuttavia, i compiti auto-generati possono portare a segnali fuorvianti, inclusi pseudo-domande multi-hop e stime inaccurate del tasso di successo. Per mitigare questi problemi, SearchMaster implementa tre controlli: un Evidence-Chain Generator (ECG), un Search-Depth Reward (SDR) e un terzo controllo meno dettagliato, probabilmente volto a migliorare la qualità dei rollout. L'articolo descrive questi approcci per avanzare nell'addestramento degli agenti di ricerca.
Fatti principali
- SearchMaster è un framework di self-play per l'addestramento di agenti di ricerca basati su LLM.
- Addestra un singolo LLM su compiti di ricerca che genera, risolve e verifica in un ambiente di ricerca locale.
- Il framework affronta i segnali fuorvianti derivanti da compiti e rollout auto-generati.
- Vengono introdotti tre controlli: Evidence-Chain Generator (ECG), Search-Depth Reward (SDR) e un terzo controllo.
- ECG fonda la generazione di compiti su catene di evidenze esplicite tra documenti per ridurre le pseudo-domande multi-hop.
- SDR valuta la difficoltà del compito in base alla profondità di ricerca.
- L'articolo è disponibile su arXiv con ID 2608.01822.
- Il tipo di annuncio è 'nuovo'.
Entità
Istituzioni
- arXiv