Fast MCTS: ricompense basate sul guadagno informativo per un KBQA basato su LLM più efficiente
Fast MCTS, introdotto nell'articolo arXiv 2502.13428v2, migliora il question answering su basi di conoscenza basato su LLM applicando la ricerca ad albero Monte Carlo con ricompense basate sul guadagno informativo. Sostituisce i costosi rollout terminali con un segnale di ricompensa per stati intermedi, calcolato come una proxy del rapporto di perplessità condizionato alla domanda su storie di interazione sanitizzate. Ciò richiede solo passaggi in avanti di un LLM di istruzioni open-source, eliminando la necessità di addestrare un modello di ricompensa separato. Il metodo supera costantemente le baseline lineari su quattro benchmark KBQA, affrontando le sfide esistenti della progettazione delle ricompense e del costo della ricerca.
Fatti principali
- L'articolo è arXiv:2502.13428v2 con tipo di annuncio replace-cross.
- Applica la ricerca ad albero Monte Carlo (MCTS) al KBQA basato su LLM.
- La progettazione delle ricompense è difficile e la ricerca basata su rollout è computazionalmente costosa nei metodi esistenti.
- I metodi esistenti stile MCTS si affidano al punteggio diretto dell'LLM o richiedono dati sostanziali per addestrare modelli di ricompensa separati.
- Fast MCTS utilizza una ricompensa basata sul guadagno informativo (IG) per gli stati intermedi invece dei rollout terminali.
- La ricompensa IG è una proxy del rapporto di perplessità (PPL) condizionato alla domanda su storie di interazione sanitizzate.
- Utilizza un LLM di istruzioni open-source senza addestramento aggiuntivo del modello di ricompensa.
- Fast MCTS supera le baseline lineari su quattro benchmark KBQA.
Entità
Istituzioni
- arXiv