LOFA: Apprendimento di Agenti di Shopping dal Feedback Online degli Utenti
Il framework di nuova introduzione, LOFA, consente agli agenti di shopping basati su grandi modelli linguistici di apprendere direttamente dai log di interazione online reali, senza la necessità di annotazione umana. Questo metodo innovativo affronta i problemi di feedback online diversificato, sparso e rumoroso integrando l'apprendimento per rinforzo basato su risultati di acquisto verificabili con la distillazione on-policy sensibile al feedback. Cattura efficacemente le direttive degli utenti durante le conversazioni e le trasforma in segnali di apprendimento affidabili, affrontando le carenze dei metodi attuali che dipendono da segnali di addestramento offline come le interazioni utente-articolo o i dati di preferenza sintetici. Un articolo che delinea questo framework è stato pubblicato su arXiv (ID: 2608.11604), mostrando il suo potenziale per migliorare gli agenti di shopping nell'e-commerce reale utilizzando le preziose intuizioni del feedback conversazionale naturale degli utenti.
Fatti principali
- LOFA è un framework per agenti di shopping per apprendere dai log di interazione online.
- Utilizza l'apprendimento per rinforzo su risultati di acquisto verificabili.
- Impiega la distillazione on-policy sensibile al feedback.
- Il metodo identifica le direttive degli utenti nel dialogo.
- Converte il feedback online eterogeneo, sparso e rumoroso in segnali di apprendimento.
- Gli approcci esistenti si basano su segnali di addestramento offline come le interazioni utente-articolo.
- L'articolo è disponibile su arXiv con ID 2608.11604.
- Il framework non richiede annotazione umana.
Entità
Istituzioni
- arXiv