HeuristicEdu allinea i LLM come tutor socratici tramite apprendimento per rinforzo
HeuristicEdu, un pipeline in due fasi, è stato creato da ricercatori per guidare il grande modello linguistico Qwen2.5-7B verso un tutoraggio socratico anziché fornire semplicemente risposte. Questo approccio impiega un riscaldamento supervisionato e l'ottimizzazione delle politiche relative di gruppo (GRPO) utilizzando SocraticEdu, una raccolta di 797 dialoghi multigiro in cinese incentrati sulla scienza per bambini da una piattaforma live. Una funzione di ricompensa euristica misura la profondità cognitiva, il coinvolgimento della curiosità e la direttezza, incorporando un aggiustamento K_query per i termini introdotti dagli studenti. Nuove metriche, Efficacia dell'Impalcatura (SE) e Profondità della Conversazione (CD), valutano i risultati oltre la semplice fluidità. La variante GRPO migliore ha migliorato SE dal 30,0% al 63,3% e minimizzato la fuga di parole chiave dal 30,0% al 13,3% su 30 domande trattenute. Questa ricerca è stata pubblicata su arXiv (2607.22996v1).
Fatti principali
- Il pipeline HeuristicEdu allinea Qwen2.5-7B verso il tutoraggio socratico
- Utilizza riscaldamento supervisionato e ottimizzazione delle politiche relative di gruppo (GRPO)
- Addestrato sul dataset SocraticEdu di 797 dialoghi multigiro in cinese su scienza per bambini
- Ricompensa euristica basata su profondità cognitiva (R_cog), coinvolgimento della curiosità (R_eng) e direttezza (R_dir)
- Correzione K_query per i termini introdotti dagli studenti
- Nuove metriche: Efficacia dell'Impalcatura (SE) e Profondità della Conversazione (CD)
- La migliore variante GRPO ha migliorato SE dal 30,0% al 63,3% su 30 domande trattenute
- La fuga di parole chiave è stata ridotta dal 30,0% al 13,3%
- Pubblicato su arXiv con ID 2607.22996v1
Entità
Istituzioni
- arXiv