MetaEvolve: Insegnare agli LLM Meta-Skills di Auto-Evoluzione tramite Apprendimento per Rinforzo
MetaEvolve, un framework recentemente introdotto, mira a potenziare le meta-skills essenziali nei modelli linguistici di grandi dimensioni (LLM) per promuovere un'efficace auto-evoluzione. Questa iniziativa si basa sui successi di AlphaEvolve, che ha mostrato miglioramenti attraverso l'auto-evoluzione iterativa guidata dal feedback ambientale. MetaEvolve colma una lacuna nei metodi di post-addestramento convenzionali che trascurano meta-skills vitali come l'autoriflessione. Il framework incorpora una pipeline di sintesi dei dati, apprendimento per rinforzo (RL) consapevole dell'evoluzione e ricerca evolutiva durante l'inferenza. La sua base risiede nella programmazione, dove l'esecuzione continua del programma fornisce segnali di ricompensa continui oltre alla mera correttezza. I dati di addestramento comprendono traiettorie evolutive, inclusi il programma corrente, il punteggio di fitness (che integra correttezza ed efficienza) e la cronologia dei tentativi precedenti. I risultati dettagliati sono disponibili in un articolo su arXiv (2607.21971).
Fatti principali
- MetaEvolve è un framework per insegnare agli LLM meta-skills per l'auto-evoluzione.
- Si basa sull'auto-evoluzione iterativa di AlphaEvolve con feedback ambientale.
- Le meta-skills come l'autoriflessione sono ampiamente trascurate dal post-addestramento tradizionale.
- Il framework utilizza una pipeline di sintesi dei dati, RL consapevole dell'evoluzione e ricerca evolutiva durante l'inferenza.
- MetaEvolve è fondato sulla programmazione, dove l'esecuzione del programma fornisce segnali di ricompensa continui.
- I dati di addestramento includono traiettorie evolutive con programma corrente, punteggio di fitness e cronologia.
- L'articolo è disponibile su arXiv con identificatore 2607.21971.
- L'approccio mira a consentire un raffinamento multi-round efficace negli LLM.
Entità
Istituzioni
- arXiv