RLSVR: Ricompense Auto-Verificabili per il Miglioramento Automatico di LLM aperti
I ricercatori hanno introdotto il Reinforcement Learning con Ricompense Auto-Verificabili (RLSVR), un nuovo framework di addestramento che potenzia RLVR per compiti aperti trasformandoli in ambienti proxy verificabili. Mentre RLVR ha notevolmente avanzato i LLM focalizzati sul ragionamento, la sua applicabilità è limitata ad aree come matematica e programmazione, dove la correttezza può essere verificata in modo definitivo. Al contrario, i compiti aperti dipendono da preferenze umane, modelli di ricompensa o valutazioni da parte di LLM, che possono portare a bias e costi maggiori. RLSVR sfrutta l'apprendimento auto-supervisionato per creare compiti pretesto che generano supervisione dai dati stessi, producendo segnali di ricompensa automaticamente attraverso regole interne e risultati delle interazioni. L'articolo completo è disponibile su arXiv.
Fatti principali
- 1. RLVR è limitato a matematica e coding dove la correttezza è verificabile deterministicamente.
- 2. I compiti aperti dipendono da preferenze umane, modelli di ricompensa o giudici basati su LLM.
- 3. RLSVR trasforma i compiti aperti in ambienti proxy verificabili.
- 4. RLSVR genera automaticamente segnali di ricompensa da regole interne e risultati delle interazioni.
- 5. L'approccio si basa su principi di apprendimento auto-supervisionato.
- 6. L'articolo è disponibile su arXiv con ID 2607.23802.
- 7. RLVR ha guidato recenti progressi nei LLM orientati al ragionamento.
- 8. RLSVR mira a estendere RLVR ai compiti aperti.
Entità
Istituzioni
- arXiv