DMAPO: Accordo Multi-Valutatore Centrato sui Dati per l'Ottimizzazione delle Preferenze
Esiste un nuovo metodo chiamato DMAPO, che sta per Data-centric Multi-evaluator Agreement for Preference Optimization. È progettato per migliorare l'allineamento dei modelli linguistici utilizzando un insieme piccolo e affidabile di risposte on-policy. Invece di modificare gli obiettivi di addestramento mantenendo gli stessi dati, DMAPO genera risposte dalla policy target e le valuta in base a utilità, correttezza fattuale e chiarezza con l'aiuto di valutatori specifici. Successivamente, perfeziona le risposte mantenendo solo quelle su cui c'è maggiore accordo. Da un pool di 54.236 candidati da Mistral-7B, solo 1.871 (3,45%) sono stati selezionati. Il modello KTO, addestrato su questi, ha ottenuto un punteggio di 7,50 su MT-Bench e ha superato text-davinci-003 con un tasso di vittoria del 95,5%.
Fatti principali
- 1. DMAPO sta per Data-centric Multi-evaluator Agreement for Preference Optimization.
- 2. Il metodo genera risposte candidate dalla policy target.
- 3. Valuta utilità, correttezza fattuale e concisione con valutatori specializzati in rubriche.
- 4. Applica una correzione basata su process-critic.
- 5. Mantiene solo esempi desiderabili o indesiderabili ad alto consenso.
- 6. Accetta 1.871 di 54.236 candidati da Mistral-7B (3,45%).
- 7. KTO addestrato su questo insieme raggiunge 7,50 su MT-Bench.
- 8. Ottiene un tasso di vittoria controllato per lunghezza del 95,5% contro text-davinci-003.
- 9. Raggiunge una precisione del 57,3% su IFEval.
- 10. GPT-4o produce un tasso di vittoria netto di 23,3 punti su 129 prompt tenuti da parte e 24,0 punti su 200 LMSY fuori distribuzione.
Entità
—