ARTFEED — Contemporary Art Intelligence

DMAPO: Accordo Multi-Valutatore Centrato sui Dati per l'Ottimizzazione delle Preferenze

ai-technology · 2026-07-29

Esiste un nuovo metodo chiamato DMAPO, che sta per Data-centric Multi-evaluator Agreement for Preference Optimization. È progettato per migliorare l'allineamento dei modelli linguistici utilizzando un insieme piccolo e affidabile di risposte on-policy. Invece di modificare gli obiettivi di addestramento mantenendo gli stessi dati, DMAPO genera risposte dalla policy target e le valuta in base a utilità, correttezza fattuale e chiarezza con l'aiuto di valutatori specifici. Successivamente, perfeziona le risposte mantenendo solo quelle su cui c'è maggiore accordo. Da un pool di 54.236 candidati da Mistral-7B, solo 1.871 (3,45%) sono stati selezionati. Il modello KTO, addestrato su questi, ha ottenuto un punteggio di 7,50 su MT-Bench e ha superato text-davinci-003 con un tasso di vittoria del 95,5%.

Fatti principali

  • 1. DMAPO sta per Data-centric Multi-evaluator Agreement for Preference Optimization.
  • 2. Il metodo genera risposte candidate dalla policy target.
  • 3. Valuta utilità, correttezza fattuale e concisione con valutatori specializzati in rubriche.
  • 4. Applica una correzione basata su process-critic.
  • 5. Mantiene solo esempi desiderabili o indesiderabili ad alto consenso.
  • 6. Accetta 1.871 di 54.236 candidati da Mistral-7B (3,45%).
  • 7. KTO addestrato su questo insieme raggiunge 7,50 su MT-Bench.
  • 8. Ottiene un tasso di vittoria controllato per lunghezza del 95,5% contro text-davinci-003.
  • 9. Raggiunge una precisione del 57,3% su IFEval.
  • 10. GPT-4o produce un tasso di vittoria netto di 23,3 punti su 129 prompt tenuti da parte e 24,0 punti su 200 LMSY fuori distribuzione.

Entità

Fonti