ARTFEED — Contemporary Art Intelligence

RISE-RL: Nuovo Metodo Migliora l'RL Open-Ended per gli LLM

ai-technology · 2026-08-11

Uno studio recente introduce RISE-RL (Rubric-Informed Selective Exploration), un approccio innovativo volto a migliorare l'apprendimento per rinforzo (RL) per l'allineamento dei modelli linguistici di grandi dimensioni (LLM) in compiti open-ended. Questi compiti presentano la difficoltà di richiedere risposte che soddisfino vari criteri, senza un'unica risposta corretta. I metodi RL tradizionali basati su rubriche condensano il feedback dettagliato in ricompense scalari, complicando l'identificazione delle carenze di capacità in corso durante l'esplorazione on-policy limitata. RISE-RL affronta questo problema concentrandosi sui criteri della rubrica spesso trascurati per scoprire traiettorie preziose che l'esplorazione standard potrebbe perdere. Mantiene solo quelle traiettorie in cui la ricompensa completa della rubrica supera la ricompensa media dei rollout naturali e poi le rivaluta in base al prompt originale per evidenziare comportamenti che la politica naturale supporta in modo inadeguato. Il segnale di guida viene affinato attraverso un obiettivo ausiliario distinto e viene scartato dopo l'addestramento. La ricerca è accessibile su arXiv con ID 2608.09123.

Fatti principali

  • RISE-RL sta per Rubric-Informed Selective Exploration.
  • Affronta l'RL open-ended per gli LLM.
  • I metodi RL esistenti basati su rubriche comprimono il feedback in ricompense scalari.
  • RISE-RL utilizza criteri di rubrica ripetutamente mancati per elicitare traiettorie privilegiate.
  • Mantiene traiettorie con ricompensa completa della rubrica superiore alla media dei rollout naturali.
  • Rivaluta le traiettorie sotto il prompt originale.
  • Ottimizza il segnale di guida attraverso un obiettivo ausiliario separato.
  • L'articolo è su arXiv con ID 2608.09123.

Entità

Istituzioni

  • arXiv

Fonti