ARTFEED — Contemporary Art Intelligence

CoRT: Assegnazione del Credito a Livello di Token per RL Guidato da Rubriche negli LLM

ai-technology · 2026-07-29

Un nuovo approccio chiamato CoRT (Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization) affronta una sfida nell'apprendimento per rinforzo basato su rubriche per modelli linguistici. I tradizionali framework GRPO semplificano le valutazioni delle rubriche in un unico premio scalare, applicato uniformemente a tutti i token, con conseguente mancanza di una distribuzione specifica del credito. CoRT, invece, implementa una ponderazione del credito a livello di token senza la necessità di un modello aggiuntivo. Utilizza il replay controfattuale riscorrendo la stessa risposta campionata sia con il prompt originale condizionato dalla rubrica sia con un prompt corrispondente senza criteri. I contrasti nella log-verosimiglianza a livello di token fungono da proxy per la dipendenza dal contesto della rubrica, che vengono poi convertiti in pesi limitati e normalizzati per risposta. Questo metodo è descritto in un articolo disponibile su arXiv (2607.25659).

Fatti principali

  • CoRT è un metodo di ponderazione del credito a livello di token per GRPO condizionato da rubriche.
  • Utilizza il replay controfattuale per riscorrere le risposte con prompt con e senza rubrica.
  • I contrasti nella log-verosimiglianza a livello di token fungono da proxy per la dipendenza dal contesto della rubrica.
  • Non è richiesto un modello ausiliario di scoring dei token.
  • I pipeline GRPO standard distribuiscono premi scalari uniformemente a tutti i token.
  • L'articolo è disponibile su arXiv con ID 2607.25659.
  • L'RL basato su rubriche valuta gli output rispetto a criteri espliciti.
  • CoRT mappa i contrasti in pesi limitati e normalizzati per risposta.

Entità

Istituzioni

  • arXiv

Fonti