ARTFEED — Contemporary Art Intelligence

DASH: Migliorare l'auto-distillazione on-policy per modelli di ragionamento

other · 2026-08-07

Un nuovo articolo su arXiv (2608.06243) introduce DASH (Divergence-Adaptive Supervision Horizons), un metodo per migliorare l'auto-distillazione on-policy (OPSD) per l'addestramento di modelli di ragionamento. L'OPSD mitiga la scarsità di ricompense verificabili utilizzando un insegnante privilegiato per fornire una supervisione densa a livello di token sui prefissi visitati dallo studente. Tuttavia, l'OPSD standard assegna coefficienti uguali a tutte le divergenze locali, ignorando il contesto temporale del rollout. DASH adatta gli orizzonti di supervisione in base alle sequenze di divergenza, consentendo al modello di sfruttare meglio la struttura temporale della generazione autoregressiva. L'articolo è scritto da ricercatori ed è stato annunciato su arXiv. Il metodo mira a migliorare le capacità di ragionamento dei modelli linguistici di grandi dimensioni utilizzando in modo più efficace i segnali di supervisione densi.

Fatti principali

  • ID dell'articolo: arXiv:2608.06243
  • Tipo di annuncio: nuovo
  • Metodo: DASH (Divergence-Adaptive Supervision Horizons)
  • Migliora l'auto-distillazione on-policy (OPSD)
  • Affronta la scarsità di ricompense verificabili in RLVR
  • Utilizza un insegnante privilegiato per una supervisione densa a livello di token
  • L'OPSD standard assegna coefficienti uguali alle divergenze locali
  • DASH adatta gli orizzonti di supervisione in base alle sequenze di divergenza

Entità

Istituzioni

  • arXiv

Fonti