ARTFEED — Contemporary Art Intelligence

Re-FORC: Predizione Adattiva della Ricompensa per un Ragionamento a Catena di Pensiero Efficiente

ai-technology · 2026-07-27

I ricercatori hanno introdotto Re-FORC, un metodo per la predizione adattiva della ricompensa che stima le ricompense future analizzando la quantità di token di pensiero. L'utilizzo di un adattatore leggero addestrato su modelli di ragionamento migliora le previsioni, in particolare con ragionamento esteso e modelli più grandi. Re-FORC facilita la terminazione anticipata di catene di ragionamento inefficaci, portando a una riduzione del carico computazionale fino al 26% mantenendo l'accuratezza. Inoltre, ottimizza la selezione del modello e della lunghezza del ragionamento, ottenendo un aumento massimo dell'accuratezza di 1,7 punti percentuali con un carico computazionale inferiore fino al 12% rispetto al solo modello più grande. Inoltre, il ridimensionamento adattivo al momento del test aumenta l'accuratezza di 9,9 punti percentuali rispetto ai basati sulla confidenza, consentendo un ragionamento dinamico controllato da soglie di costo per token.

Fatti principali

  • Re-FORC predice le ricompense future attese in funzione dei futuri token di pensiero.
  • Un adattatore leggero è addestrato su modelli di ragionamento.
  • L'arresto anticipato riduce il carico computazionale fino al 26% mantenendo l'accuratezza.
  • La selezione ottimizzata raggiunge un'accuratezza massima superiore di 1,7 punti percentuali.
  • Fino al 12% in meno di carico computazionale per eguagliare l'accuratezza del modello più grande.
  • Il ridimensionamento adattivo al momento del test aumenta l'accuratezza di 9,9 punti percentuali.
  • Ragionamento dinamico con controllo della lunghezza tramite soglie di costo per token.
  • Il metodo è proposto in arXiv:2511.02130.

Entità

Istituzioni

  • arXiv

Fonti