ARTFEED — Contemporary Art Intelligence

CAST: Utilizzare Risolutori di Giochi per Guidare l'Addestramento di Agenti LLM

other · 2026-07-29

Un nuovo approccio noto come CAST (Credit Assignment from Solver Teachers) migliora il processo di addestramento dei modelli linguistici di grandi dimensioni (LLM) per giochi estesi, utilizzando risolutori di giochi per fornire feedback a ogni turno. L'apprendimento per rinforzo tradizionale con ricompense verificabili (RLVR) offre solo ricompense finali limitate, complicando il compito di attribuire il successo ad azioni specifiche. CAST traduce le variazioni del valore di stato di un risolutore in vantaggi del risolutore, integrandoli come segnali densi all'interno di RLVR. Assumendo un risolutore soft-ottimale, massimizzare il vantaggio del risolutore equivale alla distillazione on-policy dal risolutore, basandosi esclusivamente su valori scalari. Questa tecnica è stata valutata utilizzando giochi come Sokoban e Minesweeper, tra gli altri.

Fatti principali

  • CAST sta per Credit Assignment from Solver Teachers
  • Utilizza le variazioni del valore di stato del risolutore di giochi come segnali di credito a livello di turno
  • Massimizzare il vantaggio del risolutore equivale alla distillazione on-policy sotto l'assunzione soft-ottimale
  • Testato su Sokoban e Minesweeper
  • Pubblicato su arXiv con ID 2607.25308

Entità

Fonti