Credito Token nella Self-Distillazione: Nuova Ricerca da arXiv
Uno studio recente pubblicato su arXiv (2608.09263) indaga l'efficacia dell'assegnazione del credito token nella self-distillazione on-policy per modelli linguistici di grandi dimensioni. I ricercatori sostengono che un cambiamento nella probabilità dei token non equivale necessariamente a un credito per i risultati. Identificano tre domande critiche: se il punteggio riflette accuratamente azioni superiori, come la costruzione del feedback altera i confronti, e quale comportamento promuove la perdita di addestramento. L'articolo delinea formalmente questi aspetti. Quando si valuta un rollout con feedback hindsight relativo allo stesso rollout, il contenuto influenza sia i token che il contesto di punteggio, risultando in una auto-dipendenza diretta. Utilizzare feedback da un rollout diverso dello stesso problema elimina questa dipendenza, ma non garantisce un punteggio significativo. Negli esperimenti con un modello da 20B su AIME 2025, il punteggio additivo ottenuto è vicino al caso (AUC=0.505) e favorisce leggermente i token errati. Questo studio sottolinea la necessità di una validazione approfondita delle tecniche di self-distillazione privilegiate.
Fatti principali
- Articolo su arXiv: 2608.09263
- Focus: credito token nella self-distillazione on-policy
- Gli autori separano tre domande sulla validità del punteggio
- Il feedback hindsight sullo stesso rollout crea auto-dipendenza
- Usare feedback da un altro rollout rimuove la dipendenza
- Esperimenti con modello da 20B su AIME 2025
- Punteggio additivo vicino al caso (AUC=0.505)
- Il punteggio favorisce leggermente i token errati
Entità
Istituzioni
- arXiv