Distillazione mascherata interiorizza la catena di pensiero nei modelli linguistici
Un nuovo quadro per la distillazione della conoscenza, noto come distillazione mascherata, consente ai modelli linguistici studenti di comprendere i processi di ragionamento di modelli più grandi. I modelli di ragionamento di grandi dimensioni (LRM) producono sequenze dettagliate di token intermedi prima di arrivare alle risposte finali, il che incide significativamente sulla latenza e sui costi; tuttavia, la correttezza di queste tracce non è necessariamente correlata all'accuratezza delle risposte. Nella distillazione mascherata, un LLM studente impara a anticipare solo i token della soluzione basandosi sulla domanda, mentre un insegnante di ragionamento offre guida attraverso la propria catena di pensiero. Questo metodo mira a minimizzare la lunghezza delle tracce intermedie e ridurre i costi operativi mantenendo la precisione delle risposte. La ricerca è disponibile su arXiv con ID 2607.22629.
Fatti principali
- I modelli di ragionamento di grandi dimensioni producono lunghe catene esplicite di passaggi intermedi prima delle risposte finali.
- Le tracce intermedie dominano la latenza, l'uso della memoria e il costo di servizio.
- La correttezza della risposta finale non è causalmente correlata alla correttezza della traccia.
- La lunghezza della traccia non è un indicatore affidabile della complessità del problema.
- La distillazione mascherata è un quadro di distillazione della conoscenza.
- L'LLM studente è addestrato a prevedere solo i token della soluzione condizionati dalla domanda.
- L'insegnante di ragionamento fornisce feedback dopo essersi condizionato sulla domanda e sulla propria traccia CoT.
- L'articolo è disponibile su arXiv con ID 2607.22629.
Entità
Istituzioni
- arXiv