ARTFEED — Contemporary Art Intelligence

Distillazione mascherata interiorizza la catena di pensiero nei modelli linguistici

ai-technology · 2026-07-29

Un nuovo quadro per la distillazione della conoscenza, noto come distillazione mascherata, consente ai modelli linguistici studenti di comprendere i processi di ragionamento di modelli più grandi. I modelli di ragionamento di grandi dimensioni (LRM) producono sequenze dettagliate di token intermedi prima di arrivare alle risposte finali, il che incide significativamente sulla latenza e sui costi; tuttavia, la correttezza di queste tracce non è necessariamente correlata all'accuratezza delle risposte. Nella distillazione mascherata, un LLM studente impara a anticipare solo i token della soluzione basandosi sulla domanda, mentre un insegnante di ragionamento offre guida attraverso la propria catena di pensiero. Questo metodo mira a minimizzare la lunghezza delle tracce intermedie e ridurre i costi operativi mantenendo la precisione delle risposte. La ricerca è disponibile su arXiv con ID 2607.22629.

Fatti principali

  • I modelli di ragionamento di grandi dimensioni producono lunghe catene esplicite di passaggi intermedi prima delle risposte finali.
  • Le tracce intermedie dominano la latenza, l'uso della memoria e il costo di servizio.
  • La correttezza della risposta finale non è causalmente correlata alla correttezza della traccia.
  • La lunghezza della traccia non è un indicatore affidabile della complessità del problema.
  • La distillazione mascherata è un quadro di distillazione della conoscenza.
  • L'LLM studente è addestrato a prevedere solo i token della soluzione condizionati dalla domanda.
  • L'insegnante di ragionamento fornisce feedback dopo essersi condizionato sulla domanda e sulla propria traccia CoT.
  • L'articolo è disponibile su arXiv con ID 2607.22629.

Entità

Istituzioni

  • arXiv

Fonti