Rilevamento di allucinazioni senza addestramento per modelli linguistici di diffusione
Un nuovo articolo di ricerca introduce TRE, una metrica di rilevamento delle allucinazioni senza addestramento per modelli linguistici di diffusione di grandi dimensioni (D-LLM). A differenza degli approcci basati sull'addestramento esistenti, TRE non richiede addestramento del rilevatore né campionamento ripetuto, operando direttamente sui segnali di entropia di una singola generazione. Estrae l'entropia lungo le dimensioni spaziali e temporali durante il processo di decodifica del D-LLM, concentrandosi sui token di rivelazione come i più soggetti ad allucinazioni. Questo metodo senza parametri e a esecuzione singola mira a migliorare l'affidabilità senza costi aggiuntivi o overhead di implementazione. L'articolo è disponibile su arXiv con ID 2607.22661.
Fatti principali
- TRE è una metrica di rilevamento delle allucinazioni senza addestramento per D-LLM.
- È senza parametri e richiede solo una singola esecuzione di generazione.
- Estrae segnali di entropia dalle dimensioni spaziali e temporali.
- Si concentra sui token di rivelazione come i più soggetti ad allucinazioni.
- Mira a superare le limitazioni dei metodi di rilevamento basati sull'addestramento.
- Articolo disponibile su arXiv: 2607.22661.
- Nessun addestramento del rilevatore o campionamento ripetuto necessario.
- Riduce i costi di addestramento aggiuntivi e l'overhead di implementazione.
Entità
Istituzioni
- arXiv