ARTFEED — Contemporary Art Intelligence

Nuovo studio: nessun segnale universale prevede la regressione a livello di campione nei LLM tra aggiornamenti di versione

ai-technology · 2026-08-17

Un articolo su arXiv (2608.13607) esplora la prevedibilità della regressione a livello di singolo campione nei modelli linguistici di grandi dimensioni (LLM) basata su segnali a tempo di inferenza durante gli aggiornamenti del modello. La ricerca contrappone indicatori a modello singolo (come confidenza, margine logit e entropia dell'attenzione) con indicatori cross-versione (inclusi divergenza KL di output, deriva di verosimiglianza, KL a livello di token e deriva di rappresentazione) attraverso un test unificato di valore aggiunto che valuta il contributo di ciascun segnale oltre una baseline di confidenza. Analizzando sei benchmark in tre categorie di compiti (risposta a domande a scelta multipla, ragionamento matematico e generazione di codice) e sei coppie di aggiornamenti di modello, i risultati rivelano che l'efficacia dei segnali varia a seconda del compito: la confidenza eccelle in MCQ e matematica di base, mentre i segnali di verosimiglianza/KL funzionano meglio nella generazione di codice e nella matematica complessa. Non esiste un segnale universale per prevedere la regressione in tutti i compiti, sottolineando la necessità di strategie specifiche per compito. L'articolo è stato sottomesso ad arXiv.

Fatti principali

  • Articolo arXiv:2608.13607v1
  • Tipo di annuncio: nuovo
  • Confronta segnali a modello singolo e cross-versione
  • Test unificato di valore aggiunto isola i guadagni dei segnali rispetto alla baseline di confidenza
  • Sei benchmark in tre famiglie di compiti
  • Sei coppie di aggiornamenti di modello
  • L'efficacia dei segnali dipende dal compito
  • La confidenza è più forte in MCQ e matematica più semplice
  • I segnali di verosimiglianza/KL sono migliori per la generazione di codice e la matematica più difficile
  • Nessun segnale universale prevede la regressione

Entità

Istituzioni

  • arXiv

Fonti