ARTFEED — Contemporary Art Intelligence

Nuovo pipeline di valutazione dei dati migliora l'allineamento degli LLM

ai-technology · 2026-07-29

Uno studio recente presenta un framework scalabile di valutazione dei dati per modelli linguistici di grandi dimensioni (LLM) che stima il valore di Shapley senza necessità di riaddestramenti ripetuti. Questa tecnica affronta le sfide della qualità dei dati nell'allineamento convertendo i vicinati semantici k-NN in un grafo diretto e valutando l'utilità dei dati tramite la distribuzione di probabilità di un LLM di riferimento, utilizzando spostamenti di log-verosimiglianza condizionale zero-shot e one-shot. Il framework converte i punteggi di influenza predittiva in metriche di vantaggio localizzate per identificare voci problematiche, come contraddizioni nascoste, problemi di sicurezza ed errori di annotazione. Progettato per ampi dataset di preferenze e istruzioni, questo metodo opera esclusivamente sull'inferenza.

Fatti principali

  • ID articolo arXiv: 2607.22766
  • Tipo di annuncio: cross
  • Il metodo approssima il valore di Shapley senza addestramento iterativo
  • Utilizza vicinati semantici k-NN mappati in un grafo diretto
  • Valuta l'utilità dei dati tramite la distribuzione di probabilità di un LLM di riferimento
  • Applica spostamenti di log-verosimiglianza condizionale zero-shot e one-shot
  • Traduce i punteggi di influenza in metriche di vantaggio localizzate
  • Affronta problemi di qualità dei dati nell'allineamento degli LLM

Entità

Istituzioni

  • arXiv

Fonti