ARTFEED — Contemporary Art Intelligence

Il framework SCOPE utilizza la predizione conformale per calibrare i giudici LLM nelle valutazioni a coppie

ai-technology · 2026-08-19

Una recente pubblicazione su arXiv introduce SCOPE (Selective Conformal Optimized Pairwise Evaluation), un sistema progettato per regolare una soglia di accettazione, garantendo che il tasso di errore per i giudizi non astenuti rimanga entro un livello α definito dall'utente. Presenta l'entropia di preferenza bidirezionale (BPE), che coinvolge i giudici presentando entrambe le sequenze di risposta per ottenere un segnale di incertezza senza bias. Negli esperimenti, la BPE ha superato le tradizionali proxy di confidenza sia in calibrazione che in discriminazione. SCOPE ha raggiunto un tasso di falsa scoperta empirico compreso tra circa 0.097 e 0.099 con α=0.10, gestendo efficacemente i tassi di errore. L'articolo, arXiv:2602.13110, affronta le carenze dei sistemi di valutazione basati su LLM e fornisce una strategia per calibrare i giudici a coppie, migliorando così le valutazioni automatizzate in vari domini.

Fatti principali

  • 1. SCOPE è un framework per calibrare le soglie di accettazione nella valutazione a coppie con LLM.
  • 2. Garantisce che il tasso di errore tra i giudizi non astenuti sia al massimo un α specificato dall'utente sotto scambiabilità.
  • 3. La BPE (Entropia di Preferenza Bidirezionale) è introdotta come segnale di incertezza neutrale rispetto al bias.
  • 4. La BPE interroga il giudice in entrambe le posizioni di risposta e utilizza la probabilità di preferenza mediata per ordine.
  • 5. La BPE supera le proxy di confidenza standard in calibrazione e discriminazione nei benchmark di giudizio a coppie.
  • 6. SCOPE raggiunge empiricamente un FDR ≈ 0.097–0.099 con α=0.10.
  • 7. SCOPE mantiene una copertura sostanziale soddisfacendo al contempo il vincolo di rischio.
  • 8. L'articolo è disponibile su arXiv come 2602.13110, con tipo di annuncio replace-cross.

Entità

Fonti