ARTFEED — Contemporary Art Intelligence

Le soglie di similarità coseno negli embedding falliscono come barriere di sicurezza nei sistemi agente

ai-technology · 2026-08-13

Un recente preprint su arXiv (2608.10216) esamina l'efficacia delle soglie di similarità coseno negli embedding come misure di controllo qualità all'interno dei framework agente. Queste soglie sono tipicamente utilizzate per attività come deduplicazione, cache semantica, rilevamento di deriva e valutazione delle risposte, per valutare se due segmenti di testo mantengono lo stesso significato. Tuttavia, l'analisi indica che queste metriche riflettono cambiamenti nella formulazione piuttosto che un vero allineamento semantico. L'audit mostra una divergenza significativa; ad esempio, una modifica minore può portare a una bassa variazione del coseno mentre una riformulazione completa può risultare in un'alta similarità. In un guardiano di deriva di produzione valutato, non è riuscito a identificare nessuna delle 56 mutazioni che alterano il significato. L'articolo, scritto da ricercatori e disponibile su arXiv, sottolinea un difetto critico nell'affidarsi alle soglie di similarità coseno negli embedding per l'accuratezza semantica, sollevando preoccupazioni per la sicurezza e l'affidabilità dell'IA nei sistemi agente.

Fatti principali

  • Il preprint arXiv:2608.10216 verifica le soglie di similarità coseno negli embedding come barriere di qualità nei sistemi agente.
  • Le barriere sono utilizzate per deduplicazione, cache semantiche, guardiani di deriva e valutazione delle risposte.
  • Il punteggio misura il cambiamento nella formulazione, non l'equivalenza semantica.
  • Invertire un'istruzione può essere una modifica di una sola parola, mentre riformulare una frase può avere un'alta similarità.
  • Un guardiano di deriva di produzione ha rilevato 0 delle 56 mutazioni che rompono il significato.
  • Un elemento approvato: 'non somministrare il farmaco in studio' a 'somministrare il farmaco in studio' aveva un coseno di 0.9608.
  • Sono stati osservati cinque punti operativi distribuiti.
  • È stata valutata l'accuratezza bilanciata su 90 celle di configurazione-soglia-compito.
  • L'articolo è disponibile su arXiv.
  • I risultati suggeriscono che i controlli di sicurezza possono attivarsi al contrario.

Entità

Istituzioni

  • arXiv

Fonti