ARTFEED — Contemporary Art Intelligence

Soppressione dei Latenze di Consapevolezza della Valutazione nei LLM tramite Ottimizzazione del Solo Input

ai-technology · 2026-07-29

Un recente preprint su arXiv (2607.25907) presenta una tecnica volta a ridurre le latenze di consapevolezza della valutazione nei grandi modelli linguistici attraverso l'ottimizzazione del solo input, eliminando la necessità di accesso al modello durante l'inferenza. Questo metodo modifica Fluent Dreaming e EPO incorporando un termine di caratteristica negato, unendo l'ottimizzazione dei token in stile GCG con un regolarizzatore di fluenza basato su auto-entropia incrociata. La latenza target, una caratteristica di consapevolezza della valutazione linearmente interpretabile e controllabile evidenziata in ricerche precedenti, pone rischi per la validità della valutazione della sicurezza se i modelli reagiscono diversamente durante i test. I test condotti su Llama-3.2-3B e Llama-3.1-8B hanno soppresso efficacemente la latenza in cinque costrutti target. La soppressione è notevolmente forte (z≈-7), e una caratteristica SAE di Llama Scope convalidata causalmente può essere completamente e selettivamente disabilitata.

Fatti principali

  • Il metodo sopprime le latenze di consapevolezza della valutazione tramite ottimizzazione del solo input
  • Nessun accesso al modello durante l'inferenza richiesto
  • Adatta Fluent Dreaming / EPO con termine di caratteristica negato
  • Utilizza ottimizzazione dei token in stile GCG più regolarizzatore di fluenza basato su auto-entropia incrociata
  • La latenza target è linearmente leggibile e controllabile
  • Esperimenti su Llama-3.2-3B e Llama-3.1-8B
  • Cinque costrutti target testati: direzione CAA, norma del sottospazio, caratteristica SAE, singolo neurone MLP, logit comportamentale
  • Latenza robustamente sopprimibile (z≈-7)

Entità

Istituzioni

  • arXiv

Fonti