Soppressione dei Latenze di Consapevolezza della Valutazione nei LLM tramite Ottimizzazione del Solo Input
Un recente preprint su arXiv (2607.25907) presenta una tecnica volta a ridurre le latenze di consapevolezza della valutazione nei grandi modelli linguistici attraverso l'ottimizzazione del solo input, eliminando la necessità di accesso al modello durante l'inferenza. Questo metodo modifica Fluent Dreaming e EPO incorporando un termine di caratteristica negato, unendo l'ottimizzazione dei token in stile GCG con un regolarizzatore di fluenza basato su auto-entropia incrociata. La latenza target, una caratteristica di consapevolezza della valutazione linearmente interpretabile e controllabile evidenziata in ricerche precedenti, pone rischi per la validità della valutazione della sicurezza se i modelli reagiscono diversamente durante i test. I test condotti su Llama-3.2-3B e Llama-3.1-8B hanno soppresso efficacemente la latenza in cinque costrutti target. La soppressione è notevolmente forte (z≈-7), e una caratteristica SAE di Llama Scope convalidata causalmente può essere completamente e selettivamente disabilitata.
Fatti principali
- Il metodo sopprime le latenze di consapevolezza della valutazione tramite ottimizzazione del solo input
- Nessun accesso al modello durante l'inferenza richiesto
- Adatta Fluent Dreaming / EPO con termine di caratteristica negato
- Utilizza ottimizzazione dei token in stile GCG più regolarizzatore di fluenza basato su auto-entropia incrociata
- La latenza target è linearmente leggibile e controllabile
- Esperimenti su Llama-3.2-3B e Llama-3.1-8B
- Cinque costrutti target testati: direzione CAA, norma del sottospazio, caratteristica SAE, singolo neurone MLP, logit comportamentale
- Latenza robustamente sopprimibile (z≈-7)
Entità
Istituzioni
- arXiv