Voice Memory: Schema Solo Inferenziale per Riconoscimento Vocale Agentico
Un approccio innovativo solo inferenziale chiamato Voice Memory migliora il riconoscimento vocale per agenti utilizzando un correttore statico che esamina un file di memoria specifico del dominio. Determina per ogni enunciato se procedere con l'ipotesi o astenersi dall'agire. Un ottimizzatore asincrono con punteggio soglia aggiorna la memoria attraverso modifiche limitate, consentendo alterazioni solo quando migliorano un punteggio di validazione. Questa divisione, nota come architettura ascoltatore-pensatore, mantiene invariati i pesi, garantendo che l'abilità acquisita rimanga verificabile e trasferibile. La tecnica minimizza la sovracorrezione: mentre la correzione generativa di errori non vincolata (GER) altera token corretti fino al 64% delle modifiche su notizie finanziarie, Voice Memory riduce questa percentuale al 35%. In dieci domini HyPoradise con un correttore aperto, Voice Memory diminuisce l'errore ponderato sulle parole.
Fatti principali
- Voice Memory è uno schema solo inferenziale per il riconoscimento vocale agentico.
- Un correttore congelato legge un singolo file di memoria per dominio al momento del flusso.
- Il correttore decide per ogni enunciato se agire sull'ipotesi o astenersi e mantenere il miglior risultato.
- Un ottimizzatore asincrono con punteggio soglia revisiona la memoria attraverso modifiche limitate.
- Le modifiche sono accettate solo quando migliorano strettamente un punteggio di validazione.
- L'architettura è chiamata ascoltatore-pensatore, con due ruoli accoppiati solo tramite memoria.
- Nessun peso cambia, quindi l'abilità appresa rimane verificabile e portatile.
- La GER non vincolata rompe token corretti fino al 64% delle sue modifiche su notizie finanziarie.
- Voice Memory riduce questo tasso di sovracorrezione al 35%.
- Testato su dieci domini HyPoradise con un correttore aperto.
Entità
—