Modelli del mondo neuro-simbolici per il trasferimento zero-shot di compiti nell'apprendimento per rinforzo
Il preprint arXiv 2608.17959 presenta una formulazione di modello del mondo neuro-simbolico volta a consentire il trasferimento zero-shot di compiti nell'apprendimento per rinforzo. Gli attuali metodi di apprendimento per rinforzo basati su modello apprendono modelli del mondo neurali che supportano il miglioramento della politica tramite pianificazione in uno spazio latente, senza assumere la conoscenza della struttura dell'ambiente. Tuttavia, questi modelli sono tipicamente dipendenti dal compito, apprendendo rappresentazioni latenti non interpretabili legate al compito di addestramento, il che ostacola la generalizzazione a nuovi compiti. L'approccio proposto disaccoppia la ricostruzione dell'osservazione dalla previsione della ricompensa, cosicché la previsione della ricompensa dipende solo da un sottoinsieme di componenti strutturate e simboliche dello stato latente. Con la funzione di ricompensa definita su uno spazio di stato simbolico condiviso, un modello appreso può adattarsi a nuove funzioni di ricompensa senza ulteriori interazioni con l'ambiente, cioè zero-shot. Gli autori discutono i vantaggi e le sfide dell'apprendimento di tali modelli del mondo neuro-simbolici e dimostrano forti proprietà di generalizzazione. Il preprint è stato annunciato come nuova sottomissione su arXiv e si concentra sul quadro concettuale piuttosto che su esperimenti specifici o dataset.
Fatti principali
- L'articolo è identificato come arXiv:2608.17959.
- Introduce una nuova formulazione di modello del mondo neuro-simbolico.
- La previsione della ricompensa dipende da un sottoinsieme di componenti strutturate e simboliche dello stato latente.
- La ricostruzione dell'osservazione e la previsione della ricompensa sono disaccoppiate.
- Il modello supporta l'adattamento zero-shot a nuove funzioni di ricompensa.
- L'adattamento zero-shot non richiede ulteriori interazioni con l'ambiente.
- L'articolo discute i principali vantaggi e le sfide dell'approccio.
- Vengono dimostrate forti proprietà di generalizzazione.
Entità
Istituzioni
- arXiv