ELMER: Modello Linguistico Evolutivo Migliora l'Evoluzione dei Programmi tramite Linguaggio Naturale
Un nuovo metodo per l'evoluzione dei programmi chiamato ELMER (Modello Linguistico Evolutivo che Esplora e Raffina) è stato sviluppato dai ricercatori, utilizzando descrizioni in linguaggio naturale per guidare le mutazioni. Questo approccio innovativo affronta un notevole svantaggio dell'evoluzione convenzionale dei programmi: la difficoltà di controllare il movimento delle mutazioni nello spazio comportamentale. Spesso, la dimensione delle modifiche sintattiche non indica in modo affidabile i cambiamenti comportamentali, poiché piccole modifiche al codice possono portare a significativi cambiamenti comportamentali, mentre riscritture estese potrebbero mantenere la stessa traccia di esecuzione. ELMER impiega un modello Qwen3-8B completamente ottimizzato per cercare descrizioni di policy in linguaggio naturale e compilare programmi tipizzati per l'esecuzione. Questo modello è addestrato su tre operazioni specifiche per il compito: mutazione semantica condizionale, traduzione dal linguaggio naturale al linguaggio specifico del dominio (GPTL) e conversione da GPTL al linguaggio naturale. La messa a punto è condotta con input condizionale sulla forza della mutazione (bassa, media, alta) tramite Ottimizzazione Diretta delle Preferenze (oDPO). In 252 ricerche evolutive a budget fisso, oDPO ha migliorato sia la calibrazione comportamentale che l'efficienza della ricerca. Il più alto h-index è stato registrato usando il linguaggio naturale, indicando che le rappresentazioni linguistiche possono migliorare la ricerca evolutiva. L'articolo di ricerca è accessibile su arXiv con l'identificatore 2608.10196.
Fatti principali
- ELMER è un Modello Linguistico Evolutivo che cerca descrizioni di policy in linguaggio naturale.
- Compila programmi tipizzati per l'esecuzione.
- Il modello si basa su Qwen3-8B ed è completamente ottimizzato.
- Tre operazioni: mutazione semantica condizionale, compilazione da NL a GPTL, traduzione da GPTL a NL.
- Ottimizzato con Ottimizzazione Diretta delle Preferenze (oDPO) sulla forza della mutazione (bassa, media, alta).
- Testato su 252 ricerche evolutive a budget fisso.
- oDPO migliora la calibrazione comportamentale e l'efficienza della ricerca a budget finito.
- Il linguaggio naturale ha raggiunto il più alto h-index osservato.
- Articolo disponibile su arXiv (2608.10196).
Entità
Istituzioni
- arXiv