ARTFEED — Contemporary Art Intelligence

Le strategie evolutive migliorano la copertura delle soluzioni degli LLM oltre il RL

ai-technology · 2026-08-15

Uno studio recente pubblicato su arXiv (2608.12679) suggerisce di sfruttare le strategie evolutive (ES) per migliorare la copertura delle soluzioni dei modelli linguistici di grandi dimensioni (LLM) in campi come la matematica e la scienza. Mentre il metodo convenzionale, pass@k, consente ai modelli di produrre una varietà di soluzioni candidate, l'applicazione dell'apprendimento per rinforzo (RL) post-addestramento tende a concentrare la distribuzione delle uscite su soluzioni ad alta ricompensa, portando a una copertura ridotta. Al contrario, ES è un metodo basato su popolazione e senza gradienti che ottimizza direttamente nello spazio dei pesi attraverso cambiamenti casuali, superando costantemente RL in pass@k e producendo una distribuzione delle uscite più ampia con una maggiore diversità di soluzioni. L'articolo sottolinea ES come un promettente sostituto di RL nel post-addestramento degli LLM, potenziando così le loro capacità esplorative.

Fatti principali

  • Articolo su arXiv: 2608.12679
  • LLM utilizzati in domini di scoperta come matematica e scienza
  • Pass@k consente ai modelli di generare diverse soluzioni candidate
  • Il post-addestramento con RL restringe la distribuzione delle uscite, causando il collasso della copertura delle soluzioni
  • ES è un metodo di post-addestramento basato su popolazione e senza gradienti
  • ES ottimizza direttamente nello spazio dei pesi attraverso perturbazioni casuali
  • ES raggiunge costantemente un pass@k più alto rispetto a RL
  • ES produce una distribuzione delle uscite più ampia con una maggiore diversità di soluzioni

Entità

Istituzioni

  • arXiv

Fonti