ARTFEED — Contemporary Art Intelligence

Modello Quadratico Prevede le Dinamiche di Ottimizzazione degli LLM

ai-technology · 2026-07-27

Un nuovo studio testa il modello quadratico come quadro semplice ma predittivo per comprendere l'ottimizzazione delle reti neurali nei modelli linguistici di grandi dimensioni (LLM). La ricerca, pubblicata su arXiv (2607.21716), sottopone a stress test questo modello idealizzato su un LLM con 150 milioni di parametri addestrato su 3 miliardi di token. I risultati mostrano che gli sviluppi di Taylor del modello e della funzione di perdita a checkpoint intermedi possono prevedere accuratamente le dinamiche di ottimizzazione su finestre che coprono fino al 10% dell'addestramento. Gli autori analizzano quindi lo spettro dell'Hessiana e la stabilità locale utilizzando la quadratura di Lanczos con sonde profonde. Questo lavoro suggerisce che anche i modelli di ottimizzazione più semplici possono essere sorprendentemente efficaci in contesti complessi di LLM.

Fatti principali

  • Articolo arXiv 2607.21716
  • Testa il modello quadratico su un LLM con 150 milioni di parametri
  • Addestrato su 3 miliardi di token
  • Gli sviluppi di Taylor prevedono le dinamiche su finestre fino al 10% dell'addestramento
  • Utilizza la quadratura di Lanczos con sonde profonde
  • Analizza lo spettro dell'Hessiana e la stabilità locale

Entità

Istituzioni

  • arXiv

Fonti