ARTFEED — Contemporary Art Intelligence

NetlistBench: Valutazione dell'affidabilità dei LLM nel riconoscimento e nella manipolazione di netlist SPICE

ai-technology · 2026-08-13

È stato lanciato un nuovo benchmark chiamato NetlistBench per valutare l'affidabilità dei grandi modelli linguistici (LLM) nell'interpretare e modificare netlist SPICE, che servono come rappresentazioni testuali di circuiti elettronici. Questo benchmark, descritto in un articolo su arXiv (2608.12197), mira a colmare una lacuna nella conoscenza esistente: anche se gli LLM sono sempre più utilizzati nei processi di progettazione di circuiti, la loro efficacia nei compiti relativi alle netlist per simulatori è raramente distinta dal ragionamento di progettazione di alto livello. NetlistBench comprende 2.342 istanze in 24 categorie di compiti, tra cui riconoscimento di parametri, modifiche di connettività, funzioni gerarchiche, valutazioni di equivalenza e modifiche composte a lungo orizzonte. Un oracolo deterministico sensibile alla struttura valuta le uscite del modello. Testando sei LLM non pensanti sono emerse variazioni significative nelle prestazioni basate sulla complessità strutturale a livello di operazione, con semplici modifiche locali che raggiungono un'accuratezza del 96%–100%, mentre l'accuratezza nell'aggiunta di dispositivi è scesa al 41%–83%, e i compiti di giudizio di equivalenza hanno subito un ulteriore declino. Questo benchmark mira a stabilire un metodo strutturato e verificabile per valutare le capacità degli LLM in quest'area, sottolineando la necessità di una maggiore affidabilità in compiti complessi di manipolazione di netlist.

Fatti principali

  • NetlistBench è un benchmark verificato strutturalmente per il riconoscimento e la manipolazione di netlist SPICE.
  • Contiene 2.342 casi in 24 famiglie di compiti.
  • I compiti includono riconoscimento e modifiche di parametri e connettività, operazioni gerarchiche, giudizio di equivalenza e modifica composta a lungo orizzonte.
  • Le uscite del modello sono valutate da un oracolo deterministico sensibile alla struttura.
  • Su sei LLM non pensanti, semplici modifiche locali hanno raggiunto un'accuratezza del 96%–100%.
  • L'accuratezza nell'aggiunta di dispositivi è scesa al 41%–83%.
  • Il benchmark è presentato in un articolo su arXiv con identificatore 2608.12197.
  • L'articolo è annunciato come annuncio di tipo incrociato.

Entità

Istituzioni

  • arXiv

Fonti