ARTFEED — Contemporary Art Intelligence

I difetti del benchmark SciCode sottovalutano la capacità di coding scientifico dei LLM

ai-technology · 2026-08-06

Un nuovo studio pubblicato su arXiv (2608.04975) rivela che il benchmark SciCode, una misura standard della capacità di coding scientifico dei modelli linguistici, contiene difetti che hanno portato a una sottostima delle loro prestazioni. Il benchmark, che include problemi di livello di ricerca che richiedono sia teoria scientifica che coding numerico, è utilizzato nell'Artificial Analysis Intelligence Index e nelle valutazioni governative. I punteggi recenti si sono stabilizzati, con i migliori modelli del 2026 che raggiungono circa il 60% di accuratezza sui sottoproblemi. Un audit di tutti i 65 problemi di test condotto da esperti di dominio ha trovato 263 difetti, di cui 192 (che influenzano il 91% dei problemi principali) causano il rifiuto errato di soluzioni corrette a causa di risposte gold non riproducibili, tolleranze eccessivamente strette o specifiche contraddittorie. In particolare, il 78% di questi difetti che sopprimono i punteggi richiede conoscenze specialistiche di fisica o matematica per essere identificato. I risultati suggeriscono che le capacità di coding scientifico dei modelli linguistici sono superiori a quanto riportato in precedenza, e lo studio invita a migliorare il benchmark.

Fatti principali

  • SciCode è un benchmark standard per la capacità di coding scientifico dei modelli linguistici.
  • Fa parte dell'Artificial Analysis Intelligence Index ed è utilizzato nelle valutazioni governative.
  • I punteggi recenti si sono stabilizzati intorno al 60% di accuratezza sui sottoproblemi per i migliori modelli del 2026.
  • Un audit di tutti i 65 problemi di test ha trovato 263 difetti.
  • 192 difetti causano il rifiuto errato di soluzioni corrette.
  • Il 91% dei problemi principali è influenzato da questi difetti.
  • Il 78% dei difetti che sopprimono i punteggi richiede conoscenze specialistiche di fisica o matematica.
  • Lo studio suggerisce che le capacità dei modelli linguistici sono sottostimate.

Entità

Istituzioni

  • arXiv
  • Artificial Analysis Intelligence Index

Fonti