I difetti del benchmark SciCode sottovalutano la capacità di coding scientifico dei LLM
Un nuovo studio pubblicato su arXiv (2608.04975) rivela che il benchmark SciCode, una misura standard della capacità di coding scientifico dei modelli linguistici, contiene difetti che hanno portato a una sottostima delle loro prestazioni. Il benchmark, che include problemi di livello di ricerca che richiedono sia teoria scientifica che coding numerico, è utilizzato nell'Artificial Analysis Intelligence Index e nelle valutazioni governative. I punteggi recenti si sono stabilizzati, con i migliori modelli del 2026 che raggiungono circa il 60% di accuratezza sui sottoproblemi. Un audit di tutti i 65 problemi di test condotto da esperti di dominio ha trovato 263 difetti, di cui 192 (che influenzano il 91% dei problemi principali) causano il rifiuto errato di soluzioni corrette a causa di risposte gold non riproducibili, tolleranze eccessivamente strette o specifiche contraddittorie. In particolare, il 78% di questi difetti che sopprimono i punteggi richiede conoscenze specialistiche di fisica o matematica per essere identificato. I risultati suggeriscono che le capacità di coding scientifico dei modelli linguistici sono superiori a quanto riportato in precedenza, e lo studio invita a migliorare il benchmark.
Fatti principali
- SciCode è un benchmark standard per la capacità di coding scientifico dei modelli linguistici.
- Fa parte dell'Artificial Analysis Intelligence Index ed è utilizzato nelle valutazioni governative.
- I punteggi recenti si sono stabilizzati intorno al 60% di accuratezza sui sottoproblemi per i migliori modelli del 2026.
- Un audit di tutti i 65 problemi di test ha trovato 263 difetti.
- 192 difetti causano il rifiuto errato di soluzioni corrette.
- Il 91% dei problemi principali è influenzato da questi difetti.
- Il 78% dei difetti che sopprimono i punteggi richiede conoscenze specialistiche di fisica o matematica.
- Lo studio suggerisce che le capacità dei modelli linguistici sono sottostimate.
Entità
Istituzioni
- arXiv
- Artificial Analysis Intelligence Index