ARTFEED — Contemporary Art Intelligence

Stima dell'Incertezza nei LLM di Codice: Multi-Sample P(True) Promette Bene, l'Auto-Correzione Fallisce

ai-technology · 2026-08-18

Uno studio recente pubblicato su arXiv (2608.14659) esplora l'applicabilità delle tecniche di stima dell'incertezza dal processamento del linguaggio naturale alla generazione di codice, valutando se questi metodi possono migliorare la generazione di codice tramite auto-correzione selettiva. I ricercatori hanno testato cinque tecniche di incertezza—entropia media dei token, confidenza verbalizzata, P(True), ensemble di entropia e sonde di entropia semantica—utilizzando tre piccoli LLM di codice sui benchmark HumanEval e BigCodeBench. I risultati hanno indicato che il multi-sample P(True) aveva la più alta correlazione con la correttezza, mentre gli altri metodi, incluse le sonde di entropia semantica, mostravano solo correlazioni deboli. Gli autori hanno implementato tre strategie di auto-correzione basate su questi segnali: decodifica adattiva, rigenerazione basata sull'incertezza e rigenerazione basata sulla verifica. Sorprendentemente, i risultati hanno dimostrato che l'auto-correzione guidata dall'incertezza non migliorava la generazione di codice e, in alcuni casi, la peggiorava, sottolineando i limiti degli attuali metodi di stima dell'incertezza in questo ambito e la necessità di soluzioni più efficaci.

Fatti principali

  • Studio su arXiv:2608.14659
  • Valuta cinque metodi di incertezza
  • Metodi: entropia media dei token, confidenza verbalizzata, P(True), ensemble di entropia, sonde di entropia semantica
  • Testati tre piccoli LLM di codice
  • Benchmark: HumanEval e BigCodeBench
  • Multi-sample P(True) ha la correlazione più forte con la correttezza
  • Gli altri metodi hanno correlazione debole
  • Tre politiche di auto-correzione: decodifica adattiva, rigenerazione basata sull'incertezza, rigenerazione basata sulla verifica
  • L'auto-correzione basata sull'incertezza non ha migliorato le prestazioni

Entità

Istituzioni

  • arXiv

Fonti