ARTFEED — Contemporary Art Intelligence

I LLM a pesi aperti superano i baselines simbolici nella riparazione di modelli di pianificazione PDDL

ai-technology · 2026-08-19

Uno studio disponibile su arXiv (identificatore 2608.17341) indaga l'uso di grandi modelli linguistici (LLM) a pesi aperti per correggere errori nei modelli PDDL (Planning Domain Definition Language), essenziali per la pianificazione dell'IA. Si concentra sul rilevamento e la correzione di errori tramite piani di test sia positivi che negativi. La ricerca confronta un metodo basato solo su LLM con una baseline simbolica, che raggiunge un punteggio F1 di 0,49. L'LLM con le migliori prestazioni, che richiede uno sforzo di ragionamento significativo, raggiunge un punteggio di 0,87, riflettendo un miglioramento di 0,38, sebbene il suo tasso medio di superamento dei test sia 0,82, crollando a 0,06 nel dominio Thoughtful. I risultati indicano che, mentre gli LLM possono eccellere rispetto alle tecniche simboliche in alcuni casi, la loro affidabilità varia a seconda del dominio, evidenziando la necessità di ulteriori indagini.

Fatti principali

  • Articolo disponibile su arXiv con identificatore arXiv:2608.17341
  • Lo studio valuta grandi modelli linguistici a pesi aperti per la riparazione di modelli PDDL
  • Il metodo utilizza un approccio basato solo su LLM
  • La baseline simbolica raggiunge un punteggio F1 di 0,49
  • L'LLM con le migliori prestazioni e un alto sforzo di ragionamento raggiunge un punteggio F1 di 0,87
  • Il miglioramento assoluto nel punteggio F1 è di 0,38
  • Il tasso medio di superamento dei test per la migliore configurazione è 0,82
  • Nel dominio Thoughtful, il tasso di superamento dei test scende a 0,06

Entità

Fonti