ARTFEED — Contemporary Art Intelligence

Il Benchmark SemPlan Valuta la Pianificazione Semantica Strutturata Basata su LLM per Query di Dati Aziendali

other · 2026-08-17

È stato introdotto un nuovo benchmark chiamato SemPlan per valutare come le interfacce in linguaggio naturale gestiscono la progettazione dei dati aziendali. Si concentra sulla trasformazione di richieste vaghe degli utenti in passaggi attuabili, affrontando problemi come query non valide e fallimenti delle policy. SemPlan include un dataset sintetico bilingue con 1.800 istanze in inglese e portoghese brasiliano, con 1.200 riservate alla valutazione scientifica. Sono stati testati quattro modelli: generazione diretta di SQL (A1), un agente strumento di base (A2), richieste semantiche strutturate (A3) e una versione di chiarimento (A4). L'accuratezza complessiva è risultata bassa, con A3 che ha ottenuto i migliori risultati al 25,67%. A3 ha superato notevolmente gli altri, evidenziando il potenziale della pianificazione semantica strutturata. Il benchmark è disponibile su arXiv con l'identificatore 2608.13612.

Fatti principali

  • Il Benchmark SemPlan è un benchmark sintetico bilingue deterministico con 1.800 casi in inglese e portoghese brasiliano.
  • 1.200 casi formano il sottoinsieme di valutazione scientifica congelato.
  • Vengono confrontate quattro architetture: generazione diretta di SQL (A1), agente strumento di base con limiti (A2), generazione di richieste semantiche strutturate con pianificazione deterministica (A3) e variante di chiarimento/pianificazione semantica con stato (A4).
  • Su 4.800 record primari, i tassi di correttezza sono: A1 22,25%, A2 22,58%, A3 25,67%, A4 24,25%.
  • A3 ha avuto la correttezza osservata più alta e ha superato significativamente A1, A2 e A4.
  • Il benchmark affronta il controllo di query non valide, fallimenti delle policy, costi e non determinismo.
  • L'articolo è disponibile su arXiv con identificatore 2608.13612.

Entità

Istituzioni

  • arXiv

Fonti