Agentic-SQL Rivisitato: Tassonomia Basata sull'Autonomia e Analisi dei Benchmark
Un recente preprint su arXiv (2608.15389) introduce un sistema di classificazione per modelli Text-to-SQL basati su LLM, categorizzandoli lungo un asse di autonomia inferenziale che include generazione vincolata, in-contesto, iterativa, agentica e internalizzata nel ragionamento. I ricercatori ridefiniscono il dominio come un'aggregazione di leaderboard, compilando metriche da vari autori e garantendo origini tracciabili per ogni voce. Per corroborare le loro scoperte, eseguono uno studio di caso utilizzando il benchmark Spider, valutando modelli open-source da 8B con e senza supervisione chain-of-thought (CoT) rispetto ai benchmark few-shot DeepSeek V3 e GLM-4. La loro analisi rivela quattro tendenze chiave: trasferimento non uniforme da Spider a BIRD e Spider 2.0; il trade-off dell'autonomia per la robustezza; la posizione dell'internalizzazione del ragionamento tra decodifica solo-risposta e agenti coordinati esternamente; e miglioramenti del CoT concentrati su query Hard ed Extra-Hard. Gli autori forniscono anche un harness Python per ulteriori esplorazioni.
Fatti principali
- Il preprint arXiv 2608.15389 propone una tassonomia per sistemi Text-to-SQL basati su LLM.
- La tassonomia si basa su un asse di autonomia inferenziale: vincolata, in-contesto, iterativa, agentica, internalizzata nel ragionamento.
- Lo studio aggrega metriche riportate dagli autori, con provenienza tracciabile per ogni cella.
- Uno studio di caso su Spider confronta backbone open-source da 8B con/senza supervisione CoT.
- I baseline includono DeepSeek V3 e GLM-4 in configurazione few-shot.
- Quattro pattern: trasferimento non uniforme a BIRD e Spider 2.0; costi dell'autonomia; internalizzazione del ragionamento; guadagni del CoT su Hard/Extra-Hard.
- Viene rilasciato un harness Python.
- Il paper è disponibile su arxiv.org/abs/2608.15389.
Entità
Istituzioni
- arXiv