ARTFEED — Contemporary Art Intelligence

La Guida Soft Supera il Prompting Chain-of-Thought nei LLM Moderni

ai-technology · 2026-08-06

Un recente articolo su arXiv (2608.03550) mette in discussione l'uso prevalente del prompting Chain-of-Thought (CoT) come punto di riferimento per valutare le capacità di ragionamento nei grandi modelli linguistici (LLM). I ricercatori notano che numerosi LLM contemporanei producono naturalmente risposte in stile CoT quando affrontano sfide di ragionamento, portando a una riconsiderazione del prompting CoT few-shot. La loro valutazione di vari modelli di medie dimensioni che affrontano problemi matematici rivela che i modelli progettati per il ragionamento eccellono in un contesto zero-shot diretto, superando gli esempi CoT few-shot e superando significativamente i risultati precedentemente riportati (ad esempio, Mathstral sale da ~77% a ~84% su GSM8K). Inoltre, un prompt CoT zero-shot è sufficiente per un modello di uso generale per superare la baseline few-shot. Gli autori attribuiscono questa tendenza ai progressi nell'addestramento dei LLM, indicando che la necessità di un prompting CoT esplicito potrebbe diminuire man mano che i modelli diventano più abili nel ragionamento. Questi risultati hanno importanti implicazioni per l'ingegneria dei prompt e le strategie di valutazione nella ricerca sull'IA.

Fatti principali

  • Articolo: arXiv:2608.03550
  • Titolo: 'La guida soft inizia a superare il prompting CoT man mano che i LLM migliorano'
  • Il prompting CoT è la baseline standard per valutare le capacità di ragionamento
  • I LLM moderni producono risposte in stile CoT in modo nativo
  • I modelli specializzati nel ragionamento performano meglio in zero-shot che in few-shot CoT
  • Mathstral migliora da ~77% a ~84% su GSM8K con zero-shot
  • Il CoT zero-shot supera la baseline few-shot per un modello di uso generale
  • I risultati suggeriscono che il prompting CoT esplicito potrebbe diventare meno necessario

Entità

Istituzioni

  • arXiv

Fonti