La Guida Soft Supera il Prompting Chain-of-Thought nei LLM Moderni
Un recente articolo su arXiv (2608.03550) mette in discussione l'uso prevalente del prompting Chain-of-Thought (CoT) come punto di riferimento per valutare le capacità di ragionamento nei grandi modelli linguistici (LLM). I ricercatori notano che numerosi LLM contemporanei producono naturalmente risposte in stile CoT quando affrontano sfide di ragionamento, portando a una riconsiderazione del prompting CoT few-shot. La loro valutazione di vari modelli di medie dimensioni che affrontano problemi matematici rivela che i modelli progettati per il ragionamento eccellono in un contesto zero-shot diretto, superando gli esempi CoT few-shot e superando significativamente i risultati precedentemente riportati (ad esempio, Mathstral sale da ~77% a ~84% su GSM8K). Inoltre, un prompt CoT zero-shot è sufficiente per un modello di uso generale per superare la baseline few-shot. Gli autori attribuiscono questa tendenza ai progressi nell'addestramento dei LLM, indicando che la necessità di un prompting CoT esplicito potrebbe diminuire man mano che i modelli diventano più abili nel ragionamento. Questi risultati hanno importanti implicazioni per l'ingegneria dei prompt e le strategie di valutazione nella ricerca sull'IA.
Fatti principali
- Articolo: arXiv:2608.03550
- Titolo: 'La guida soft inizia a superare il prompting CoT man mano che i LLM migliorano'
- Il prompting CoT è la baseline standard per valutare le capacità di ragionamento
- I LLM moderni producono risposte in stile CoT in modo nativo
- I modelli specializzati nel ragionamento performano meglio in zero-shot che in few-shot CoT
- Mathstral migliora da ~77% a ~84% su GSM8K con zero-shot
- Il CoT zero-shot supera la baseline few-shot per un modello di uso generale
- I risultati suggeriscono che il prompting CoT esplicito potrebbe diventare meno necessario
Entità
Istituzioni
- arXiv