Prompting a Catena di Pensiero: Collo di Bottiglia della Profondità Seriale nel Ragionamento dei LLM
Una recente indagine empirica mette in discussione la convinzione che il prompting a catena di pensiero (CoT) migliori costantemente il ragionamento nei modelli linguistici di grandi dimensioni (LLM). Questa ricerca, disponibile su arXiv (2608.09942), presenta l'idea di un 'collo di bottiglia della profondità seriale' all'interno delle architetture transformer. Sebbene il limite formale di banda H_dp (Chen et al., 2024) sia applicabile solo asintoticamente, gli autori suggeriscono che esso indica un vincolo reale: i compiti di calcolo seriale estesi devono essere esternalizzati, ed è ciò che fa il CoT. Lo studio rivela un gradiente di profondità seriale nei benchmark: l'accuratezza senza CoT diminuisce costantemente con l'aumentare della profondità seriale, mentre il CoT rimane in gran parte invariato. Esperimenti su tre modelli istruiti tramite istruzioni (Qwen-2.5-7B/32B, Llama-3.1-8B) su cinque benchmark NLP mostrano che per compiti P-completi ad alta profondità come GSM8K e MATH, il CoT migliora le prestazioni di +54 a +68 punti percentuali. Al contrario, per compiti TC^0 superficiali come MMLU e ARC, il CoT non offre vantaggi notevoli. Questi risultati indicano che il CoT è particolarmente efficace per compiti che superano la capacità seriale di una singola passata del transformer, informando la sua applicazione pratica e potenzialmente migliorando l'efficienza.
Fatti principali
- Lo studio indaga quando il prompting a catena di pensiero (CoT) aiuta o ostacola il ragionamento dei LLM.
- Introduce il concetto di collo di bottiglia della profondità seriale basato sul limite di banda H_dp (Chen et al., 2024).
- L'accuratezza a passata singola degrada con la profondità seriale; il CoT è invariante alla profondità.
- Testato sui modelli Qwen-2.5-7B/32B e Llama-3.1-8B.
- Utilizzati cinque benchmark NLP: GSM8K, MATH, MMLU, ARC e uno aggiuntivo.
- Il CoT migliora i compiti ad alta profondità (GSM8K, MATH) di +54 a +68 punti percentuali.
- Il CoT non mostra benefici su compiti superficiali (MMLU, ARC).
- L'articolo è disponibile su arXiv con ID 2608.09942.
Entità
Istituzioni
- arXiv