Collasso dell'Impilamento delle Istruzioni: Il Benchmark Rivela il Valore Dipendente dalle Capacità della Compilazione dei Prompt
Uno studio recente pubblicato su arXiv (2608.02639) esamina il declino nell'aderenza alle istruzioni nei grandi modelli linguistici man mano che vengono introdotti più vincoli. Valuta tre LLM leader: Claude Sonnet 4.6, GPT-5-mini e Gemini 2.5 Flash, utilizzando fino a 20 istruzioni verificate. I risultati rivelano una significativa caduta non lineare nei tassi di aderenza, che crollano da circa il 96% fino al 20%, principalmente a causa di conflitti strutturati a coppie. Ad esempio, un singolo requisito 'output JSON' non può essere soddisfatto insieme ad altri nove. Inoltre, la ricerca esplora una soluzione senza addestramento: un compilatore di istruzioni che riformula i prompt impilati in una singola chiamata LLM, migliorando le prestazioni fino a +11 punti per i modelli più deboli, che affrontano le maggiori sfide con l'impilamento. Queste intuizioni sono cruciali per l'ingegneria dei prompt e lo sviluppo di sistemi AI, specialmente in scenari che richiedono istruzioni complesse con più vincoli.
Fatti principali
- Il benchmark impila 24 istruzioni verificate da verificatori, da una a venti alla volta.
- Valuta Claude Sonnet 4.6, GPT-5-mini e Gemini 2.5 Flash.
- Il tasso di aderenza scende da circa il 96% fino al 20%.
- Il degrado è non lineare e guidato da conflitti a coppie.
- Un singolo vincolo 'output JSON' è congiuntamente insoddisfacibile con altri nove.
- Il compilatore di istruzioni riscrive il prompt impilato in una singola chiamata LLM.
- Il compilatore recupera fino a +11 punti di tasso di aderenza per i modelli più deboli.
- Il beneficio è graduato in base alle capacità.
Entità
Istituzioni
- arXiv