CoT-Core: La Selezione di Coreset Senza Addestramento Accelera la Valutazione degli LLM
Un nuovo metodo per accelerare la valutazione dei modelli linguistici di grandi dimensioni (LLM) è stato introdotto in un preprint su arXiv. Il metodo, chiamato CoT-Core, affronta l'alto costo computazionale della valutazione degli LLM durante lo sviluppo. I metodi tradizionali di selezione dei coreset richiedono o un'ampia quantità di dati storici (un problema di 'avvio a freddo') o si basano sulla similarità lessicale superficiale, perdendo la struttura di ragionamento sottostante dei compiti. CoT-Core è un approccio senza addestramento che utilizza traiettorie di ragionamento a catena di pensiero (CoT) zero-shot per raggruppare le domande per equivalenza logica piuttosto che per similarità testuale. Ciò si ottiene sollecitando gli LLM a generare percorsi di ragionamento e proiettandoli in uno spazio latente. Esperimenti su benchmark tra cui GSM8K, MMLU, MMLU-Pro e GPQA mostrano che CoT-Core riduce significativamente i costi di valutazione mantenendo punteggi ad alta fedeltà. L'articolo è disponibile su arXiv:2608.00014.
Fatti principali
- CoT-Core è un nuovo framework di selezione dei coreset senza addestramento per la valutazione degli LLM.
- Utilizza traiettorie di ragionamento a catena di pensiero zero-shot per raggruppare le domande per equivalenza logica.
- Il metodo affronta il collo di bottiglia dell''avvio a freddo dei metodi esistenti come la Teoria della Risposta all''Elemento.
- Gli esperimenti sono stati condotti sui benchmark GSM8K, MMLU, MMLU-Pro e GPQA.
- CoT-Core riduce drasticamente i costi di valutazione mantenendo punteggi ad alta fedeltà.
- L''articolo è pubblicato su arXiv con identificatore 2608.00014.
- L''approccio è senza addestramento, il che significa che non richiede un addestramento aggiuntivo del modello.
- Proietta i percorsi di ragionamento in uno spazio latente per raggruppare le domande.
Entità
Istituzioni
- arXiv