ARC-Encoder: Comprimere il Testo per i LLM
Un nuovo encoder chiamato ARC-Encoder comprime il testo in rappresentazioni continue che sostituiscono gli embedding dei token nei decoder LLM, riducendo i costi di inferenza senza necessità di fine-tuning o modifica del modello target. Lo studio sistematico delle strategie di addestramento e delle scelte architetturali ha portato al suo design, producendo rappresentazioni x volte inferiori (tipicamente x∈{4,8}) rispetto ai token di testo. Valutato in vari scenari di utilizzo dei LLM, incluso l'apprendimento in contesto, ARC-Encoder offre un'alternativa alle tecniche di compressione del contesto che degradano le capacità generali quando utilizzate per scopi specifici. L'approccio affronta contesti più lunghi e costi di inferenza aumentati da tecniche come il retrieval-augmented generation o il chain-of-thought reasoning.
Fatti principali
- ARC-Encoder comprime il contesto in rappresentazioni continue che sostituiscono gli embedding dei token.
- Produce rappresentazioni x volte inferiori, tipicamente x∈{4,8}.
- Non richiede fine-tuning o modifica dell'architettura del LLM target.
- Lo studio sistematico delle strategie di addestramento e delle scelte architetturali ha informato il design.
- Valutato in vari scenari di utilizzo dei LLM, incluso l'apprendimento in contesto.
- Affronta i costi di inferenza aumentati da contesti più lunghi.
- Alternativa ai metodi che degradano le capacità generali.
- Correlato al retrieval-augmented generation e al chain-of-thought reasoning.
Entità
—