Living-Harness: Framework per Agenti LLM Auto-Evolventi
I ricercatori propongono Living-Harness, un'imbracatura auto-evolvente per agenti basati su grandi modelli linguistici (LLM) che affronta il problema dei fallimenti ricorrenti nell'esecuzione. Le imbracature statiche tradizionali migliorano l'affidabilità attraverso strumenti e flussi di lavoro fissi, ma rimangono invariate dopo il deployment, consentendo la ricomparsa degli stessi errori. Living-Harness converte ogni traiettoria completata e i segnali dell'evaluatore in prove a posteriori per aggiornamenti limitati dell'imbracatura, guidati da un Evolution-SOP (Procedura Operativa Standard) a livello di dominio. Estrae astrazioni di episodi e prove strutturate di aggiornamento, scrivendo due forme di conoscenza procedurale: memoria episodica (che registra condizioni di attivazione, modelli di fallimento e azioni di recupero) e un grafo di stato. L'articolo è pubblicato su arXiv con ID 2607.26598.
Fatti principali
- Living-Harness è un'imbracatura auto-evolvente per agenti LLM.
- Affronta i fallimenti ricorrenti nell'esecuzione degli agenti LLM.
- Le imbracature statiche rimangono invariate dopo il deployment.
- Living-Harness utilizza i segnali dell'evaluatore per aggiornamenti limitati.
- È guidata da un Evolution-SOP a livello di dominio.
- Scrive memoria episodica e un grafo di stato.
- L'articolo è su arXiv con ID 2607.26598.
- L'approccio converte le traiettorie in prove a posteriori.
Entità
Istituzioni
- arXiv