Articolo arXiv sulle Competenze dell'IA Agente Corregge Errori e Inverte un Risultato Chiave
Un articolo recentemente aggiornato su arXiv (2603.00195v2) si concentra sull'analisi formale e sulla sicurezza delle catene di approvvigionamento relative alle capacità dell'IA agente, correggendo errori nella bibliografia e nelle affermazioni esterne. Gli autori hanno confermato 22 riferimenti tramite l'API di arXiv e hanno informato gli autori interessati. Inoltre, hanno modificato tre dichiarazioni esterne: MalTool indica 1.300 strumenti dannosi autonomi e 5.727 incorporati (non 6.487); CVE-2026-25253 riguarda l'esfiltrazione di token di autenticazione tramite un gatewayUrl non validato (attribuito a depthfirst, risolto il 29.01.2026), non l'esecuzione remota di codice; ClawHavoc riporta conteggi di 341, 824 e 1.184 per fonte e data, non "oltre 1.200". Tutti gli esperimenti sono stati rivalutati rispetto all'implementazione v0.6.0 rilasciata utilizzando harness committati. Mentre gli esperimenti E1/E2 rimangono coerenti (F1 96,15%), E3 mostra un risultato negativo: l'analisi del flusso di informazioni non migliora il rilevamento. Il documento comprende 32 pagine, presenta 5 teoremi con dimostrazioni complete, include 68 riferimenti e fornisce uno strumento open-source all'indirizzo https://github.com/qualixar/skillfortify.
Fatti principali
- L'articolo arXiv:2603.00195v2 è una versione rivista che corregge errori bibliografici e affermazioni esterne.
- 22 voci bibliografiche avevano elenchi di autori che non corrispondevano agli identificativi arXiv citati; tutti corretti e gli autori interessati sono stati informati.
- MalTool riporta 1.300 strumenti dannosi autonomi e 5.727 incorporati, non 6.487.
- CVE-2026-25253 riguarda l'esfiltrazione di token di autenticazione tramite un gatewayUrl non validato, attribuito a depthfirst e risolto il 29.01.2026.
- I conteggi di ClawHavoc sono 341, successivamente 824 e 1.184 per fonte e data, non "oltre 1.200".
- Tutti gli esperimenti sono stati rimisurati rispetto all'implementazione v0.6.0 utilizzando harness committati nel repository.
- E1/E2 invariati (F1 96,15%).
- E3 si inverte in un risultato negativo: l'analisi del flusso di informazioni non aggiunge benefici al rilevamento.
- L'articolo ha 32 pagine, 5 teoremi con dimostrazioni complete, 68 riferimenti.
- Strumento open-source disponibile all'indirizzo https://github.com/qualixar/skillfortify.
Entità
Istituzioni
- arXiv
- GitHub
- qualixar