Il modello AI V4.1 Flash di DeepSeek supera Kimi K3 nei benchmark di cybersecurity e coding
DeepSeek, lo sviluppatore cinese di intelligenza artificiale, ha annunciato giovedì che il suo nuovo modello V4.1 Flash supera i concorrenti nei benchmark chiave per compiti di cybersecurity e coding. Il modello impiega una nuova architettura "Causal-Encoder-Decoder" e, pur essendo costruito su un framework da 552 miliardi di parametri, utilizza un design Mixture-of-Experts (MoE) che attiva solo 8 miliardi di parametri per l'elaborazione dell'input e 16 miliardi per la generazione della risposta, riducendo significativamente le richieste computazionali per richiesta. DeepSeek sostiene che V4.1 Flash è il più piccolo della sua nuova serie e offre una comprensione visiva multimodale nativa. Ha superato il V4 Pro della stessa azienda nei benchmark che valutano coding, cybersecurity e compiti di agenti autonomi. Su Terminal-Bench 2.1, che valuta l'IA su compiti computazionali del mondo reale, V4.1 Flash ha ottenuto 90,6, battendo GPT-5.6 Sol di OpenAI (88,8), Kimi K3 di Moonshot AI (88,3) e V4 Pro di DeepSeek (87,9). Il lancio sottolinea l'intensificarsi della competizione cinese nell'IA, dove efficienza e velocità sono cruciali tra costi hardware in aumento e restrizioni all'esportazione di chip stranieri che stringono i vincoli computazionali. Gli sviluppatori cinesi corrono per offrire ragionamento di alto livello a costi operativi di frazioni di centesimo.
Fatti principali
- DeepSeek ha annunciato V4.1 Flash giovedì.
- Il modello utilizza un'architettura "Causal-Encoder-Decoder".
- È costruito su un framework da 552 miliardi di parametri con un design Mixture-of-Experts (MoE).
- Solo 8 miliardi di parametri vengono attivati per l'elaborazione dell'input e 16 miliardi per la generazione della risposta.
- V4.1 Flash è il modello più piccolo della nuova serie di DeepSeek e offre una comprensione visiva multimodale nativa.
- Ha superato V4 Pro nei benchmark di coding, cybersecurity e agenti autonomi.
- Su Terminal-Bench 2.1, V4.1 Flash ha ottenuto 90,6, superando GPT-5.6 Sol di OpenAI (88,8), Kimi K3 di Moonshot AI (88,3) e V4 Pro di DeepSeek (87,9).
- Il lancio evidenzia la battaglia cinese nell'IA tra restrizioni all'esportazione di chip e costi hardware in aumento.
Entità
Istituzioni
- DeepSeek
- OpenAI
- Moonshot AI
- Zhipu AI
- Vals AI
- Anthropic
- Artificial Analysis
Luoghi
- China
- San Francisco
- United States
- Beijing