Kog mira a ottenere un'inferenza LLM 30 volte più veloce dalle GPU esistenti
Kog, una startup francese fondata da Gaël Delalleau, si concentra sul miglioramento delle GPU tradizionali per l'inferenza AI, mettendo così in discussione la necessità di chip specializzati. A maggio, l'azienda ha presentato un'anteprima tecnologica su Hacker News, raggiungendo un notevole 3.000 token al secondo (TPS) con il modello Laneformer 2B utilizzando GPU AMD MI300X e NVIDIA H200. Kog afferma di fornire un'inferenza LLM 30 volte più veloce, servendo clienti di ingegneria del software insoddisfatti dei ritardi in strumenti come Claude Code. La startup ha spostato la sua attenzione su modelli più grandi dopo aver scoperto che i clienti erano riluttanti a mettere a punto modelli più piccoli. Supportata da Scaleway, Bpifrance e French Tech 2030, Kog intende svelare un modello significativo a velocità 10x entro settembre per assicurarsi un finanziamento di Serie A. Delalleau ha un background in fisica dello stato solido e cybersecurity.
Fatti principali
- Kog è una startup francese focalizzata sull'ottimizzazione del software per un'inferenza AI più veloce su GPU convenzionali.
- Fondata da Gaël Delalleau, che ha studiato fisica dello stato solido all'École Polytechnique e ha lavorato nella cybersecurity offensiva.
- A maggio, l'anteprima tecnologica di Kog su Hacker News ha dimostrato una decodifica veloce su GPU AMD MI300X e NVIDIA H200.
- La demo ha raggiunto 3.000 token al secondo (TPS) utilizzando Laneformer 2B, un piccolo modello open-source.
- Kog promette un'inferenza LLM 30 volte più veloce, ma non l'ha ancora dimostrato su modelli di grandi dimensioni.
- L'azienda ha ricevuto 200 contatti commerciali concreti dopo l'anteprima.
- Kog si sta concentrando sull'ingegneria del software come primo caso d'uso, puntando agli utenti di strumenti come Claude Code.
- Delalleau prevede di dimostrare un modello importante a velocità 10x entro settembre per raccogliere un finanziamento di Serie A.
- Kog è supportata da Scaleway, Bpifrance e French Tech 2030.
- Il team di 11 persone dedica settimane o mesi a ogni nuova GPU, limitando la scalabilità.
- Kog prevede di utilizzare pipeline basate su agenti per supportare più chip e modelli in futuro.
Entità
Artisti
- Gaël Delalleau
Istituzioni
- Kog
- Cerebras
- AMD
- NVIDIA
- Anthropic
- ZML
- Stanford University
- Hazy Research
- École Polytechnique
- DEF CON
- Varsity VC
- Scaleway
- Bpifrance
- French Tech 2030
- TechCrunch
Luoghi
- France