Kog fikk 3 000 tokener i sekundet ut av én forespørsel på H200 og MI300X
Les Kogs tall som et gulv for hva vanlige datasenter-GPU-er kan gjøre, ikke som et løfte om 30 ganger raskere LLM-er i dag.
Kappløpet om raskere inferens har stort sett handlet om spesialbygd maskinvare, og Cerebras fikk godt mottatt børsdebut i mai på nettopp det premisset. Franske Kog satser motsatt: at det finnes mye mer å hente ut av GPU-ene bedrifter allerede eier. Selskapet nådde forsiden av Hacker News i mai med en teknisk forhåndsvisning som skulle vise at «ekstremt rask dekoding av enkeltforespørsler er mulig på standard datasenter-GPU-er», kjørt på AMD MI300X og Nvidia H200, skriver TechCrunch.
Demoen leverte rundt 3 000 tokener i sekundet per forespørsel. Forbeholdet ligger i modellen: tallet kom fra en spesialbygd modell på rundt 2 milliarder parametere, Laneformer 2B, som nå er lagt ut med åpen kildekode. Mellom det og selskapets løfte om «30 ganger raskere LLM-inferens» ligger hele hoppet opp til store modeller.
«GPU-er har en lys fremtid» — Gaël Delalleau, administrerende direktør i Kog
Delalleau mener det er en misforståelse at GPU-er er dårlig egnet til dekoding, og peker på at nyere kort har stadig mer minnebåndbredde som bare venter på å bli utnyttet. Metoden hans stammer fra offensiv sikkerhet, der han var finalist fire ganger i DEFCONs CTF-turnering, og går ut på å reversere maskinvaren ned til assembler og binærkode. Prisen er tempo: hver nye GPU krever flere uker eller måneder med arbeid, og teamet er på elleve personer. Kog er ikke alene om tilnærmingen, og TechCrunch nevner landsmannen ZML, som lager maskinvareuavhengig programvare utenom Nvidias CUDA.
Etter lanseringen fikk selskapet 200 konkrete kundeemner, ifølge Delalleau, og oppdaget samtidig at kundene ikke er villige til å finjustere små modeller. Derfor er alt nå rettet mot store modeller. Delalleau venter å ha den første store modellen på ti ganger hastighet i september, og bruker den til å hente inn en A-runde.
Hva bør du gjøre?
- Hent Laneformer 2B hvis du vil se hva metoden faktisk gjør. Den er den eneste delen av demoen du kan kjøre selv i dag.
- Sjekk om flaskehalsen din er enkeltforespørsler eller gjennomstrømning. Kogs tall gjelder dekoding av én forespørsel om gangen, som er tilfellet når du sitter og venter på en kodeagent, ikke når du betjener mange brukere samtidig.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.