Hopp til hovedinnhold
Tilbake
Bransje 2 min · Kilde: The Decoder

Nvidias Groq 3 LPX når 3400 tokens i sekundet, men trenger 64 brikker

KI Takeaway KI-generert · kan inneholde feil

Satte Groq 3 LPX i full produksjon med 3400 tokens i sekundet på Gemma 4 31B, men rekorden krever minst 64 brikker.

Nvidia meldte på Hot Chips 2026 at inferensakseleratoren Groq 3 LPX har gått i full produksjon, skriver The Decoder. Brikken utvider Vera Rubin-plattformen og er bygget for rask tokengenerering til agentsystemer, og Nvidia sier den blir tilgjengelig senere i år. Nebius skal være første skyleverandør ut med den, gjennom Token Factory. I slutten av desember betalte Nvidia rundt 20 milliarder dollar for Groq-lisensen og hentet inn grunnlegger Jonathan Ross og president Sunny Madra.

Målingen kommer fra Artificial Analysis: 3400 tokens i sekundet på den åpne modellen Gemma 4 31B med 100 000 tokens kontekst, målt over 50 påfølgende forespørsler. Ytelsen holdt seg stabil mellom 10 000 og 100 000 tokens inn. Nvidia bruker tallet til å si at akseleratoren er fire ganger raskere enn Cerebras, som ligger på 882 tokens i sekundet.

Regnestykket har en hake, påpeker The Register. Hver LPU har bare 500 MB minne, 576 ganger mindre enn en Rubin-GPU med 288 GB, så modellen må splittes over flere akseleratorer via Ethernet, med opptil 256 LPU-er i ett rack. GPU-ene tar den beregningstunge prefill-fasen og LPU-ene den båndbreddetunge decode-fasen. Nvidia trenger minst 64 brikker for å nå rekorden, mens Cerebras klarer seg med én eller to, og sammenligningen tar ikke med Cerebras' nyeste CS-4-generasjon i det hele tatt.

Gemma 4 31B er dessuten et beste tilfelle: en tett modell som får plass i ett rack. DeepSeek V3 ville trengt 1342 akseleratorer, litt over fem rack. For deg som planlegger agentkjøringer med mange steg, gjelder hastighetstallet altså én modellform, og kostnaden per rack er variabelen du faktisk må regne på.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter