Hopp til hovedinnhold
Tilbake
Bransje 3 min · Kilde: Cerebras

Cerebras CS-4 dobler ytelsen på samme wafer ved å doble effekten

KI Takeaway KI-generert · kan inneholde feil

Dobler effektbudsjettet per wafer i stedet for å lage ny silisium, og lander på opptil 30 ganger raskere inferens enn GPU-systemer.

Anslagsvis 33 kilowatt går nå gjennom én Cerebras-wafer, mot 15 kilowatt i forrige generasjon. Det er den viktigste endringen i CS-4, systemet Cerebras kunngjorde 18. august, og som ifølge selskapet leverer opptil 30 ganger raskere inferens enn GPU-systemer i produksjon. De første leveransene skal skje dette kvartalet.

Prosessoren heter Wafer Scale Engine 3 Turbo, og «Turbo» er presist valgt. The Register har satt spesifikasjonene ved siden av forrige generasjon og finner ingen forskjell på det som vanligvis definerer ny silisium: 46 225 kvadratmillimeter wafer, TSMC 5 nm, fire billioner transistorer, 900 000 kjerner og 44 GB SRAM. Det som er nytt, er kraftforsyningen. Cerebras plasserer den 0,5 millimeter fra prosessoren, rundt 100 ganger nærmere enn de omtrent 50 millimeterne på et vanlig GPU-kort, og fjerner dermed mesteparten av tapet på kortnivå. The Register anslår at klokkefrekvensen har gått fra 1,4 til 2,8 GHz.

«På papiret høres det mer imponerende ut enn det egentlig er» — The Register om Cerebras' toppytelsestall

Innvendingen gjelder hvordan tallene er målt. Cerebras oppgir 250 petaFLOPS per prosessor, men det tallet forutsetter sparsity, som sjelden hjelper på LLM-inferens. Tett FP16 lander nærmere 25 petaFLOPS. Til sammenligning ligger nyeste GPU fra AMD og Nvidia på fire til fem petaFLOPS tett FP16. Minnebåndbredden på 43,2 petabyte per sekund er trolig også teoretisk, siden forrige generasjon manglet regnekraft til å mette sin egen SRAM.

Den mer interessante endringen er arkitektonisk. Cerebras kjører ikke lenger hele inferenskjeden på egne brikker. CS-4 har innebygd støtte for disaggregert inferens, der en egen prefill-motor behandler prompten og overleverer tilstanden til Cerebras for selve dekodingen. Selskapet peker eksplisitt på AMD Helios og AWS Trainium som prefill-plattformer. Cerebras-brikkene blir dermed dekodingsakseleratorer, og fordelen deres er de 44 gigabytene SRAM: der en Groq-basert løsning trenger tusenvis av enheter for en modell på en billion parametere, klarer Cerebras seg med noen titalls.

Cerebras skriver i produktbloggen at raske tokens er mer verdt enn langsomme, og at CS-4 derfor leverer både høyere tokenverdi og mer total kapasitet innenfor et gitt effektbudsjett. Latensen mellom wafere er nede i to mikrosekunder, som ifølge selskapets egen ekstrapolering gir over 1 000 tokens per sekund på modeller med mer enn ti billioner parametere.

For deg som bygger agenter og resonnerende applikasjoner, betyr dette at ultrarask dekoding stadig tydeligere blir en egen tjeneste du kjøper via API, ikke noe du kjører selv. Prisen for hastigheten er en effektprofil som bare hyperskala-datasentre kan huse.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter