Hopp til hovedinnhold

Onsdag 7. oktober

GLM-5.2 kjører 2626 tokens/sek per node på AMD MI355X til under halve Blackwell-prisen

lørdag 4. juli · KI-generert · Kilde: Wafer AI

Innholdet er KI-generert og kan inneholde feil. Sjekk originalkilden.

- Wafer AI måler GLM-5.2 til 2626 tokens/sek per node på AMD MI355X, med over 2x lavere kostnad per token enn Nvidia Blackwell. - Målingen gjelder inferens på åpne modeller, gjort av én aktør på ett oppsett.

For deg som vurderer egen inferens-hardware er dette et datapunkt verdt å notere, ikke en fasit. AMDs MI355X har lenge vært billigere på papiret, men programvarestacken (ROCm mot CUDA) har vært bøygen. At noen viser konkurransedyktig gjennomstrømning på en åpen modell som GLM-5.2, tyder på at gapet smalner.

Les tallene med forbehold. Én benchmark fra én aktør er ikke en garanti for din arbeidslast, og «per node» skjuler valg om batching, kontekstlengde og kvantisering. Men retningen er interessant: mer press på Nvidia betyr flere reelle alternativer for deg som vil eie inferensen selv i stedet for å leie den per token.

Pulsen · norske KI-nyheter for deg som bygger. Sakene er KI-generert fra originalkilden, som alltid lenkes.