Hopp til hovedinnhold
Tilbake
Modell 2 min · Kilde: The Decoder

Kimi K3 topper Code Arena Frontend, men faller på tung matte

KI Takeaway KI-generert · kan inneholde feil

Topper Code Arena Frontend foran både Claude Fable 5 og GPT-5.6 Sol, men treffer bare rundt 39 prosent på de tyngste matteoppgavene.

Moonshots Kimi K3 er den første kinesiske modellen som tar førsteplassen i Code Arena Frontend, en benchmark der menneskelige preferansevurderinger avgjør rangeringen. Modellen lander på 1 679 poeng, mot 1 631 for Claude Fable 5 og 1 618 for GPT-5.6 Sol. Arena.ai oppgir at det er et hopp på 17 plasser fra forrige Kimi-modell, k2.6, og at K3 topper 6 av 7 deldomener, blant dem merkevare og markedsføring, referansebasert design og dataanalyse.

Bildet snur på tung matematikk. Tall fra Epoch AI viser at Kimi K3 treffer rundt 39 prosent riktig på FrontierMath Tier 4, benchmarkens vanskeligste ekspertoppgaver. Modeller fra OpenAI og Anthropic ligger i enkelte tilfeller nær 90 prosent på samme sett. Avstanden på et par prosentpoeng i frontend-arenaen og avstanden på 50 prosentpoeng i matte handler om to helt forskjellige egenskaper.

Nøkkeltall
1 679
Kimi K3 i Code Arena Frontend, ny førsteplass
1 631
Claude Fable 5, tidligere leder
1 618
GPT-5.6 Sol
39 %
Kimi K3 på FrontierMath Tier 4, mot nær 90 % for de beste vestlige modellene

Frontend-arenaen måler hva mennesker foretrekker å se, altså komponenter, layout og visuell gjennomføring. FrontierMath Tier 4 måler flerstegsresonnering der ett feilsteg ødelegger svaret. At en modell kan lede den ene og ligge langt bak på den andre, sier noe om hvor lite «best i test» betyr uten at du vet hvilken oppgave det gjelder.

Praktisk konsekvens: bruker du en modell til UI-arbeid, er Kimi K3 nå et reelt alternativ til de dyre vestlige modellene, og med åpne vekter ventet i slutten av juli kan det bli et alternativ du kjører selv. Skal den samme modellen ta ansvar for planlegging over mange steg, verifisering eller noe som ligner matematisk resonnering, holder ikke frontend-plasseringen som grunnlag.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter