Kimi K3 topper Code Arena Frontend, men faller på tung matte
Topper Code Arena Frontend foran både Claude Fable 5 og GPT-5.6 Sol, men treffer bare rundt 39 prosent på de tyngste matteoppgavene.
Moonshots Kimi K3 er den første kinesiske modellen som tar førsteplassen i Code Arena Frontend, en benchmark der menneskelige preferansevurderinger avgjør rangeringen. Modellen lander på 1 679 poeng, mot 1 631 for Claude Fable 5 og 1 618 for GPT-5.6 Sol. Arena.ai oppgir at det er et hopp på 17 plasser fra forrige Kimi-modell, k2.6, og at K3 topper 6 av 7 deldomener, blant dem merkevare og markedsføring, referansebasert design og dataanalyse.
Bildet snur på tung matematikk. Tall fra Epoch AI viser at Kimi K3 treffer rundt 39 prosent riktig på FrontierMath Tier 4, benchmarkens vanskeligste ekspertoppgaver. Modeller fra OpenAI og Anthropic ligger i enkelte tilfeller nær 90 prosent på samme sett. Avstanden på et par prosentpoeng i frontend-arenaen og avstanden på 50 prosentpoeng i matte handler om to helt forskjellige egenskaper.
Frontend-arenaen måler hva mennesker foretrekker å se, altså komponenter, layout og visuell gjennomføring. FrontierMath Tier 4 måler flerstegsresonnering der ett feilsteg ødelegger svaret. At en modell kan lede den ene og ligge langt bak på den andre, sier noe om hvor lite «best i test» betyr uten at du vet hvilken oppgave det gjelder.
Praktisk konsekvens: bruker du en modell til UI-arbeid, er Kimi K3 nå et reelt alternativ til de dyre vestlige modellene, og med åpne vekter ventet i slutten av juli kan det bli et alternativ du kjører selv. Skal den samme modellen ta ansvar for planlegging over mange steg, verifisering eller noe som ligner matematisk resonnering, holder ikke frontend-plasseringen som grunnlag.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.