Hopp til hovedinnhold

Onsdag 7. oktober

 Tilbake Koding 2 min 00.57

Kimi K3 topper Code Arena Frontend, men faller på tung matte

mandag 20. juli · KI-generert · Kilde: The Decoder

Innholdet er KI-generert og kan inneholde feil. Sjekk originalkilden.

Topper Code Arena Frontend foran både Claude Fable 5 og GPT-5.6 Sol, men treffer bare rundt 39 prosent på de tyngste matteoppgavene.

Moonshots Kimi K3 er den første kinesiske modellen som tar førsteplassen i Code Arena Frontend, en benchmark der menneskelige preferansevurderinger avgjør rangeringen. Modellen lander på 1 679 poeng, mot 1 631 for Claude Fable 5 og 1 618 for GPT-5.6 Sol. Arena.ai oppgir at det er et hopp på 17 plasser fra forrige Kimi-modell, k2.6, og at K3 topper 6 av 7 deldomener, blant dem merkevare og markedsføring, referansebasert design og dataanalyse.

Bildet snur på tung matematikk. Tall fra Epoch AI viser at Kimi K3 treffer rundt 39 prosent riktig på FrontierMath Tier 4, benchmarkens vanskeligste ekspertoppgaver. Modeller fra OpenAI og Anthropic ligger i enkelte tilfeller nær 90 prosent på samme sett. Avstanden på et par prosentpoeng i frontend-arenaen og avstanden på 50 prosentpoeng i matte handler om to helt forskjellige egenskaper.

Nøkkeltall
1 679
Kimi K3 i Code Arena Frontend, ny førsteplass
1 631
Claude Fable 5, tidligere leder
1 618
GPT-5.6 Sol
39 %
Kimi K3 på FrontierMath Tier 4, mot nær 90 % for de beste vestlige modellene

Frontend-arenaen måler hva mennesker foretrekker å se, altså komponenter, layout og visuell gjennomføring. FrontierMath Tier 4 måler flerstegsresonnering der ett feilsteg ødelegger svaret. At en modell kan lede den ene og ligge langt bak på den andre, sier noe om hvor lite «best i test» betyr uten at du vet hvilken oppgave det gjelder.

Praktisk konsekvens: bruker du en modell til UI-arbeid, er Kimi K3 nå et reelt alternativ til de dyre vestlige modellene, og med åpne vekter ventet i slutten av juli kan det bli et alternativ du kjører selv. Skal den samme modellen ta ansvar for planlegging over mange steg, verifisering eller noe som ligner matematisk resonnering, holder ikke frontend-plasseringen som grunnlag.

Pulsen · norske KI-nyheter for deg som bygger. Sakene er KI-generert fra originalkilden, som alltid lenkes.