Kinesiske åpne modeller tok igjen Vesten: forspranget er nede i tre områder
Krymper til tre målbare områder etter at Kimi K3 og GLM-5.3 tok igjen de vestlige modellene, og det som fortsatt lar seg forsvare ligger i systemet rundt modellen.
For halvannet år siden fikk DeepSeek R1 markedene til å skjelve, men den gang lå de kinesiske modellene på topp bare i enkeltdisipliner. Den perioden er over, skriver The Decoder i fjerde utgave av nyhetsbrevet Frontier Radar. Moonshots Kimi K3, Alibabas Qwen3.8-Max og Z.ais GLM-5.3 håndterer lange kunnskapsoppgaver, koder over mange steg og koordinerer verktøy langt mer pålitelig enn forgjengerne. K3 debuterte på tredjeplass på Artificial Analysis' intelligensindeks med 57 poeng, og Opus 5 tok tilbake toppen med 61.
Tre områder skiller fortsatt, og alle er skjøre som forsvarsverk. Abstrakte spesialtester gir et tydelig gap på ARC-AGI-2, 60,4 mot 89,2 prosent, men testen måler mønstergjenkjenning langt fra hverdagsoppgaver. Pålitelighet veier tyngre kommersielt: på AA-AnalystAgent, som bare godkjenner en oppgave hvis modellen løser den fem av fem ganger, leder Opus 5 med 54 prosent mot K3s 39. Gapet skyldes nesten utelukkende repeterbarhet, for K3 løser 73 prosent av oppgavene minst én gang mot Opus 5s 74. Det tredje er offensiv cybersikkerhet, der K3 fikk 32 prosent på ExploitBench mot rundt 76 for de beste amerikanske modellene. GLM-5.3 kuttet avstanden omtrent i halvparten på en måned med 54,4 prosent, målt av Z.ai selv.
Vestlige laber forklarer tempoet med destillasjon. Anthropic beskriver industrielle kampanjer knyttet til DeepSeek, Moonshot og MiniMax med over 16 millioner interaksjoner gjennom rundt 24 000 falske kontoer. Ingen av labene har lagt fram etterprøvbare bevis. The Decoders poeng er at skyldspørsmålet nesten ikke betyr noe: stemmer det, lekker enhver solgt evne ut til konkurrentene innen måneder, og stemmer det ikke, var forspranget verdt enda mindre.
Derfor flytter argumentet seg til systemet rundt modellen. Britiske AI Security Institute målte at resultatene på programvareoppgaver steg rundt 25 prosent da en modell fikk ti millioner tokens per oppgave i stedet for én million. Enda tydeligere: da OpenAI beholdt resonneringstilstanden mellom stegene og komprimerte konteksten annerledes i en ARC-AGI-3-evaluering, nær tredoblet Sol seg fra 13,3 til 38,3 prosent, med en sjettedel av output-tokenene. Samme modell, annet system.
Kontrollprogramvaren er likevel ingen vollgrav. Den som spør et fremmed agentsystem tett nok, ser verktøykallene og kan lære orkestreringen, og koden lekker: i Claude Code-lekkasjen eksponerte et feilsendt source map rundt 513 000 linjer kildekode. Det som ikke kan kopieres, er den løpende driften hos kunden. Arnaud Fournier, teknologidirektør i OpenAIs utrullingsselskap DeployCo, beskriver overfor The Decoder en kanal som går gjennom modellsvakheter og verktøybehov, ikke gjennom kundedata.
«Med mindre noen eksplisitt ber oss om det» — Arnaud Fournier, teknologidirektør i DeployCo, om det eneste tilfellet der OpenAI trener på kundedata
Finner et kundeteam at dokumentforståelse fungerer dårlig, henter forskningssiden målrettet data og retter det. Destillasjon kopierer den ferdige modellen, aldri tilgangen til arbeidet den neste lærer av.
For Europa er regnestykket todelt. Løpet Europa tapte tydeligst, det om den sterkeste ferdige modellen, mister strategisk verdi. Laget der forsprang forsvares framover kan derimot ikke lastes ned: EuroStack-initiativet anslår at Europa importerer over 80 prosent av sin digitale infrastruktur, og europeiske leverandører har rundt 15 prosent av skymarkedet. Mistral er ifølge The Decoder den eneste europeiske aktøren med egne modeller, egen plattform og planlagt regnekraft, men endepunktene støtter ennå ikke de agentiske arbeidslastene analysen handler om.
For deg som bygger flytter tyngdepunktet seg fra hvilken modell du velger til hvordan du kjører den. Et åpent vektsett er dessuten en forretningsbeslutning noen kan trekke tilbake: USA eksportkontrollerte Fable 5 i 18 dager, og Z.ai holder foreløpig tilbake vektene til GLM-5.3.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.