Nav velger kinesisk Qwen-modell for lokal KI-utvikling
Flyttet Nav kodearbeidet over på kinesiske Qwen 3.6, kjørt lokalt på utviklernes egne maskiner for å få skybudsjettet til å strekke lenger.
«Alle KI-labene er uetiske, med noen nyanser selvsagt», sier utvikler Hans Kristian Flaatten i Nav til Shifter. Poenget hans er at valget mellom leverandører ikke løses med tillit, men med hvor modellen faktisk kjører. Nav testet flere modeller og størrelser før etaten landet på Qwen 3.6, språkmodellen fra kinesiske Alibaba Cloud, kjørt lokalt på utviklernes egne maskiner.
Utløseren var økonomi, ikke ideologi. Flaatten sier til Shifter at han ikke får mer budsjett i 2026 uansett, og at rammen tvinger fram smartere arbeid framfor mer innkjøpt skykapasitet. Nav valgte 3.6 framfor 3.8, selv om 3.8 gir best kvalitet av de to.
«Man bytter tid med kvalitet. 3.6 er vesentlig raskere uten nevneverdige flere feil» — Hans Kristian Flaatten, utvikler i Nav
Rundt modellen har Nav bygget «Oh-my-Nav», et rammeverk av instruksjoner som styrer hva modellen får lov til å gjøre, og som binder den til Navs regelverk, personvernkrav og kodestandard. Arbeidsflyten er fast: modellen intervjuer utvikleren om oppgaven, lager en plan, kritiserer planen sin, og skriver først deretter kode. Utvikleren må bekrefte mellom hver fase, og koden går gjennom sikkerhetssjekker og kodegjennomgang til slutt. Rammeverket kjører isolert, kan ikke lese eller sende e-post, og virker både med GitHub Copilot og Open Code.
Nav har i tillegg lagt ut cplt, en isolert sandkasse for å kjøre agenter trygt på egen maskin, åpent på GitHub. Der ligger etaten allerede med rundt 3100 åpne repoer.
Kjernen i argumentet er at opprinnelsesland betyr mindre enn kjøremiljø: «Det spiller liten rolle hvor modellen er laget når den kjører på maskinen min og aldri sender ut noe», sier Flaatten. Skymodellene Nav fortsatt kjøper tilgang til, må derimot ligge innenfor EØS eller i land etaten har databehandleravtale med.
Hva bør du gjøre?
- Test en mindre modell mot dine faktiske oppgaver i stedet for mot benchmarks. Nav fant at de minste modellene slet med å gjennomføre samme oppgave gjentatte ganger, og at hastigheten var verdt mer enn den siste kvalitetsprosenten.
- Skill mellom modell og ramme. Nav vurderer risikoen til å ligge i rammene rundt bruken, ikke i vektene. Skriv ned hva agenten får lese og skrive før du velger modell.
- Kjør agenten i sandkasse. cplt ligger åpent på GitHub og gjør samme jobb for deg som for Nav: fanger opp feil før de treffer maskinen din.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.