Hopp til hovedinnhold
Tilbake
Forskning 3 min · Kilde: Fermisense

500 dollar GPU-tid ga en 9B-modell som slo fem frontier-modeller

KI Takeaway KI-generert · kan inneholde feil

Trente en åpen 9B-modell for rundt 500 dollar i GPU-tid til 87,3 prosent av maksimal score på katalogkontroll, mot 76,9 prosent for det beste frontier-oppsettet.

«Vårt volum gjør dem uoverkommelig dyre», skriver Shopify Engineering om kommersielle API-er fra OpenAI og Google. Shopify kjører i stedet rundt 40 millioner multimodale modellkall i døgnet på finjusterte åpne modeller, og har flyttet seg fra LLaVA 1.5 7B via LLaMA 3.2 11B til Qwen2VL 7B. Konsulentselskapet Fermisense publiserte 27. juli en case-studie som forsøker å tallfeste hva den overgangen faktisk er verdt.

Fermisense bygde en simulert kopi av katalogkontrollen hos en e-handelsplattform: 177 767 vurderingsepisoder fra datasettet Amazon Berkeley Objects, en taksonomi på rundt 13 000 kategorier, og verktøy for taksonomisøk, merkevaresjekk og attributtskjema. Agenten må velge kategori, fylle attributter og felle en policy-dom. En scorer straffer oversette regelbrudd sju ganger hardere enn falske alarmer, slik at prioriteringen ligger i belønningen og ikke i prompten.

Fem frontier-modeller ble målt på 200 stratifiserte valideringsepisoder med identiske verktøy, bilder og scorer: GPT-5.5, GPT-5.6-sol, Gemini 3.1 Pro, Claude Opus 4.8 og Claude Fable 5. Med 2 800 tegn optimaliserte instrukser landet samtlige innenfor en tidels poeng av hverandre, på 76,9 prosent av oppnåelig score. Instruksene løftet samtidig inntoken-regningen med 28 til 55 prosent, på hvert eneste kall, for alltid.

Den trente modellen nådde 87,3 prosent. Ifølge modellkortet på Hugging Face er basen en Qwen3.5 med 9 milliarder parametere. Treningen gikk på to leide RTX PRO 6000-kort med det åpne rammeverket prime-rl fra Prime Intellect, 1 000 optimaliseringssteg over tre og en halv dag, til rundt 500 dollar. Modellen passerte frontier-nivået allerede etter omtrent 250 steg. Resten av kjøringen var finpuss.

Bakgrunn

Tallene er Fermisenses egne, publisert av et selskap som selger nettopp denne tjenesten, og bør leses deretter. Mønsteret bekreftes likevel av parter uten salgsinteresse i rapporten. Thinking Machines Lab og Bridgewaters AIA Labs trente i juni en Qwen3-235B på merkelapper fra fondets egne investorer, og løftet snittnøyaktigheten fra 78,2 til 84,7 prosent.

«Den trente modellen vår gjør 29,8 prosent færre feil enn den beste frontier-modellen vi evaluerte» — Thinking Machines Lab og Bridgewater AIA Labs

De oppgir samtidig 13,8 ganger lavere inferenskostnad per oppgave. Harvey rapporterer et juridisk agent-oppsett som slår GPT-5.5 og Claude Opus 4.8 på egne rubrikker, og Intercom kjører sin egen støttemodell Fin Apex på nesten to millioner kundesaker i uka.

Fellesnevneren er ikke modellstørrelse. Den er at oppgaven kan scores maskinelt. Der en regel, en test eller en rubrikk kan avgjøre om svaret var riktig, kan modellen øve seg. Der utfallet bare kan diskuteres, kan den ikke.

For deg som bygger, er terskelen lavere enn dollartallene antyder. prime-rl ligger åpent på GitHub under Apache-2.0 med rundt 1 700 stjerner, og GPU-regningen er det billigste leddet i regnestykket. De to dyre delene er å bygge et miljø modellen kan feile i gjentatte ganger, og en scorer som ikke lar seg lure.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter