Hopp til hovedinnhold
Tilbake
Modell 3 min · Kilde: Ornith AI

Ornith-1.5: åpne vekt-modeller med selvforbedringsløkke, matcher Claude Opus 4.8 på Terminal-Bench

KI Takeaway KI-generert · kan inneholde feil

Slipper Ornith AI tre modeller under MIT-lisens som er trent på oppgaver de har funnet opp selv.

Claude Opus 4.8 får 85,0 på Terminal-Bench 2.1. Ornith-1.5-397B får 86,1, og vektene lå fritt nedlastbare under MIT-lisens på Hugging Face fra 18. august 2026. På DeepSWE går det motsatt vei: 56,0 mot Opus 4.8 sine 59,0. Ornith AI la ut tre størrelser samtidig, en MoE-modell på 397 milliarder parametere, en MoE på 35 milliarder med 3 milliarder aktive per token, og en tett modell på 9 milliarder.

Det interessante er hvordan de er trent. Ornith-1.5 utvider selvforbedringsløkken fra Ornith-1.0 til å dekke hele kjeden: modellen foreslår nye oppgaver, bygger sitt eget stillas av instruksjoner og verktøy rundt hver oppgave, og produserer løsningsforsøk som gir belønningssignal. Alle tre stegene optimaliseres med GRPO i samme løkke, så belønningen fra et løsningsforsøk forplanter seg bakover til oppgavegeneratoren.

Belønningen for en foreslått oppgave er et produkt av tre signaler: om oppgaven i det hele tatt er et gyldig og verifiserbart miljø, om den ligger like i overkant av det modellen klarer nå, og om den er ny sammenlignet med det som allerede er trent på. Multiplikasjonen er poenget. En oppgave som er gyldig og vanskelig, men identisk med noe modellen har sett før, gir null.

«I stedet for å hvile på en statisk treningsfordeling eller håndbygd agentdesign utvider Ornith-1.5 sin egen læreplan kontinuerlig» — Ornith AI

Kjører du lokalt, er det de små modellene som teller. Ornith-1.5-9B lander på 47,0 på Terminal-Bench 2.1 med Claude Code og 70,6 på SWE-bench Verified, over Gemma-4-31B sine 52,0 på samme test til tross for at den er under en tredjedel så stor. Ornith AI har lagt ut GGUF-versjoner og MLX-bygg i 4, 6 og 8 bit, så 9B-modellen kjører på en Mac uten at du selv må kvantisere. 35B-varianten aktiverer bare 3 milliarder parametere per token og får 68,5 på Terminal-Bench mot 49,2 for Qwen3.6-35B-A3B.

Ta likevel tallene for det de er: selvrapporterte resultater fra modellprodusenten, snitt over fem kjøringer. Metoden er dokumentert i detalj, med git-historikk fjernet fra oppgaverepoene og nettverket avslått for å hindre at modellen finner fasiten. Gapet oppover er også reelt. På Frontier-Bench v0.1 får Ornith-1.5-397B 13,5 mot 21,1 for Claude Opus 4.8 og 23,0 for Kimi K3, som med sine 2,8 billioner parametere fortsatt ligger foran på både Terminal-Bench (88,3) og DeepSWE (67,5).

Nøkkeltall
86,1
Ornith-1.5-397B på Terminal-Bench 2.1, mot 85,0 for Claude Opus 4.8
68,5
35B-modellen på samme test, mot 49,2 for Qwen3.6-35B-A3B
70,6
9B-modellen på SWE-bench Verified, mot 52,0 for Gemma-4-31B
13,5
397B-modellen på Frontier-Bench v0.1, mot 21,1 for Claude Opus 4.8

Hva bør du gjøre?

  1. Hent GGUF- eller MLX-bygget av 9B-modellen først. Det er den eneste av de tre som gir mening på en laptop, og MLX-versjonene i 4 og 6 bit er allerede lagt ut.
  2. Kjør 35B-A3B på en arbeidsstasjon hvis du har VRAM til det. Med 3 milliarder aktive parametere per token er den billigere å kjøre enn tette modeller i samme klasse.
  3. Test på dine egne oppgaver før du bytter. Tallene er produsentens egne, og avstanden til Opus 4.8 vokser jo vanskeligere oppgavene blir.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter