Hopp til hovedinnhold
Tilbake
Fine-tuning 2 min · Kilde: Hugging Face

Ivo Sage: MIT-lisensiert LoRA på DeepSeek V4 Flash løfter kontraktsoppgaver fra 70 til 91 prosent

KI Takeaway KI-generert · kan inneholde feil

Se på Ivo Sage som oppskrift: 65 RL-steg med en LoRA på 12,2 GiB løftet en åpen basismodell nær frontnivå på juridisk agentarbeid.

0,40 dollar mot 92,46 dollar per oppgave. Det er kostnaden for Ivo Sage og Fable 5.1 på de generelle oppgavene i Harveys Legal Agent Benchmark (LAB), der Ivo Sage besto alle kriterier i 15,2 prosent av oppgavene og Fable 5.1 i 15,7 prosent. Ivo AI publiserte modellen på Hugging Face denne uken under MIT-lisens. Fable 5.1-tallet utelater fire oppgaver modellen ikke fullførte, ifølge modellkortet.

Ivo Sage er ikke en ny modell, men en LoRA (rank 32, alpha 64) på DeepSeek V4 Flash, en MoE-modell med 284 milliarder parametere totalt og 13 milliarder aktive. Adapteren dekker feed-forward-lagene i alle eksperter pluss lm_head, mens attention er frosset. Ivo AI trente med RL-metoden CISPO i bare 65 steg på 1 040 LAB-oppgaver, med benchmarkens egen agentløkke og seks verktøy (bash, read, write, edit, glob, grep) som miljø og en LLM-dommers rubrikkscore som belønning.

På kontraktsoppgavene steg andelen beståtte kriterier fra 70,1 til 91,3 prosent. Modellen brukte også 21 prosent færre tokens per episode enn basismodellen (47 600 mot 60 000), og derfor er den billigere enn DeepSeek V4 Flash selv. På RedlineBench, som ikke var med i treningen, gikk scoren fra 30,8 til 45,7, mens LegalBench holdt seg på 83,0 mot 83,1.

Forbeholdet er at trening og validering kommer fra samme benchmark, med samme agentløkke og samme dommer. RedlineBench er det eneste signalet utenfor den fordelingen. Modellen er dessuten trent på engelsk, så norske kontrakter er utestet.

«Ivo Sage produserer juridiske arbeidsprodukter som skal gjennomgås av en kvalifisert advokat.» — Ivo AI, modellkortet på Hugging Face

Hva bør du gjøre?

  1. Les episodetranskriptene i datasettet ivo-ai-labs/ivo-sage-training-artifacts før du stoler på tallene; der ligger hver valideringsepisode med leveranser og dommerens vurderinger.
  2. Server modellen med SGLang og --enable-lora oppå DeepSeek-V4-Flash-0731; eksempelet i modellkortet bruker --tp 8, altså åtte GPU-er.
  3. Gjenbruk oppskriften i eget domene hvis du har vurderingsrubrikker: egen agentløkke som miljø, LLM-dommer som belønning og en LoRA i stedet for full finjustering.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter