Hopp til hovedinnhold
Tilbake
Modell 2 min · Kilde: GitHub (Show HN)

Cactus Hybrid gir Gemma 4 en innebygd tillitsscore som fanger egne feil

KI Takeaway KI-generert · kan inneholde feil

Legg en tillitsscore inn i selve sjekkpunktet, så kan en liten Gemma 4 avgjøre på egen hånd når den bør sende spørsmålet videre til en større modell.

En liten modell på din egen maskin er rask og privat, men den tar av og til feil uten å antyde det med et eneste ord. Cactus Compute angriper det med å ettertrene modellen til å vite når den bommer: selskapet legger prober inn i sjekkpunktet som gir hvert svar en tillitsverdi mellom 0 og 1, levert som strukturert data ved siden av svaret i stedet for noe du må lese ut av teksten. Første utgivelse er Gemma 4 E2B Hybrid, den minste modellen i Gemma 4-familien, sluppet under MIT-lisens med Googles Gemma-vilkår på selve modellvektene.

Ruting er poenget. Cactus oppgir at E2B Hybrid matcher Gemini 3.1 Flash-Lite på de fleste målingene ved å sende bare 15 til 35 prosent av forespørslene videre til Flash-Lite og kjøre resten selv. Andelen stiger med hardere kvantisering: på 4-bit ligger den mellom 25 og 45 prosent avhengig av oppgave, og på MMLU-Pro må rundt 90 prosent videre. Kvantiseringstallene er målt på Cactus' egne kvantiseringer, og selskapet ber utviklere måle Unsloth, GGUF og MLX hver for seg.

Tallet selskapet legger mest vekt på er AUROC, altså hvor godt tillitsscoren skiller riktige svar fra gale. Cactus rapporterer 0,814 i snitt mot 0,549 for token-entropi, den vanlige billige metoden. Mest oppsiktsvekkende er at proben ble trent uten et eneste lydeksempel, men lander mellom 0,79 og 0,88 på fire lydbenchmarker. Cactus tolker det som at proben leser et modalitetsuavhengig korrekthetssignal ut av modellens skjulte tilstand. Alle tallene er selskapets egne og foreløpig ikke etterprøvd uavhengig.

Hva bør du gjøre?

  1. Sett terskelen selv i stedet for å arve eksempelet. Cactus ruter videre under 0,85, men riktig nivå avhenger av hva en feil faktisk koster i appen din.
  2. Last modellen med eksplisitt .to(device), aldri device_map="auto". Proben scorer utenfor forward(), så vekter som havner på meta-enheten krasjer avlesningen.
  3. Lås transformers til minst 5.5.4 og under 5.6. Cactus melder at 5.14 og nyere krasjer på dette sjekkpunktet.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter