Needle 2 pakker verktøykall i 14 MB og kjører på en ESP32
Slipper Cactus Compute en verktøykallende modell på 45 millioner parametere som kjører en hel økt innenfor 28 MB RAM.
Edge-KI har i praksis betydd Mac-er og PC-er med rikelig minne. Cactus Compute sikter et helt annet sted: selskapet peker på over 21 milliarder tilkoblede IoT-enheter mot rundt 1,5 milliarder PC-er, og anslår at omtrent fire av fem enheter i kanten koster under 200 dollar. Needle 2 ble sluppet 10. august og er bygget for nettopp den maskinvaren: ingen GPU, ingen NPU, noen hundre megabyte RAM.
Hele modellen er én binærfil på 14 MB, med motor, tokenizer og grammatikk-kompilator forseglet inni. Cactus oppgir 500 tokens i sekundet i dekoding på en Raspberry Pi 5, mellom 300 og 700 på telefoner under 200 dollar som Samsungs A-serie, og 400 til 1500 på VR-utstyr som Meta Quest 3S og Apple Vision Pro. Minnetaket er det viktigste tallet: oppmerksomhetsvinduet er låst til 256 tokens, så RAM-bruken har et fast tak på 28 MB uansett hvor lenge økten varer. Det er lite nok for mikrokontrollere som ESP32-P4 med 32 MB PSRAM.
Kvantiseringen er ikke gjort i etterkant. Needle 2 trenes mot Cactus Quants gjennom hele løpet, både vekter, aktiveringer og KV-cache, og modellen du laster ned på snitt 2 bits er den samme modellen som ble trent. Systemprompten og verktøydeklarasjonene er festet som permanente ankere i cachen, så det ene en verktøykallende modell aldri kan glemme, er strukturelt umulig å kaste ut.
Benchmarkene viser også hvor den svikter. På Googles Mobile Actions treffer Needle 2 63,7 prosent mot 69,1 for LFM2.5 230M og 64,0 for FunctionGemma 270M, men har høyest treffsikkerhet på selve funksjonsnavnet med 98,3. På Seal-Tools utenfor domenet leder den klart med 28,7 mot 17,0 og 15,6. På BFCL v4 faller den til 42,6 samlet, mot 61,7 for Apple FM. Cactus oppgir selv de to skjevhetene i sammenligningen: konkurrentene kjører i f16, og Needle er trent kun for agentiske verktøykall.
Konfidansscoren er limet i arkitekturen. Hvert svar bærer en lært score, og et tomt kall er modellens måte å si nei på: over terskelen handler du lokalt, under den spør du på nytt eller eskalerer til skyen. Testere på Hacker News fant at grensen ikke holder helt, og at bokstavene «HN» alene utløste et kall om å låse inngangsdøren, riktignok med konfidans 0.
«Rundt 60 prosent konfidansterskel fungerer fint ut fra eksperimentene våre, problemet er at du må teste på din egen arbeidsmengde» — Henry Ndubuaku, Cactus Compute, i Show HN-tråden
I produksjon kjører Pebble modellen lokalt i Index 01-appen, uten å gå veien om nett.
«Pebble Index Ring har ingen skjerm. Så når du snakker til den, må handlingen bare skje, hver gang, med eller uten internett» — Pebble, sitert av Cactus Compute
Hva bør du gjøre?
- Kjør modellen på maskinvaren du faktisk skal bruke, ikke på en laptop. Vektene ligger på Hugging Face under Apache 2.0, og repoet kjører på en Raspberry Pi 5 uten GPU.
- Sett konfidansterskelen mot din egen arbeidsmengde. Cactus eksponerer den nettopp fordi ingen offentlig benchmark dekker ditt verktøysett.
- Finjuster på ditt eget verktøyvokabular. En modell på 45 millioner parametere lar seg trene om på din egen Mac eller PC på minutter til noen timer, ifølge Cactus.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.