Hillock kjører lokalt agent-minne uten vektordatabase
Bytter vektordatabasen mot en SQLite-kunnskapsgraf og et hyperdimensjonalt minne som holder seg under 1,2 GB VRAM.
En vanlig lokal RAG-stabel bruker 5,8 til 16 GB VRAM og en 8B-modell bare for å trekke fakta ut av dokumenter. Hillock, et åpent prosjekt av Roan de Jager som ble lagt ut som Show HN 30. august, gjør samme jobb under 1,2 GB, testet på et GTX 1070-kort, og kjører også helt uten GPU.
Forskjellen ligger i at generative modeller er fjernet fra inntaksfasen. Dokumenter går gjennom TALON, en tretrinns pipeline med koreferanse-oppløsning, en MiniLM-basert predikatruter og en zero-shot relasjonsekstraktor. Resultatet lagres som subjekt-predikat-objekt-tripler i SQLite, ikke som embeddinger. Et hypervektorrom på 10 000 dimensjoner håndterer kontekstmatching, og en hard terskel på 0,55 avgjør om spørsmålet i det hele tatt får treffe Ollama. Klarer det ikke terskelen, svarer systemet at det ikke har verifisert informasjon, i stedet for å gjette. Inntak av et dokument på 30 setninger tar rundt 5 sekunder på GPU, mot 15 til 30 minutter for LLM-basert uttrekk.
Prosjektets egne tall er lave, og de oppgis åpent. Versjon 0.6.0 måler 59,1 prosent recall på uttrekk, 13,8 prosent presisjon og 54,5 prosent gjenfinningsnøyaktighet. Testsettet er én akademisk tekst på 32 setninger, 22 besvarbare spørsmål og ti lurespørsmål, og de Jager skriver selv at det er nok til å fange regresjoner, men ikke til å hevde statistisk robusthet. Du får altså en billig og ærlig minnemotor, ikke en presis en.
Hva bør du gjøre?
- Kjør verify_hillock.py først. Den 21-punkts verifikasjonssuiten trenger ingen GPU og sjekker kjernematematikken før du drar opp CUDA-stakken.
- Sjekk lisensen mot planene dine. Hillock er AGPL-3.0, og bidrag krever signert CLA fordi utvikleren holder døren åpen for kommersiell dual-lisensiering.
- Test mot dine egne dokumenter. 13,8 prosent presisjon på ett akademisk testsett sier lite om hvordan triplene ser ut i din domenetekst, og /inspect viser hver lagret trippel per entitet.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.