Til forsiden
#kvantisering
55 saker med denne taggen
I dag · onsdag 9. september
08:15
08:15 Kvantisering · 2 min · TechPowerUp
LattePanda Mu Ultra kjører Qwen3.5-9B lokalt på 18 tokens i sekundet
Onsdag 2. september
08:22
08:22 Guider · 3 min · Kevin Lewis (blogg)
Kevin Lewis kjører hele KI-stacken sin lokalt på en M4 Pro Mac mini
Tirsdag 1. september
20:23
20:23 Kvantisering · 3 min · day50.dev
29 787 åpne Ollama-servere, og hundrevis av dem kjører ingen modell
Torsdag 27. august
12:20
12:20 Kvantisering · 2 min · Quesma Blog
Qwen3.8 27B i 4 bit matcher fullmodellen: 17 gigabyte mot 55
05:06
05:06 Kvantisering · 2 min · Simon Willison's Weblog
Simon Willison kjører Qwen3.8-Flash-Next lokalt på 72,5 gigabyte
Tirsdag 25. august
16:28
16:28 Kvantisering · 2 min · Hugging Face - Blog
Multiverse-modell i 4 bit slår sin egen 16-bits kilde på 7 av 9 tester
Søndag 23. august
00:27
00:27 Kvantisering · 2 min · Level1Techs Forum
Nvidias FP4-kvant flippet halvparten av tokenene ved 88k kontekst
Lørdag 22. august
00:45
00:45 Fine-tuning · 2 min · Patronus AI
Entropi-bonusen frøs 4-bits GLM-5.2 under RL-trening
Torsdag 20. august
00:58
00:58 Kvantisering · 2 min · Unsloth
Unsloth Dynamic 3.0 presser Qwen3.8-27B ned i 6,2 GB
Onsdag 19. august
20:17
20:17 Kvantisering · 3 min · Ornith AI
Ornith-1.5: åpne vekt-modeller med selvforbedringsløkke, matcher Claude Opus 4.8 på Terminal-Bench
16:27
16:27 Hugging-face · 2 min · Hugging Face - Blog
Liquid AI trener 4-bit inn i modellen og beholder 97 prosent av BF16
Søndag 16. august
12:17
12:17 Kvantisering · 2 min · XDA Developers
To DGX Spark-maskiner matcher nå skyen på DeepSeek V4 Flash
Torsdag 13. august
04:53
04:53 Kvantisering · 3 min · Hugging Face
Ling-3.0-tiny aktiverer 1,3 av 7,9 milliarder parametere og kjører på 8,3 GiB
Tirsdag 11. august
05:20
05:20 Kvantisering · 3 min · Hacker News - Newest: ""AI" "LLM" "Claude""
Needle 2 pakker verktøykall i 14 MB og kjører på en ESP32
04:28
04:28 Kvantisering · 2 min · Simon Willison's Weblog
Simon Willison kjørte Muse Glimmer lokalt på 18,16 GB
Fredag 7. august
21:53
21:53 Kvantisering · 2 min · GitHub
NanoMind-S3: 15,2 millioner parametere kjører på en ESP32-S3
21:47
21:47 Kvantisering · 2 min · Unsloth
Unsloth v0.1.525-beta: Kimi K3 lokalt krever 595 GB på disk
Onsdag 5. august
20:21
20:21 Kvantisering · 3 min · The Register
9,88 tokens i sekundet på en mikrokontroller til 10 dollar
16:18
16:18 Kvantisering · 3 min · GitHub (slvDev/esp32-ai)
28,9 millioner parametere kjører på en ESP32 med 512 KB SRAM
Tirsdag 4. august
04:25
04:25 Kvantisering · Lenke · Latent.Space
Baseten: kvantisering gjorde GLM-5.2 20 prosent raskere uten kvalitetstap
Mandag 3. august
12:42
12:42 Kvantisering · 2 min · Level1Techs Forum
ROCm 7.14 halverte farten på én modell, men ikke på den ved siden av
Fredag 31. juli
12:20
12:20 Kvantisering · 2 min · AI Insiders
Escha-W2 kjører en 35B MoE-modell i 2 bit på ett 24 GB-kort
00:28
00:28 Kvantisering · 3 min · GitHub (Show HN)
runNburn kjører en 222 GiB modell på en Mac med 64 GiB minne
00:22
00:22 Kvantisering · 3 min · CNX Software
NightRun booter Raspberry Pi 5 rett inn i en språkmodell, uten operativsystem
Torsdag 30. juli
16:23
16:23 Fine-tuning · 2 min · Unsloth (GitHub)
Unsloth kjører Kimi K3 lokalt, men minste kvantisering krever 595 GB disk
12:22
12:22 Kvantisering · 2 min · RuntimeWire
VisionPsy-Nano kjører bildeforståelse på mobilen: 460 millioner parametere, Apache 2.0
Onsdag 29. juli
00:25
00:25 Kvantisering · Lenke · LavX News
Neutrino-8B presser en 8B-modell ned i 3,88 GB med ternære vekter
Tirsdag 28. juli
20:26
20:26 Kvantisering · 3 min · How-To Geek
Gemma 4 E2B svarer på ett sekund der Qwen 3.5 4B bruker fem i Home Assistant
Mandag 27. juli
00:18
00:18 Kvantisering · 3 min · Awesome Agents
POCKET-35B kjører uten grafikkort, men 88,4 prosent på GPQA blir 73,2 ved ett forsøk
Søndag 26. juli
04:28
04:28 Kvantisering · 3 min · Hacker News - Newest: ""AI" "LLM" "Claude""
28,9 millioner parametere kjører nå på en ESP32 til 8 dollar
Lørdag 25. juli
04:23
04:23 Kvantisering · Lenke · Tech Times
Kimi K3 slipper åpne vekter 27. juli, men nedlastingen er på 1,4 terabyte
Fredag 24. juli
04:28
04:28 Kvantisering · 2 min · Hacker News
quantprobe kjører 110B-modell på 16 GB RAM, men bare 0,19 tokens i sekundet
Torsdag 23. juli
12:28
12:28 Hugging-face · 2 min · Hugging Face - Blog
Nunchaku Lite gir 4-bits diffusjon direkte i Diffusers
Onsdag 22. juli
04:17
04:17 Kvantisering · Lenke · Show HN
Nettside viser hvilken KI-modell laptopen din kan kjøre lokalt
Mandag 20. juli
12:36
12:36 Kvantisering · 2 min · Hi-Tech.ua
Bonsai 27B kjører 27 milliarder vekter på iPhone i 3,9 GB
Søndag 19. juli
13:01
13:01 Kvantisering · 2 min · Tech Times
PrismML klemmer en 27 milliarder-parameter KI-modell ned til under 4 GB for iPhone
Fredag 17. juli
04:27
04:27 Kvantisering · 2 min · WinBuzzer
Apple vurderer PrismMLs komprimeringsteknologi for større KI-modeller på iPhone
Onsdag 15. juli
16:28
16:28 Kvantisering · Lenke · DEV Community
KronQ får 2-bit-modeller til å virke der GPTQ kollapser
04:46
04:46 Kvantisering · 2 min · MarkTechPost
PrismML Bonsai 27B: 1-bit og ternære versjoner av Qwen3.6-27B kjører på laptop og telefon
Tirsdag 14. juli
16:24
16:24 Kvantisering · 2 min · Baseten
StepFun slipper Step 3.7 Flash: 198 milliarder parametre på fire H100-kort
04:19
04:19 Kvantisering · 2 min · Creative AI News
Kjør Qwen3.6 2,5x raskere lokalt med Unsloth NVFP4
Søndag 12. juli
04:21
04:21 Kvantisering · 2 min · DEV Community
Unsloths NVFP4-quants kjører Qwen3.6 2,5x raskere, men bare på Blackwell
Fredag 10. juli
08:36
08:36 Kvantisering · 4 min · GitHub
Colibri kjører GLM 5.2 på 25 GB RAM ved å streame eksperter fra disk
Torsdag 2. juli
08:20
08:20 Forskning · Lenke · AIJourn
STAR-KV komprimerer KV-cache opptil 20x, valgt som ICML 2026-spotlight-artikkel
Onsdag 1. juli
20:22
20:22 Forskning · 2 min · The Register
SEMQ-metoden kutter minnebruk for KI-modeller uten å tape nøyaktighet
Søndag 7. juni
10:10
10:10 Google · 2 min · Google Blog
Gemma 4 får QAT-kvantisering: E2B-modellen krymper til 1 GB minne
Onsdag 13. mai
10:34
10:34 Kvantisering · 3 min · Hugging Face
Lokale åpne modeller dobler intelligens hver 10. måned: 4,7x på to år, uendret laptop
Mandag 11. mai
22:18
22:18 Kvantisering · 3 min · jola.dev
Lokale modeller på M4 med 24 GB minne: hva som faktisk er brukbart
Onsdag 6. mai
22:32
22:32 Kvantisering · 2 min · GitHub: localai-org/vibevoice.cpp
vibevoice.cpp: Microsofts VibeVoice kjører nå lokalt på llama.cpp-stacken via ggml
02:15
02:15 Kvantisering · 2 min · DEV Community
Qwen3.6-35B kjører på Mac med 48 GB RAM på 77 tokens/sekund — komplett MLX-oppskrift
Fredag 1. mai
18:18
18:18 Kvantisering · 2 min · github.com/intel
Intel auto-round v0.12.3: kvantiserer LLM til 2–4 bit på CPU og GPU med vLLM- og SGLang-støtte
14:16
14:16 Google · 1 min · AI Pressa
Google TurboQuant: KV-cache-kompresjon kutter minnebruk 6x uten retrening
Tirsdag 21. april
06:15
06:15 Kvantisering · 2 min · PrismML
Ternary Bonsai kjører 8B-modell på 1,58 bits — 82 tokens/sek på M4 Pro uten GPU
Søndag 19. april
22:10
22:10 Google · 2 min · Hacker News / Show HN
Gemma 4 kjører i Chrome med WebGPU: prompt-til-Excalidraw i nettleseren, 3 GB RAM
Torsdag 2. april
12:50
12:50 Forskning · Lenke · LocalLlama