Til forsiden
#lokale-modeller
378 saker med denne taggen
I dag · fredag 4. september
20:30
20:30 Lokale-modeller · 2 min · Hugging Face
LLaDA-Image: 6B-modell som lager og redigerer bilder i fire steg
20:23
20:23 Hugging-face · 2 min · X (Georgi Gerganov)
Gerganov: llama.cpp forblir hardware-agnostisk etter Nvidia-kjøpet
12:19
12:19 Lokale-modeller · Lenke · AI | The Verge
Ugreen HomeAgent kjører smarthjem-KI lokalt, toppmodellen på Jetson Thor
I går · torsdag 3. september
21:02
21:02 Lokale-modeller · 3 min · AI | The Verge
Nvidia PAIR sprer lokal inferens over PC-ene du allerede har
20:58
20:58 Google · Lenke · Release notes from ollama
Ollama 0.33.3 gir gemma4 bilde- og lydstøtte på MLX
20:31
20:31 Lokale-modeller · 3 min · Perplexity (X)
Perplexity åpner Lily: egenbygd inferensmotor slår MLX på Mac
20:25
20:25 Llm · 3 min · Institute of Foundation Models
IFM åpner hele treningsløpet for K2 Horizon, fra 0,9B til 375B
04:31
04:31 Lokale-modeller · Lenke · Release notes from ollama
Ollama 0.33.3-rc2 rapporterer cachede prompt-tokens og leser GGUF-standardparametere
Onsdag 2. september
12:23
12:23 Lokale-modeller · 3 min · GitHub (antirez/ds4)
ds4 får synsstøtte: DeepSeek V4 Flash leser bilder lokalt på Metal, CUDA og ROCm
08:25
08:25 Lokale-modeller · 3 min · GitHub
slotstream lar en 48 GB-Mac kjøre en 104 GB-modell via SSD-streaming
08:22
08:22 Guider · 3 min · Kevin Lewis (blogg)
Kevin Lewis kjører hele KI-stacken sin lokalt på en M4 Pro Mac mini
08:20
08:20 Lokale-modeller · Lenke · PR Newswire (GEEKOM)
GEEKOM kobler fire Mini-PC-er sammen til en lokal DeepSeek-klynge over USB4
00:31
00:31 Lokale-modeller · 2 min · Engadget
Perplexity deler oppgaven mellom en lokal modell og skyen
00:25
00:25 Lokale-modeller · 2 min · Ollama
Ollama gir 60 dollar i bruk for 20 dollar i måneden
Tirsdag 1. september
20:43
20:43 Hugging-face · 3 min · Hugging Face - Blog
207 WebGPU-kjerner fra Hugging Face gjør nettleser-inferens 2,57 ganger raskere
20:23
20:23 Kvantisering · 3 min · day50.dev
29 787 åpne Ollama-servere, og hundrevis av dem kjører ingen modell
16:18
16:18 Lokale-modeller · 2 min · SparkLLM
Spark X2.5-4B og 1.7B kjører én million tokens kontekst på enheten
Mandag 31. august
16:41
16:41 Llm · 3 min · Hugging Face
DeepSeek gir V4-Flash syn: 36,5 mot 26,2 på ApexBench
16:27
16:27 Lokale-modeller · Lenke · The Decoder
KI-labene kjøper Mac mini i titusenvis for å trene datamaskinbruk
08:16
08:16 Lokale-modeller · 2 min · underfoot
Underfoot måler hvordan Apples modell på enheten drifter mellom OS-bygg
04:35
04:35 Lokale-modeller · 2 min · GitHub (AniketWathore/bolnee-chat)
Bolnee-Chat gir deg en RAG-chatbot på SQLite uten ekstern database
00:26
00:26 Lokale-modeller · 2 min · GitHub
Simurg kutter strømmen når modellen kollapser midt i svaret
00:22
00:22 Lokale-modeller · 2 min · GitHub
Hillock kjører lokalt agent-minne uten vektordatabase
Søndag 30. august
00:19
00:19 Lokale-modeller · 2 min · vLLM
vLLM 0.28 dobler token-budsjettet, bitsandbytes blir plugin
Lørdag 29. august
16:26
16:26 Lokale-modeller · 2 min · GitHub
StemDeck deler låten i seks spor lokalt, uten konto eller opplasting
08:38
08:38 Lokale-modeller · 3 min · Pangolin
Pangolin 1.22 gjør tunnelklienten til API-nøkkelen mot Ollama og skyen
Fredag 28. august
20:28
20:28 Lokale-modeller · 3 min · Hugging Face
Z.ai slipper GLM-5.3-vektene etter to uker med sikkerhetstesting
16:24
16:24 Lokale-modeller · 2 min · GitHub
FnScribe transkriberer talen din lokalt med Whisper, uten sky
00:31
00:31 Claude · 2 min · Release notes from ollama
Ollama fjerner katalogfeilen som stoppet Claude Desktop-kall
Torsdag 27. august
12:24
12:24 Lokale-modeller · 2 min · The Hacker News
GPUThor slår gjennom ECC på fire NVIDIA-kort og gir root på verten
12:20
12:20 Kvantisering · 2 min · Quesma Blog
Qwen3.8 27B i 4 bit matcher fullmodellen: 17 gigabyte mot 55
05:06
05:06 Kvantisering · 2 min · Simon Willison's Weblog
Simon Willison kjører Qwen3.8-Flash-Next lokalt på 72,5 gigabyte
00:58
00:58 Alibaba · 2 min · The Decoder
Qwen3.8-Flash-Next aktiverer 6 av 125 milliarder parametere per token
00:35
00:35 Llm · Lenke · GitHub
ModelMRI viser hvilket attention-hode som faktisk avgjorde svaret
Onsdag 26. august
21:04
21:04 Lokale-modeller · Lenke · Release notes from ollama
Ollamas MLX-runner får støtte for Qwen3.8-Flash-Next
16:26
16:26 Lokale-modeller · 3 min · Hugging Face (zai-org)
Z.ai slipper GLM-5.3-Flash under MIT med 18 aktive av 320 milliarder parametere
04:26
04:26 Lokale-modeller · 2 min · Perplexity
Perplexity Portable Computer kjører agenten lokalt på Qwen 3.8 27B
00:27
00:27 Lokale-modeller · 3 min · Hugging Face - Blog
IBMs Granite 4.2 30B når 57 på SWE-bench Verified under Apache 2.0
00:23
00:23 Lokale-modeller · 3 min · GitHub
Raspberry Pi 5 kjører Qwen3.6-35B i bilen uten internett
Tirsdag 25. august
21:01
21:01 Lokale-modeller · 3 min · The Hacker News
Ondsinnet nettside kan forgifte chat-malen i lokal Ollama via NemoClaw
08:43
08:43 Claude-code · 2 min · Release notes from ollama
Ollama slår av Claude Codes token-nedtelling fordi den brøt KV-cachen hver gang
04:43
04:43 Koding · 2 min · JetBrains
JetBrains kjører Junie lokalt på Qwen 3.6, ikke på den nyere 3.8
00:29
00:29 Lokale-modeller · 2 min · pantel.is
KI-følgesvennen i Skyrim svarer lokalt på under 500 millisekunder
Mandag 24. august
20:37
20:37 Lokale-modeller · 2 min · Gizmochina
Xiaomi viser fram AI Cube: kjører 120 milliarder parametere lokalt
00:24
00:24 Fine-tuning · 3 min · Hugging Face (community fine-tune, via r/LocalLLaMA)
Finjustert Gemma 4 12B treffer sju av ti verktøykall
Søndag 23. august
16:20
16:20 Lokale-modeller · 3 min · XDA Developers
Qwen 3.8 27B knekte en lisenssjekk lokalt på 30 minutter
00:27
00:27 Kvantisering · 2 min · Level1Techs Forum
Nvidias FP4-kvant flippet halvparten av tokenene ved 88k kontekst
Lørdag 22. august
20:41
20:41 Lokale-modeller · 2 min · ImageSage
ImageSage søker i bildene dine med lokal KI og gir dem nye filnavn
04:29
04:29 Claude · 2 min · Release notes from ollama
Ollama 0.33-rc1 kobler Claude Desktop til lokale modeller
Fredag 21. august
16:34
16:34 Lokale-modeller · 3 min · Liquid AI
LFM2.5-2.6B går fra 61 til 139 tokens i sekundet på MacBook
16:31
16:31 Google · Lenke · Google Blog
Gemma passerer én milliard nedlastinger og 100 000 varianter
Torsdag 20. august
20:21
20:21 Lokale-modeller · 3 min · Unsloth (GitHub Releases)
Unsloth Desktop 0.1.801 ruller chatten forbi kontekstgrensen
00:58
00:58 Kvantisering · 2 min · Unsloth
Unsloth Dynamic 3.0 presser Qwen3.8-27B ned i 6,2 GB
Onsdag 19. august
20:48
20:48 Lokale-modeller · 3 min · Release notes from ollama
Ollama cacher modellmetadata, halverer tid til første token
20:47
20:47 Lokale-modeller · 3 min · PantheonGPU (Show HN)
PantheonGPU stresstester GPU-en, men KI-lastene er syntetiske
20:17
20:17 Kvantisering · 3 min · Ornith AI
Ornith-1.5: åpne vekt-modeller med selvforbedringsløkke, matcher Claude Opus 4.8 på Terminal-Bench
16:27
16:27 Hugging-face · 2 min · Hugging Face - Blog
Liquid AI trener 4-bit inn i modellen og beholder 97 prosent av BF16
16:23
16:23 Hugging-face · Lenke · ModelMap
ModelMap tegner modellarkitekturen uten å laste ned vektene
12:17
12:17 Lokale-modeller · 2 min · Tom's Hardware
DDR5-minne opp 500 prosent på tolv måneder, 128 GB koster 3 399 dollar
04:27
04:27 Lokale-modeller · 2 min · Inco AI
DFlash 2 gir 21 prosent flere tokens per verifiseringsrunde
04:24
04:24 Lokale-modeller · 3 min · Hugging Face
Tencent la ut UI-Mate-27B på Hugging Face helt uten kunngjøring
00:20
00:20 Lokale-modeller · 3 min · ChatOSS
ChatOSS gir Ollama-modellene dine en Kanban-tavle og agenter som skriver i repoet
Tirsdag 18. august
04:20
04:20 Lokale-modeller · Lenke · Simon Willison's Weblog
Qwen 3.8 27B scorer 52 på Artificial Analysis-indeksen
Mandag 17. august
04:30
04:30 Alibaba · 3 min · Simon Willison's Weblog
Qwen 3.8 27B brukte 21 minutter på én SVG med standardinnstillingen
00:11
00:11 Lokale-modeller · Lenke · AI News & Artificial Intelligence | TechCrunch
Zuckerberg lover personlig KI til alle, men Glimmer krever egen maskinvare
Søndag 16. august
16:13
16:13 Llm · 2 min · GitHub - studio-dots-ai/dots3-note-prev
Xiaohongshu slipper dots3-note under Apache 2.0: 280 milliarder parametere, 16 aktive
12:17
12:17 Kvantisering · 2 min · XDA Developers
To DGX Spark-maskiner matcher nå skyen på DeepSeek V4 Flash
08:20
08:20 Lokale-modeller · 2 min · Simon Willison's Weblog
Simon Willison bygde CORS Chat på én dag for å teste Qwen 3.8 27B lokalt
00:15
00:15 Lokale-modeller · 3 min · GitHub (Cactus Compute)
Needle 2 pakker verktøykalling i 14 MB og kjører på 28 MB RAM
Lørdag 15. august
16:51
16:51 Alibaba · 3 min · The Decoder
Qwen3.8-27B er Apache 2.0, Max-vektene har egen lisens
12:59
12:59 Lokale-modeller · 2 min · The Register
Toronto-forskere bygget selvspredende orm med en åpen 2025-modell
12:56
12:56 Hugging-face · 2 min · Tech Times
Dansk Mimir v1 konkurrerer med 4B-modeller på kun tillatt treningsdata
12:27
12:27 Llm · 3 min · GitHub (chenxiachan/thoughtdag)
ThoughtDAG gjør LLM-samtalen til en graf der ledningene er konteksten
00:39
00:39 Koding · Lenke · Release notes from ollama
Ollama 0.32.13 lar kodeagenter sende developer-instruksjoner til Qwen3.8
00:28
00:28 Lokale-modeller · 3 min · Hacker News
HashAgent legger hele agenten i URL-fragmentet og kjører modellen i nettleseren
Fredag 14. august
21:07
21:07 Koding · 3 min · Release notes from ollama
Ollama 0.32.12 kjører Qwen3.8 27B, og MLX-varianten er bygget for Apple Silicon
08:22
08:22 Hugging-face · 3 min · Tech Times
Koreas Motif 3 bytter til MIT-lisens og åpner 314 milliarder parametere
05:04
05:04 Lokale-modeller · 3 min · Hacker News - Newest: ""AI" "LLM" "Claude""
Fire V620-kort fra e-avfall kjører DeepSeek V4 Flash i garasjen
04:58
04:58 Lokale-modeller · 3 min · AMD
AMD GAIA 0.23 stenger MCP-broen mot nettverket og flytter agentene til terminalen
00:28
00:28 Google · 2 min · GitHub
Gemma Translator kjører taleoversettelse helt offline på en Raspberry Pi 5
Torsdag 13. august
05:06
05:06 Lokale-modeller · Lenke · Simon Willison's Weblog
MiniMax-H3 kjører på Apple Silicon: 115 GB modellfiler og 45 minutter per klipp
04:53
04:53 Kvantisering · 3 min · Hugging Face
Ling-3.0-tiny aktiverer 1,3 av 7,9 milliarder parametere og kjører på 8,3 GiB
00:28
00:28 Lokale-modeller · Lenke · Release notes from ollama
Ollama 0.32.10-rc0 gir 7,9 prosent raskere prefill på ModelOpt-vekter
Onsdag 12. august
20:47
20:47 Llm · 2 min · The Decoder
Nvidias Nemotron 4 sikter mot tusen milliarder parametere, Kimi K3 har 2 800
20:34
20:34 Hugging-face · 2 min · Hugging Face - Blog
LFM2.5-VL-3B kjører på 3 GB minne og leser skjermbilder
16:21
16:21 Fine-tuning · 3 min · Unsloth (GitHub Releases)
Unsloth Desktop trener modeller lokalt uten kode
14:27
14:27 Lokale-modeller · 3 min · Hardware Busters
FastFlowLM 1.0 inn i ROCm: en 17 MB kjøretid for Ryzen-NPU-en
08:29
08:29 Claude · 3 min · Towards Data Science
Lokal 122B tok over hjemmeagenten Jarvis, 787 ganger billigere enn Claude
04:34
04:34 Lokale-modeller · 3 min · VentureBeat
LTX-2.5 gir åpne vekter fra 16 GB VRAM, og lisensen smitter på det du trener
Tirsdag 11. august
20:51
20:51 Lokale-modeller · 3 min · Hacker News - Newest: ""AI" "LLM" "Claude""
Metal-shim i macOS-VM ga 11 til 16 ganger raskere llama.cpp
20:17
20:17 Hugging-face · 2 min · Nasjonalbiblioteket (NTB pressemelding)
Nasjonalbiblioteket grunntrener Borealis på avistekst: vektene kommer i uke 34
16:22
16:22 Lokale-modeller · 2 min · Release notes from ollama
Ollama 0.32.9 kjører Nemotron 3.5 Lightning med 3B aktive av 30B
12:24
12:24 Hugging-face · 2 min · webAI (PR Newswire)
webAI slipper TwiL-LM: 3B slår gpt-oss-120b på egen logikktest
05:20
05:20 Kvantisering · 3 min · Hacker News - Newest: ""AI" "LLM" "Claude""
Needle 2 pakker verktøykall i 14 MB og kjører på en ESP32
04:28
04:28 Kvantisering · 2 min · Simon Willison's Weblog
Simon Willison kjørte Muse Glimmer lokalt på 18,16 GB
04:26
04:26 Lokale-modeller · 2 min · Hugging Face
VoiceChat 11B erstatter tre modeller med én, men lisensen stopper på forskning
Mandag 10. august
20:25
20:25 Lokale-modeller · 2 min · The Hacker News
Genians: Kimsuky bygger egen offline KI-stack med Ollama og GPT4All
16:26
16:26 Lokale-modeller · 3 min · Hugging Face - Blog
Muse Glimmer: Metas 30B slår Gemma 4 på agenttester, men taper mot Qwen på terminalen
12:51
12:51 Llm · 2 min · MIT Technology Review
Fire veier rundt transformerens flaskehals, og to har vekter du kan laste ned
Søndag 9. august
16:44
16:44 Deepmind · 3 min · The Decoder
Gemma 4 ble diffusjonsmodell for under ti prosent av treningen
Lørdag 8. august
20:26
20:26 Deepmind · 2 min · Google DeepMind
DeepMind åpner WeatherNext: vekter, kode og en minimodell som kjører i gratis Colab
16:43
16:43 Llm · 2 min · Hacker News - Newest: ""AI" "LLM" "Claude""
CPU-en er tilbake: 50–90 % av agent-latensen skjer utenfor GPU-en
00:59
00:59 Llm · 3 min · Hacker News - Newest: ""AI" "LLM" "Claude""
vLLM innenfra: slik gjør paged attention GPU-minnet til blokker på 16 tokens
00:32
00:32 Lokale-modeller · 2 min · AppSelfHost
LocalAI v4.8.1 retter fem feil og gjør vLLM-backenden lastbar igjen
00:28
00:28 Lokale-modeller · 3 min · XDA Developers
Gemma-4-E2B på en NAS: 10,5 tokens i sekundet på 8 GB RAM
Fredag 7. august
21:53
21:53 Kvantisering · 2 min · GitHub
NanoMind-S3: 15,2 millioner parametere kjører på en ESP32-S3
21:47
21:47 Kvantisering · 2 min · Unsloth
Unsloth v0.1.525-beta: Kimi K3 lokalt krever 595 GB på disk
Torsdag 6. august
04:26
04:26 Lokale-modeller · 2 min · GitHub (ggml-org/llama.cpp)
llama.cpp kjører nå Qwen3-TTS lokalt: stemme kopieres fra én lydfil
Onsdag 5. august
20:29
20:29 Lokale-modeller · 3 min · The Decoder
Mistrals Shieldstral på 3B matcher en sikkerhetsmodell sju ganger så stor
20:21
20:21 Kvantisering · 3 min · The Register
9,88 tokens i sekundet på en mikrokontroller til 10 dollar
20:17
20:17 Lokale-modeller · 3 min · Open WebUI Blog
Fra homelab til 180 000 statsansatte: samme selvhostede KI-stack
16:21
16:21 Lokale-modeller · Lenke · AI News & Artificial Intelligence | TechCrunch
MacPaw henter Liquid AI for lokal inferens i SetApp
16:18
16:18 Kvantisering · 3 min · GitHub (slvDev/esp32-ai)
28,9 millioner parametere kjører på en ESP32 med 512 KB SRAM
08:16
08:16 Lokale-modeller · 2 min · Unite.AI
Mistral slipper Shieldstral: 3B-moderasjonsmodell som leser reglene som tekst
Tirsdag 4. august
20:18
20:18 Lokale-modeller · Lenke · Release notes from ollama
Ollama v0.32.6-rc0: Qwen3.5 får spekulativt MTP-hode, MLX-bildegenerering ut
20:16
20:16 Lokale-modeller · 2 min · ownCloud Blog
ownCloud-utvidelse lar LLM-en din redigere filer direkte i oCIS
16:15
16:15 Hugging-face · 3 min · Hugging Face - Blog
Liquid AI slipper LFM2.5-2.6B: lokal agent på 220 tokens i sekundet
04:17
04:17 Lokale-modeller · 2 min · MiniMax News
MiniMax åpner H3: 33 milliarder parametere, 15 sekunder video med stereolyd
00:37
00:37 Lokale-modeller · 3 min · Pasquale Pillitteri
Kimi K3 kjørt på én CPU med 8 GB RAM: 2,78 billioner parametere fra disk
Mandag 3. august
20:43
20:43 Lokale-modeller · 2 min · Hacker News - Newest: ""AI" "LLM" "Claude""
Nightcrawler kjører pentest-agenten på en mobil uten nettforbindelse
20:28
20:28 Lokale-modeller · 3 min · DEV Community
AirLLM kjører Kimi K3 sine 2,8 billioner parametere på 3,72 GB VRAM
12:58
12:58 Hugging-face · 3 min · The Hacker News
FaceHugger: tre CVE-er i Diffusers omgår trust_remote_code
12:50
12:50 Alibaba · 2 min · PR Newswire
ABot-World-0 skal holde 24 timer interaktiv inferens på ett forbruker-GPU
12:42
12:42 Kvantisering · 2 min · Level1Techs Forum
ROCm 7.14 halverte farten på én modell, men ikke på den ved siden av
08:18
08:18 Hugging-face · 2 min · Particle News
MiniMax slipper H3-vektene: 33 milliarder parametere, to moduler holdt tilbake
04:21
04:21 Google · 3 min · XDA Developers
Gemma 4 E2B gir 6 tokens i sekundet på Raspberry Pi 5. Agentjobben krevde E4B
00:19
00:19 Lokale-modeller · 2 min · TechRadar Pro
Acrab lover 100 milliarder parametere lokalt. Målingen er kjørt på Gemma 26B
Søndag 2. august
20:29
20:29 Lokale-modeller · 2 min · XDA Developers
Lemonade 11s personvernfilter feiler åpent mot skyen
16:20
16:20 Llm · 3 min · Rest of World
Kimi K3 rangeres som verdens tredje beste modell, og vektene er gratis
08:33
08:33 Lokale-modeller · 2 min · XDA Developers
Sju lokale modeller testet på en NAS: bare én holdt til Home Assistant
00:39
00:39 Lokale-modeller · 2 min · MarkTechPost
AMD åpner hvert treningssteg i Instella-MoE, men bare for forskning
Lørdag 1. august
12:32
12:32 Lokale-modeller · 2 min · GitHub
Åpen kjøremotor strømmer Kimi K3 sine 2,8 billioner parametere fra NVMe
12:27
12:27 Hugging-face · 3 min · Liquid AI
Liquid AI slipper enkodere som slår ModernBERT 3,7 ganger på CPU
08:54
08:54 Hugging-face · 2 min · VentureBeat
Cisco sporer opphavet til nesten 900 åpne KI-modeller
00:28
00:28 Lokale-modeller · 2 min · GitHub / Show HN
exxperts gir lokale KI-agenter et minne du må godkjenne
Fredag 31. juli
20:24
20:24 Guider · 2 min · LeadPrompt
Mem0-proxy gir den lokale modellen din varig hukommelse på Fedora
12:20
12:20 Kvantisering · 2 min · AI Insiders
Escha-W2 kjører en 35B MoE-modell i 2 bit på ett 24 GB-kort
00:28
00:28 Kvantisering · 3 min · GitHub (Show HN)
runNburn kjører en 222 GiB modell på en Mac med 64 GiB minne
00:22
00:22 Kvantisering · 3 min · CNX Software
NightRun booter Raspberry Pi 5 rett inn i en språkmodell, uten operativsystem
Torsdag 30. juli
16:23
16:23 Fine-tuning · 2 min · Unsloth (GitHub)
Unsloth kjører Kimi K3 lokalt, men minste kvantisering krever 595 GB disk
16:22
16:22 Lokale-modeller · 3 min · GitHub (Show HN)
mere.run kjører tekst, bilde, video og musikk lokalt fra én CLI
12:42
12:42 Lokale-modeller · 2 min · Nixmac
nixmac gjør Mac-oppsettet til Nix-kode du kan rulle tilbake med ett klikk
12:22
12:22 Kvantisering · 2 min · RuntimeWire
VisionPsy-Nano kjører bildeforståelse på mobilen: 460 millioner parametere, Apache 2.0
04:23
04:23 Lokale-modeller · 2 min · GitHub (llama.cpp)
llama.cpp får NextN-dekoding for GLM-5.2: 37 prosent raskere generering
01:09
01:09 Google · 3 min · GitHub (TurboFieldfare)
TurboFieldfare kjører Gemma 4 26B i 2 GB RAM på 8 GB MacBook Air
01:05
01:05 Lokale-modeller · 3 min · aistack (imec)
Selvhosting slår frontier-API-ene på pris, men bare hvis GPU-ene faktisk brukes
Onsdag 29. juli
00:25
00:25 Kvantisering · Lenke · LavX News
Neutrino-8B presser en 8B-modell ned i 3,88 GB med ternære vekter
00:21
00:21 Lokale-modeller · Lenke · GitHub
Minute tar møtenotater på Mac uten å røre nettverket
Tirsdag 28. juli
20:41
20:41 Hugging-face · 2 min · Hugging Face - Blog
Liquid AIs encoder leser en hel kontrakt på 28 sekunder på CPU
20:29
20:29 Lokale-modeller · Lenke · 9to5Mac
LM Studio Bionic tar 15 dollar per million output-tokens for Kimi K3, mot 4,50 for resten
20:26
20:26 Kvantisering · 3 min · How-To Geek
Gemma 4 E2B svarer på ett sekund der Qwen 3.5 4B bruker fem i Home Assistant
12:21
12:21 Llm · Lenke · Seoul Economic Daily
Kakao åpner Kanana-2 med sliding window attention og 72,7 prosent lavere minnebruk
Mandag 27. juli
08:14
08:14 Lokale-modeller · 2 min · GitHub
HART OS kjører lokale agenter på 8 GB RAM, men læringskoden ligger i et privat repo
04:32
04:32 Lokale-modeller · Lenke · Release notes from ollama
Ollama 0.32.5-rc0 har én eneste endring: MLX-motoren er oppdatert
04:25
04:25 Lokale-modeller · 2 min · Hacker News
wmo lover frontier-kvalitet til 40 prosent lavere pris, Hacker News etterlyser bevis
00:18
00:18 Kvantisering · 3 min · Awesome Agents
POCKET-35B kjører uten grafikkort, men 88,4 prosent på GPQA blir 73,2 ved ett forsøk
Søndag 26. juli
04:28
04:28 Kvantisering · 3 min · Hacker News - Newest: ""AI" "LLM" "Claude""
28,9 millioner parametere kjører nå på en ESP32 til 8 dollar
Lørdag 25. juli
20:17
20:17 Hugging-face · 2 min · Hacker News - Newest: ""AI" "LLM" "Claude""
Åpne vekter har sitt Kubernetes-øyeblikk: Mesosphere-grunnleggeren advarer mot forbud
12:47
12:47 Lokale-modeller · 2 min · Hugging Face / inclusionAI
LLaDA2.2-flash genererer 519 tokens i sekundet, men taper på SWE-bench
Fredag 24. juli
20:39
20:39 Fine-tuning · Lenke · GitHub - unslothai/unsloth
Unsloth trener nå modeller på AMD-GPU: 2× raskere med 70 % mindre VRAM
20:32
20:32 Lokale-modeller · 3 min · AI News & Artificial Intelligence | TechCrunch
Nvidia og Meta signerte brevet for åpne vekter, OpenAI og Anthropic ikke
20:23
20:23 Lokale-modeller · Lenke · GitHub - ollama/ollama
Ollama 0.32.3 fikser nedlastinger som stopper før første byte
16:23
16:23 Lokale-modeller · 3 min · MarkTechPost
Andrew Ng lanserer OpenWorker: åpen kildekode-agent som leverer ferdig arbeid, ikke prat
12:24
12:24 Koding · 3 min · XDA Developers
ESP32-S3 kjører språkmodell på 28,9 millioner parametere fra flash
08:51
08:51 Hugging-face · 2 min · CSCS
Apertus 1.5 fra ETH og EPFL: åpen sveitsisk modell forstår nå bilde og lyd
04:28
04:28 Kvantisering · 2 min · Hacker News
quantprobe kjører 110B-modell på 16 GB RAM, men bare 0,19 tokens i sekundet
Torsdag 23. juli
20:44
20:44 Lokale-modeller · Lenke · Release notes from ollama
Ollama 0.32.3 fikser GLM-verktøykall og stalling i modellnedlasting
20:19
20:19 Lokale-modeller · Lenke · Framework
Framework lanserer 192 GB-variant av Framework Desktop med AMD Ryzen AI Max+ Pro 495
16:28
16:28 Hugging-face Viktig · 3 min · Vectra AI
Autonom KI-agent kompromitterte Hugging Face: forsvarerne måtte bytte til lokal modell
04:26
04:26 Google · 2 min · GitHub (Show HN)
Cactus Hybrid gir Gemma 4 en innebygd tillitsscore som fanger egne feil
00:20
00:20 Koding · 2 min · Poolside
Poolside Laguna S 2.1: åpen kodemodell med 8B aktive parametere slår større rivaler
Onsdag 22. juli
20:59
20:59 Koding · 2 min · The Decoder
Ciscos små åpne sikkerhetsmodeller finner sårbarheter for en brøkdel av GPT-5.5-prisen
16:36
16:36 Lokale-modeller · 2 min · GitHub
Ollama 0.32.2 gir skymodeller ubegrensede verktøyrunder og et skills-system
12:36
12:36 Fine-tuning · 3 min · Unsloth (GitHub)
Unsloth v0.1.50-beta gir AMD-GPUer lokal LLM-trening
12:22
12:22 Hugging-face · 2 min · Hugging Face
Aether-7B-5Attn: fullt åpen koreansk MoE-modell med 162 000 treningslogger
12:19
12:19 Koding · 3 min · MarkTechPost
Poolside slipper Laguna S 2.1: 118B kodemodell med åpne vekter som kjører på én DGX Spark
04:31
04:31 Lokale-modeller · Lenke · Release notes from ollama
Ollama 0.32.2-rc legger til skills-system og agent-modus i CLI-en
04:21
04:21 Llm · Lenke · NVIDIA
NVIDIA Nemotron 3 Embed: åpne embedding-modeller for RAG
04:17
04:17 Kvantisering · Lenke · Show HN
Nettside viser hvilken KI-modell laptopen din kan kjøre lokalt
00:21
00:21 Lokale-modeller · Lenke · Orate
Orate leser markert tekst høyt lokalt på Mac-en, uten sky
Tirsdag 21. juli
21:07
21:07 Lokale-modeller · 2 min · Simon Willison's Weblog
Nativ: åpen MLX-app som kjører lokale modeller på Apple Silicon
20:50
20:50 Lokale-modeller · 2 min · nofire.ai
NOFire-manifest: delt kjerne er ingen ekte sandbox for KI-agenter
12:23
12:23 Lokale-modeller · 3 min · The Hacker News
ENCFORGE-ransomware krypterer KI-modellvekter via Langflow-hull
08:12
08:12 Lokale-modeller · 2 min · GamesBeat
Nvidia lar KI-agenter kjøre lokalt på DGX Station
04:38
04:38 Lokale-modeller · Lenke · BetaKit
Ollama henter 65 millioner dollar til lokal KI
00:40
00:40 Lokale-modeller · 2 min · Release notes from ollama
Ollama-forhåndsversjon gir CLI-agenten et skills-system
Mandag 20. juli
20:09
20:09 Lokale-modeller · Lenke · Imbue
Bouncer skiller KI-tekst fra menneskeskrevet med egen detektormodell på enheten
12:36
12:36 Kvantisering · 2 min · Hi-Tech.ua
Bonsai 27B kjører 27 milliarder vekter på iPhone i 3,9 GB
08:18
08:18 Llm · 3 min · Tech Times
VideoChat3 slår GPT-5 på tidsforankring i video med 4B parametere
04:13
04:13 Lokale-modeller · 3 min · Hacker News
Headroom måler GPU-taket ditt for lokale modeller på 30 sekunder
01:01
01:01 Lokale-modeller · 3 min · The Decoder
Åpne modeller er nå fire til sju måneder bak på cyberangrep
00:49
00:49 Lokale-modeller · 2 min · XDA Developers
Bouncer filtrerer X-feeden din med en modell i nettleseren
Søndag 19. juli
16:41
16:41 Lokale-modeller · 2 min · AI News & Artificial Intelligence | TechCrunch
Current AI bygger åpen, offentlig KI-infrastruktur med 400 mill. dollar
13:01
13:01 Kvantisering · 2 min · Tech Times
PrismML klemmer en 27 milliarder-parameter KI-modell ned til under 4 GB for iPhone
Lørdag 18. juli
20:20
20:20 Lokale-modeller · 2 min · Phoronix
AMD slipper Lemonade 11.0: lokal KI-server med tekst-til-tale
04:35
04:35 Lokale-modeller · Lenke · Awesome Agents
LM Studios Bionic deler kodejobben mellom lokal og sky-KI
04:22
04:22 Lokale-modeller · Lenke · NotebookCheck
Bonsai 27B krymper Qwen3.6 til 3,9 GB og kjører på iPhone uten sky
00:19
00:19 Lokale-modeller · 2 min · MarkTechPost
NVIDIA slipper Nemotron 3 Embed: åpen embedding-modell topper RTEB
Fredag 17. juli
12:35
12:35 Forskning · 2 min · zhinit.dev
Hjemmedatamaskin fra 2019 trente en generativ KI-modell for kick-trommer
12:27
12:27 Lokale-modeller · 2 min · GitHub
AMD ROCm 7.14 bytter til TheRock byggesystem for lokal KI
04:35
04:35 Lokale-modeller · 2 min · LM Studio Blog
LM Studio lanserer Bionic: KI-agent for lokale og åpne modeller
04:27
04:27 Kvantisering · 2 min · WinBuzzer
Apple vurderer PrismMLs komprimeringsteknologi for større KI-modeller på iPhone
Torsdag 16. juli
18:57
18:57 Google · 2 min · explainx.ai
Gemma 4 oppdateres med FlashAttention 4, bedre verktøykall og skarpere OCR
Onsdag 15. juli
16:28
16:28 Kvantisering · Lenke · DEV Community
KronQ får 2-bit-modeller til å virke der GPTQ kollapser
16:26
16:26 Lokale-modeller · Lenke · TECHi
llama.cpp får 4,26x raskere prefill på Intel Arc, men bare i et smalt tilfelle
04:46
04:46 Kvantisering · 2 min · MarkTechPost
PrismML Bonsai 27B: 1-bit og ternære versjoner av Qwen3.6-27B kjører på laptop og telefon
Tirsdag 14. juli
18:46
18:46 Lokale-modeller · 2 min · AI News & Artificial Intelligence | TechCrunch
Hugging Face-sjefen: frontier-modellene blir for eksperimenter, produksjonen kjører på åpne vekter
04:19
04:19 Kvantisering · 2 min · Creative AI News
Kjør Qwen3.6 2,5x raskere lokalt med Unsloth NVFP4
02:44
02:44 Lokale-modeller · 2 min · Release notes from ollama
Ollama 0.32 gjør kommandolinja til en agent, med skymodell som standard
Mandag 13. juli
20:16
20:16 Lokale-modeller · 2 min · The Decoder
Tysk konsortium slipper åpen 30B-modell: Soofi S aktiverer bare 3,2 milliarder parametre per token
16:20
16:20 Lokale-modeller · 2 min · How-To Geek
Selvhostet SearXNG gir lokale KI-modeller websøk uten API-nøkler
11:17
11:17 Lokale-modeller · 2 min · vLLM (GitHub)
vLLM 0.25 sletter PagedAttention og fjerner seks modellfamilier
04:27
04:27 Lokale-modeller · 3 min · XDA Developers
21 Docker-containere uten dokumentasjon: Gemma 4 skrev wikien på en time, men droppet fire tjenester
Søndag 12. juli
20:28
20:28 Lokale-modeller · Lenke · AI | The Verge
M7 Ultra kan få 1,5 TB RAM, arven fra Apples døde bilprosjekt
16:34
16:34 Lokale-modeller · 2 min · How-To Geek
Han fikk Claude til å skrive sin egen erstatning: llama.cpp og en Python-løkke
08:35
08:35 Lokale-modeller · 3 min · Iroh
Mesh LLM deler modellen lag for lag over flere maskiner via iroh og QUIC
08:28
08:28 Lokale-modeller · 3 min · Andryo Marzuki
Utvikler fikset tre cache-bugs og kuttet prefill fra 88 sekunder til 0,64 på Mac Studio
08:24
08:24 Koding · 2 min · byteiota
Zed 1.10 kjører KI-agenten mot lokal llama.cpp, uten at koden forlater maskinen
04:21
04:21 Kvantisering · 2 min · DEV Community
Unsloths NVFP4-quants kjører Qwen3.6 2,5x raskere, men bare på Blackwell
04:20
04:20 Google · 2 min · XDA Developers
Gemma 4 kjører syn, tale og 256K kontekst lokalt på 8 GB VRAM
04:19
04:19 Lokale-modeller · 3 min · Tom's Hardware
Colibrì kjører GLM-5.2 med 744 milliarder parametre på 25 GB RAM
04:18
04:18 Lokale-modeller · 2 min · DEV Community
Utvikler kuttet TTFT 9,9x på Android ved å gjenbruke llama.cpp KV-state
00:32
00:32 Lokale-modeller · 2 min · GitHub
Reame: åpen LLM-inferensserver som blir raskere jo mer den kjører
Lørdag 11. juli
16:37
16:37 Lokale-modeller · 2 min · byteiota
Nvidia dropper draft-modellen i spekulativ dekoding med nye Nemotron-vekter
16:22
16:22 Lokale-modeller · 2 min · Newsweek
Qualcomm: KI-agenter vil selv avgjøre om jobben kjører i sky eller på enhet
12:31
12:31 Lokale-modeller · 2 min · TechAmerica.ai
Fransk startup ZML lanserer gratis inferensplattform på tvers av brikkeleverandører
12:18
12:18 Koding · 2 min · XDA Developers
Byttet ut Gemma 4 med en to år gammel kode-LLM, fikk et bedre lokalt KI-oppsett
00:43
00:43 Lokale-modeller · 2 min · SME Business Review
Ollama henter 65 millioner dollar mens utviklere velger lokal KI
Fredag 10. juli
08:36
08:36 Kvantisering · 4 min · GitHub
Colibri kjører GLM 5.2 på 25 GB RAM ved å streame eksperter fra disk
04:32
04:32 Lokale-modeller · Lenke · Release notes from ollama
Ollama 0.32.0-rc0 legger til «ollama agent», et terminalgrensesnitt for agent-kjøring
04:22
04:22 Lokale-modeller · 2 min · 9to5Mac (The Information)
PrismML sier de kjører Qwen 3.6 med 27 milliarder parametere på iPhone 17 Pro, åpen kildekode 14. juli
Torsdag 9. juli
20:50
20:50 Lokale-modeller · 2 min · MarkTechPost
Komprimert Nemotron kjører åtte 1M-forespørsler på én H100
16:23
16:23 Lokale-modeller · Lenke · TechCrunch
Ollama henter 65 millioner dollar og passerer 8,9 millioner utviklere i måneden
Onsdag 8. juli
20:23
20:23 Lokale-modeller · Lenke · AppSelfHost
Ollama v0.31.2-rc2: ny agent-kjøreramme og ROCm-endringer
16:30
16:30 Lokale-modeller · 2 min · AppSelfHost
Unsloth v0.1.48-beta: automatisk modellbytte gjør verktøyet til en full llama-swap-erstatning
00:38
00:38 Lokale-modeller · Lenke · LavX News
AMD lanserer Ryzen AI Halo-arbeidsstasjon på 3999 dollar for lokal KI
Tirsdag 7. juli
08:21
08:21 Forskning · Lenke · IEEE Spectrum
Små KI-modeller vinner frem der nettet er upålitelig og datasentre mangler
Søndag 5. juli
12:37
12:37 Lokale-modeller · 1 min · 36Kr (QbitAI)
mlx-dspark: uavhengig utvikler porterte DeepSeeks DSpark til Apple Silicon
Lørdag 4. juli
12:46
12:46 Forskning · Lenke · arXiv
Program-as-Weights: en 0,6B-modell matcher 32B ved å kompilere oppgavelogikk til vekter
08:32
08:32 Forskning · 2 min · arXiv
Ny arkitektur Wiola skal gjøre små språkmodeller mer effektive
04:20
04:20 Lokale-modeller · 1 min · Wafer AI
GLM-5.2 kjører 2626 tokens/sek per node på AMD MI355X til under halve Blackwell-prisen
04:15
04:15 Llm · 1 min · GitHub
Program-as-Weights: 23 MB lokal modell skal matche en 32B på enkeltoppgaver
Fredag 3. juli
20:20
20:20 Guider · 1 min · GitHub (jamesob/local-llm)
Guide til å bygge og kjøre toppmoderne språkmodeller lokalt
12:25
12:25 Lokale-modeller · 2 min · MarkTechPost
WebBrain: åpen kildekode nettleser-agent som kjører helt lokalt
Torsdag 2. juli
04:33
04:33 Lokale-modeller · 2 min · XDA Developers
Testet en lokal LLM mot en frontier-sky-modell: gapet var mindre enn ventet
Onsdag 1. juli
18:58
18:58 Hugging-face · 2 min · Hugging Face - Blog
Hugging Face og Cerebras kjører Gemma 4 31B for sanntids stemme-KI
10:04
10:04 Lokale-modeller · 2 min · Mozilla AI Blog
Mozilla.ai slipper transcribe.cpp: llama.cpp for lokal tale-til-tekst
10:00
10:00 Lokale-modeller · 2 min · DEV Community
NVIDIA Nemotron 3 Ultra mot GLM-5.2: to åpne modeller, to ulike maskinkrav
08:51
08:51 Lokale-modeller · 2 min · Hacker News - Newest: ""AI" "LLM" "Claude""
Wayfinder Router velger lokal eller sky-LLM på under ett millisekund
08:45
08:45 Anthropic · 2 min · The Decoder
Østerrike vil lokke Anthropic til EU etter amerikansk tilgangsstopp
08:40
08:40 Lokale-modeller · 2 min · Hacker News - Newest: ""AI" "LLM" "Claude""
Bash4LLM+ er én Bash-fil som snakker med LLM-APIer uten avhengigheter
08:36
08:36 Lokale-modeller · 2 min · SiliconANGLE
Meituan open-sourcer LongCat-2.0: 1,6 billioner parametere trent på kinesiske brikker
06:46
06:46 Lokale-modeller · 2 min · The Decoder
DeepSeek slipper DSpark: opptil 85 prosent raskere inferens under strammere eksportkontroll
04:22
04:22 Lokale-modeller · 2 min · SecurityWeek
175 000 eksponerte Ollama-servere: gratis KI-infrastruktur for angripere
02:52
02:52 Lokale-modeller · 2 min · Latent.Space
Ahmad Osman: derfor tar lokal KI innpå
Tirsdag 30. juni
20:23
20:23 Lokale-modeller · 2 min · Tom's Hardware
ZLUDA v6 mister finansieringen igjen og går tilbake til hobbystatus
16:26
16:26 Lokale-modeller · 2 min · Oflight Inc.
Japan åpner statens KI-plattform: Open GENAI kjører Ollama, Qdrant og Stable Diffusion
08:21
08:21 Llm · 2 min · TechTimes
DFlash knekker spekulativ dekoding: 15x raskere inferens på Blackwell GPU-er
00:36
00:36 Koding · 3 min · AI Superhero
Bygg en offline KI-kodermaskin: full agentisk arbeidsflyt uten sky
Mandag 29. juni
20:18
20:18 Lokale-modeller · 2 min · Quesma
Qwen 3.6 27B: 27 milliarder parametre slår 397 milliarder på koding
16:25
16:25 Lokale-modeller · Lenke · MarkTechPost
Liquid AI sender LFM2.5-230M: liten modell kjører lokalt via llama.cpp, MLX og vLLM
16:15
16:15 Lokale-modeller · 2 min · GetAIBook
DiffusionGemma 26B: Google DeepMind erstatter token-generering med parallell tekstdiffusjon for lokal kjøring
04:07
04:07 Lokale-modeller · 2 min · Semgrep
GLM 5.2 slår Claude i Semgreps sikkerhetsbenchmark: 39 mot 32 prosent på IDOR-funn
00:12
00:12 Lokale-modeller · 3 min · AI Insiders
Liquid AI krymper LFM2.5 til 230M parametre: ikke-transformer-modell kjører på Raspberry Pi
Søndag 28. juni
22:51
22:51 Lokale-modeller · 2 min · XDA Developers
Open Notebook: selvhostet NotebookLM-alternativ holder til daglig bruk etter en ukes test
22:48
22:48 Lokale-modeller · 2 min · MarkTechPost
DeepSeek åpner DSpark: spekulativ dekoding gir 60 til 85 prosent raskere V4-inferens
Mandag 15. juni
14:37
14:37 Google · 2 min · 9to5Mac
Apples tredje generasjon Foundation Models: lokal KI, sky og Siri på Google-servere
Søndag 14. juni
18:20
18:20 Lokale-modeller · 2 min · VideoCardz
AMD Ryzen AI Halo-PC med 128 GB minne nå tilgjengelig for 3 999 dollar
18:18
18:18 Lokale-modeller · 2 min · MarkTechPost
Moonshot AI lanserer Kimi Work: lokal skrivebordsagent med sverm av 300 sub-agenter
15:10
15:10 Koding · 2 min · stephen.bochinski.dev
KI-koding hjemme uten å gå konkurs: erfaringer fra en hobbyutvikler
14:36
14:36 Google · 2 min · Google DeepMind
Google DeepMind slipper DiffusionGemma: open-weight modell genererer tekst 4× raskere
14:30
14:30 Lokale-modeller · Lenke · byteiota
ZAYA1-8B: frontlinje-resonneringsmodell trent utelukkende på AMD-maskinvare, uten NVIDIA
12:04
12:04 Lokale-modeller · 2 min · MarkTechPost
Zyphra slipper Zamba2-VL: hybrid Mamba2-modell kutter tid til første token med rundt ti ganger
Onsdag 10. juni
14:20
14:20 Forskning · 2 min · InfoSec Today
Forskere bygger selvreplikerende KI-orm som kjører utelukkende på lokale open-weight-modeller
10:14
10:14 Google · 2 min · TPS Report
Google DeepMind slipper Gemma 4 12B: multimodal modell som kjører på 16 GB RAM
Tirsdag 9. juni
22:11
22:11 Lokale-modeller · Lenke · Digg
Kocoro: åpen kildekode Mac-agent med lokalt episodisk minne
18:43
18:43 Lokale-modeller · 2 min · The Hacker News
Forskere bygde en selvspredende KI-orm som kjører helt på lokale åpne modeller
18:39
18:39 Lokale-modeller · 2 min · MarkTechPost
Xiaomi MiMo og TileRT presser en billionparameter-modell forbi 1000 tokens per sekund på vanlige GPU-er
18:37
18:37 Google · 2 min · byteiota
Chrome får innebygd Gemma 197M: lokal språkmodell i nettleseren uten serverkostnad
Søndag 7. juni
10:36
10:36 Lokale-modeller · Lenke · OpenClaw Chronicles
OpenClaw v2026.5.22 gjør modell-listing 4100 ganger raskere
10:20
10:20 Google · Lenke · AppleInsider
Google AI Edge Gallery kjører Gemma-modeller lokalt på Mac
10:10
10:10 Google · 2 min · Google Blog
Gemma 4 får QAT-kvantisering: E2B-modellen krymper til 1 GB minne
Torsdag 21. mai
18:13
18:13 Lokale-modeller · 1 min · CIO Influence
Cohere slipper Command A+: åpen MoE-modell for suveren infrastruktur
10:13
10:13 Llm · Lenke · XDA Developers
AMD Ryzen AI Halo: kompakt arbeidsstasjon med opptil 192 GB minne for lokale LLM-er
10:13
10:13 Llm · 2 min · MarkTechPost
NVIDIA slipper Nemotron-Labs-Diffusion: én modell med tre dekodingsmoduser fra 3B til 14B
02:20
02:20 Lokale-modeller · Lenke · TechCrunch
Stability AI slipper Stable Audio 3.0 med små modeller for lyd på enheten
02:18
02:18 Lokale-modeller · Lenke · Ollama (GitHub)
Ollama v0.30 går over til native llama.cpp i stor arkitekturendring
Onsdag 20. mai
14:20
14:20 Lokale-modeller · 2 min · GitHub
Forge: guardrails løfter selvhostet 8B-modell fra 53 til 99 prosent på agent-eval
Tirsdag 19. mai
15:24
15:24 Lokale-modeller · 3 min · Startup Fortune
llama.cpp dobler Qwen3.6 27B med Multi-Token Prediction: 7,4 til 18,1 t/s på Strix Halo
Fredag 15. mai
18:17
18:17 Lokale-modeller · Lenke · Open Source For You
Kimi WebBridge: Moonshot AI gjør åpen modell til lokal nettleser-operatør
14:21
14:21 Lokale-modeller · 2 min · MarkTechPost
Supertonic 3: 31 språk, 99M parametre og 404 MB ONNX som kjører på e-blekk
Onsdag 13. mai
18:32
18:32 Lokale-modeller · 2 min · xix.ai
Ant Groups F2LLM-v2: åpen flerspråklig embedding-modell i full skala
18:29
18:29 Lokale-modeller · 2 min · NVIDIA Blog
Hermes Agent passerer 140 000 stjerner: selv-utviklende lokal agent kjører på RTX og DGX Spark
14:23
14:23 Lokale-modeller · 3 min · GitHub (cactus-compute)
Needle: 26M-modell distillert fra Gemini 3.1 kan finjusteres lokalt på Mac og PC
10:34
10:34 Kvantisering · 3 min · Hugging Face
Lokale åpne modeller dobler intelligens hver 10. måned: 4,7x på to år, uendret laptop
Tirsdag 12. mai
18:27
18:27 Lokale-modeller Viktig · 3 min · Security Boulevard
Bleeding Llama: kritisk Ollama-svakhet lekker minneinnhold fra 300 000 servere
18:16
18:16 Hugging-face · 2 min · Dark Reading
Én linje i tokenizer.json kan kapre KI-modeller hentet fra Hugging Face
Mandag 11. mai
22:18
22:18 Kvantisering · 3 min · jola.dev
Lokale modeller på M4 med 24 GB minne: hva som faktisk er brukbart
14:36
14:36 Lokale-modeller · 2 min · LavX News
Fedora og Ubuntu legger lokal KI inn i standarddistribusjonen
06:18
06:18 Lokale-modeller · Lenke · XDA Developers
Qwen 2.5 på NAS dekker smarthjem-automatisering uten Claude
02:12
02:12 Lokale-modeller · Lenke · unix.foo
Brutalist Report-utvikler: stopp å lime KI-chat på alt, bruk Apples on-device-modell
Søndag 10. mai
18:33
18:33 Lokale-modeller · 3 min · Hackaday
Brukt server-GPU til 200 dollar kjører LLM bedre enn RTX 3060
18:30
18:30 Lokale-modeller · 2 min · CSO Online
Kritisk Ollama-feil lekker minne fra 300 000 selvhostede servere
10:11
10:11 Google · 2 min · Tweaktown
Google Chrome laster stille ned 4 GB Gemini Nano-modell uten samtykke
02:17
02:17 Lokale-modeller · 3 min · Cyera Research
Kritisk minnelekkasje i Ollama eksponerer 300.000 servere (CVE-2026-7482)
Lørdag 9. mai
22:10
22:10 Lokale-modeller · 2 min · knightli.com
Ubuntu satser på lokal inferens og opt-in: Canonical legger KI-funksjoner til 26.10
06:35
06:35 Lokale-modeller · 2 min · Gizmochina
Xiaomi åpner OmniVoice: TTS-modell med stemmekloning på flere hundre språk og enklere arkitektur
Fredag 8. mai
18:29
18:29 Lokale-modeller · 3 min · dev.to
llama.cpp støtter nå Xiaomis MiMo-V2.5 Sparse MoE: 310 milliarder parametere lokalt
18:28
18:28 Lokale-modeller · 3 min · Cyber Security News
«Bleeding Llama»: Ollama-feil eksponerer 300 000 servere. Tre API-kall henter prompts og miljøvariabler
14:12
14:12 Lokale-modeller · 2 min · Tom's Hardware
Hovedkortsalget faller 28 prosent: KI-fabrikker spiser komponentene du trenger til lokale modeller
06:30
06:30 Google · 2 min · The Register
Chrome installerer 4 GB Gemini Nano lokalt uten samtykke. Filen kommer tilbake hvis du sletter den
Torsdag 7. mai
22:16
22:16 Lokale-modeller · 2 min · GitHub (Blaizzy/mlx-vlm)
mlx-vlm v0.5.0: kontinuerlig batching, MTP-spekulering og Gemma 4-video på Apple Silicon
22:13
22:13 Lokale-modeller · 2 min · GitHub (antirez/ds4)
antirez slipper ds4: dedikert Metal-motor for DeepSeek V4 Flash, 2-bit kvantisering, KV-cache på SSD
14:27
14:27 Google · 2 min · Belitsoft
Google legger multi-token-prediksjon til Gemma 4: opptil 3,1× raskere lokalt uten å endre kvaliteten
10:18
10:18 Lokale-modeller · 2 min · Third News
Zyphras ZAYA1-8B aktiverer mindre enn 1 milliard parametre per token og matcher 119B-modeller
06:23
06:23 Lokale-modeller Viktig · 2 min · CVE Feed
Ollama CVE-2026-7482: GGUF-fil lekker minne fra 300 000 servere, fiks i v0.17.1
02:24
02:24 Lokale-modeller · 2 min · Security Affairs
Lightning v2.6.3 spredte ShaiWorm: PyPI-import startet 11,4 MB credential stealer via Bun
Onsdag 6. mai
22:32
22:32 Kvantisering · 2 min · GitHub: localai-org/vibevoice.cpp
vibevoice.cpp: Microsofts VibeVoice kjører nå lokalt på llama.cpp-stacken via ggml
22:32
22:32 Lokale-modeller · 2 min · Ollama / GitHub Releases
Ollama v0.23.1: Gemma 4 MTP gir over 2x fart på Mac for kodingsoppgaver
18:57
18:57 Llm · 2 min · Basic Tutorials
QNAP slipper QAI-h1290FX: 16-kjerners EPYC, RTX-GPU og 12 NVMe-spor for lokale LLM-er til 19 000 euro
18:43
18:43 Claude-code · 2 min · Frontier Wisdom
Unsloth slipper Anthropic-kompatibel API for lokale Qwen og Gemma
02:16
02:16 Koding · 2 min · DEV Community
Tinkerer presser Qwen3-Coder 30B inn i 8 GB VRAM med 262K-kontekst — beskriver hver flaskehals
02:15
02:15 Kvantisering · 2 min · DEV Community
Qwen3.6-35B kjører på Mac med 48 GB RAM på 77 tokens/sekund — komplett MLX-oppskrift
Tirsdag 5. mai
22:51
22:51 Google · 2 min · Google
Gemma 4 får MTP-drafters: opp til 3x raskere lokal inferens uten kvalitetstap
22:26
22:26 Lokale-modeller · 2 min · Help Net Security
Striga finner to upatchede CVE-er i Ollamas Windows-klient som lar angripere plante en stille innloggings-RCE
22:24
22:24 Lokale-modeller Viktig · 2 min · SecurityWeek
Bleeding Llama: kritisk Ollama-feil eksponerer prompts og API-nøkler i 300 000 selvhostede oppsett
18:24
18:24 Lokale-modeller · 2 min · DEV Community
Llama.cpp får MTP-beta og Sentinel kommer som lokal-først kodeeditor på toppen av Ollama
14:10
14:10 Google · 2 min · That Privacy Guy
Chrome dytter en 4 GB Gemini Nano-modell ned på maskinen din uten å spørre, og laster den ned igjen hvis du sletter
06:27
06:27 Anthropic · 2 min · Ollama
Ollama v0.23.0 åpner Claude Desktop mot lokale modeller med «ollama launch claude-desktop»
Søndag 3. mai
18:13
18:13 Lokale-modeller · Lenke · DataLearner AI
Qwen3-TTS: Alibabas åpne talesyntese-modeller er ute — ned til 0,6B parametere
10:08
10:08 Lokale-modeller · 3 min · The Register
The Register: Slik kjører du Claude Code mot en lokal Qwen3.6-modell og dropper token-regningen
Lørdag 2. mai
10:16
10:16 Llm · 2 min · XDA Developers
En uke uten Claude Pro: lokal Qwen 3.5 9B taklet alt unntatt render-panelet
02:11
02:11 Lokale-modeller · Lenke · Linuxiac
Calibre 9.8: e-boklesleren støtter alle lokale OpenAI-kompatible KI-leverandører
Fredag 1. mai
18:29
18:29 Lokale-modeller · Lenke · openwarp.zerx.dev
OpenWarp: AGPL-fork av Warp lar deg koble til DeepSeek, Anthropic og Ollama lokalt
18:18
18:18 Kvantisering · 2 min · github.com/intel
Intel auto-round v0.12.3: kvantiserer LLM til 2–4 bit på CPU og GPU med vLLM- og SGLang-støtte
Torsdag 30. april
06:13
06:13 Lokale-modeller · 3 min · Lemonade GitHub Releases
Lemonade v10.3: én lokal OpenAI-API for tekst, bilder og tale i 10x mindre app
02:18
02:18 Lokale-modeller · 2 min · BigGo Finance
Tencent slipper Hunyuan-MT i 1,25-bit kvantisering: 33 språk i 440 MB som kjører offline på telefon
Onsdag 29. april
22:09
22:09 Llm · 2 min · SD Times
Anaconda Desktop i beta: lokal LLM-inferens og conda samlet i ett vindu
14:08
14:08 Lokale-modeller · 3 min · XDA Developers
Home Assistant med Qwen3 lokalt slår Googles Gemini for Home, også når kommandoen er tvetydig
13:06
13:06 Lokale-modeller · 2 min · The Next Web
Nvidia Nemotron 3 Nano Omni: 30B parametere, 3B aktive, multimodal modell for én GPU
10:10
10:10 Lokale-modeller · 2 min · Poolside
Poolside slipper Laguna XS.2 åpent: 33B MoE med 3B aktive, Apache 2.0 og signal om mer åpenhet
Tirsdag 28. april
18:09
18:09 Lokale-modeller · 2 min · The AI Insider
LittleLamb: Multiverse komprimerer Qwen3-0.6B med 50 % og slår originalen på HLE
10:10
10:10 Lokale-modeller · 3 min · Hugging Face
Xiaomi slipper MiMo-V2.5-Pro under MIT: 1,02 billioner parametere MoE med 1M-token kontekst
Mandag 27. april
14:08
14:08 Lokale-modeller · 2 min · B2B Daily
CVE-2026-33626: SSRF i LMDeploy ble utnyttet på 12 timer og gir tilgang til cloud-metadata
02:13
02:13 Lokale-modeller · 2 min · Startup Fortune
Pocket LLM v1.5.0 kjører multimodal KI på Android uten internett
Søndag 26. april
14:14
14:14 Lokale-modeller · Lenke · OffSeq Threat Radar
Ollama opp til versjon 0.20.2 har path traversal-sårbarhet — CVE-2026-7020
Onsdag 22. april
22:13
22:13 Lokale-modeller · 2 min · Qwen Blog
Qwen3.6-27B slår Claude Opus på flere kode-benchmarks — åpen og lokal
06:11
06:11 Lokale-modeller · 2 min · Decrypt
«Frankenstein»-modell stabler Claude Opus, GLM og Qwen: slår 35B på 9,2 GB VRAM
Tirsdag 21. april
06:15
06:15 Kvantisering · 2 min · PrismML
Ternary Bonsai kjører 8B-modell på 1,58 bits — 82 tokens/sek på M4 Pro uten GPU
02:15
02:15 Llm · 2 min · Real Hacker News
SGLang har kritisk RCE-sårbarhet CVE-2026-5760: Ondsinnede GGUF-filer kjører Python på serveren (CVSS 9,8)
Mandag 20. april
18:13
18:13 Lokale-modeller · Lenke · The Verge
RAM-mangelen kan vare til 2030 — lokal inferens blir dyrere lenge
06:07
06:07 Lokale-modeller · 2 min · Hacker News / Show HN
TRELLIS.2 kjører bilde-til-3D på M4 Pro: 424 000 vertekser på 3,5 minutter uten Nvidia
02:09
02:09 Lokale-modeller · 2 min · Startup Fortune
llama.cpp fletter inn spekulativ sjekkpunkting: 40 prosent mindre VRAM, 20 prosent flere tokens
Søndag 19. april
22:10
22:10 Google · 2 min · Hacker News / Show HN
Gemma 4 kjører i Chrome med WebGPU: prompt-til-Excalidraw i nettleseren, 3 GB RAM
06:20
06:20 Google Viktig · 2 min · MakeUseOf
Google Gemma 4 er ute: Apache-lisens og MoE som kjører i 4B-fart
Fredag 17. april
22:15
22:15 Lokale-modeller · 2 min · Hugging Face
Qwen3.6-35B-A3B: Alibaba slipper MoE-modell med 35 mrd parametere der bare 3 mrd er aktive
02:24
02:24 Lokale-modeller · 3 min · Phoronix
Mozilla lanserer Thunderbolt — åpen kildekode KI-klient med MCP- og ACP-støtte
Torsdag 16. april
22:19
22:19 Llm · 2 min · Simon Willison
21GB Qwen3.6 på en laptop tegnet bedre pelikan enn Claude Opus 4.7
18:23
18:23 Lokale-modeller · 2 min · CnTechPost
Baidu open-sourcer Ernie-Image: 8 milliarder parametere kjører på 24 GB VRAM
18:18
18:18 Lokale-modeller · 3 min · Darkbloom via HN
Darkbloom kutter inferens-prisen 50 prosent ved å kjøre på ledige Mac-er
09:25
09:25 Google · 2 min · GizmoWeek
Gemma 4 kjører nå fullt offline på iPhone — E2B-varianten anbefalt for mobilbruk
Onsdag 15. april
16:10
16:10 Google · Lenke · GizmoWeek
Google Gemma 4 kjører direkte på iPhone med full offline-inferens
09:05
09:05 Lokale-modeller · 1 min · AMD
AMD lanserer GAIA — open source-rammeverk for KI-agenter på lokal maskinvare
Tirsdag 14. april
04:13
04:13 Lokale-modeller · Lenke · Hacker News
Slik kjører du Gemma 4 lokalt i Codex CLI
Mandag 13. april
20:16
20:16 Lokale-modeller · Lenke · EE Times
ROCm tar opp kampen mot CUDA: AMD satser steg for steg
14:17
14:17 Lokale-modeller · Lenke · Gigazine
Microsoft Foundry Local: kjør Qwen og Whisper lokalt uten skytilkobling
Torsdag 9. april
08:03
08:03 Lokale-modeller · Lenke · GitHub / Hacker News
Finjuster Gemma 4 multimodalt på Apple Silicon — uten sky eller NVIDIA
Tirsdag 7. april
10:25
10:25 Llm · Lenke · XDA Developers
Spekulativ dekoding gjør lokale LLM-er raskere uten maskinvareoppgradering
Mandag 6. april
12:14
12:14 Llm · Lenke · George Liu AI
Kjør Gemma 4 lokalt med LM Studios nye headless CLI
08:17
08:17 Lokale-modeller · 1 min · iXBT
Arcee AI lanserer Trinity-Large-Thinking: åpen resonneringsmodell med 399 milliarder parametere
Søndag 5. april
20:14
20:14 Lokale-modeller · Lenke · Bitcoin News
Vitalik Buterin dropper sky-KI helt — deler sin lokale LLM-stack
16:12
16:12 Google · Lenke · Ubergizmo
Google lanserer Gemini Nano 4 for lokal KI på Android
08:17
08:17 Forskning · Lenke · The Register
Caltech-startup slipper 1-bit LLM som er 14 ganger mindre og kjører på iPhone
00:14
00:14 Lokale-modeller · Lenke · AI-trends.today
Arcee AI slipper Trinity Large Thinking: Apache 2.0 resonneringsmodell for langsiktige agenter
Lørdag 4. april
14:46
14:46 Lokale-modeller · Lenke · Gigazine
mesh-llm: kjør store KI-modeller fordelt over vanlige PCer i nettverket
14:44
14:44 Google · 1 min · Ars Technica
Google Gemma 4: fire open-source-modeller med Apache 2.0-lisens
Torsdag 2. april
12:50
12:50 Lokale-modeller · Lenke · LocalLlama
SmolLM2 kjører på en Samsung Galaxy Watch med 380 MB RAM
12:50
12:50 Forskning · Lenke · LocalLlama