Til forsiden
#ytelse
232 saker med denne taggen
I dag · fredag 4. september
16:18
16:18 Llm · 3 min · The Decoder
Epoch og Artificial Analysis er uenige om GPT-6 Astra, men ARC-AGI-3 flytter Chollets anslag
I går · torsdag 3. september
20:37
20:37 Hugging-face · 2 min · Hugging Face - Blog
NeoMME søker i PDF-sider med 260M parametre og 6 kB per side
20:31
20:31 Lokale-modeller · 3 min · Perplexity (X)
Perplexity åpner Lily: egenbygd inferensmotor slår MLX på Mac
00:24
00:24 Llm · Lenke · Multiverse Computing
Quasar 438B er Europas høyest rangerte modell, men bare gjennom et API
Onsdag 2. september
16:25
16:25 Utvikling · 3 min · The Decoder
World Labs viser Atlas: 3D-verdener fra to eller tre bilder
12:23
12:23 Lokale-modeller · 3 min · GitHub (antirez/ds4)
ds4 får synsstøtte: DeepSeek V4 Flash leser bilder lokalt på Metal, CUDA og ROCm
08:25
08:25 Lokale-modeller · 3 min · GitHub
slotstream lar en 48 GB-Mac kjøre en 104 GB-modell via SSD-streaming
Tirsdag 1. september
20:43
20:43 Hugging-face · 3 min · Hugging Face - Blog
207 WebGPU-kjerner fra Hugging Face gjør nettleser-inferens 2,57 ganger raskere
08:28
08:28 Utvikling Viktig · 3 min · Latent.Space
H3 Max lager fem sekunder video på under tre sekunder
Mandag 31. august
08:16
08:16 Lokale-modeller · 2 min · underfoot
Underfoot måler hvordan Apples modell på enheten drifter mellom OS-bygg
Lørdag 29. august
16:37
16:37 Ytelse · 2 min · AI News & Artificial Intelligence | TechCrunch
Nvidias fortrinn flytter seg fra GPU-en til resten av racket
00:37
00:37 Hugging-face · 2 min · Hugging Face - Blog
Hindi inn på Open ASR Leaderboard: like modeller feiler i hver sin landsdel
Torsdag 27. august
20:56
20:56 Google · 3 min · AI News & Artificial Intelligence | TechCrunch
Google Play innfører minnetak: 2 GB for apper på en 4 GB-telefon
16:43
16:43 Ytelse · 2 min · The Decoder
GLM-5.3-Flash kjørte helt uten Nvidia, til 0,09 dollar per oppgave
Onsdag 26. august
12:59
12:59 Llm · 2 min · MIT Technology Review
KI-modeller løser Connections nesten feilfritt, men bommer på mental rotasjon
Tirsdag 25. august
20:43
20:43 Openai · 3 min · OpenAI News
OpenAIs Jalapeño gir 1,9 ganger flere tokens per kilowatt enn GB200
16:36
16:36 Ytelse · 2 min · The Decoder
Nvidias Groq 3 LPX når 3400 tokens i sekundet, men trenger 64 brikker
16:25
16:25 Utvikling · 3 min · LPU Lite
Studenttrio bygde egen LPU: 8500 tokens i simulering, 20 på FPGA-en
08:43
08:43 Claude-code · 2 min · Release notes from ollama
Ollama slår av Claude Codes token-nedtelling fordi den brøt KV-cachen hver gang
04:45
04:45 Anthropic · 2 min · Anthropic / GitHub
Claude Code 2.1.243 kutter nedlastingen fra 340 til 75 MB på Linux
Mandag 24. august
20:37
20:37 Lokale-modeller · 2 min · Gizmochina
Xiaomi viser fram AI Cube: kjører 120 milliarder parametere lokalt
16:47
16:47 Llm · Lenke · The Decoder
Cerebras CS-4 dobler ytelsen på samme 5nm-brikke
Søndag 23. august
04:33
04:33 Llm · 3 min · Prime Intellect
Fable 5 tetter 81,7 prosent av gapet til nanoGPT-menneskerekorden
00:27
00:27 Kvantisering · 2 min · Level1Techs Forum
Nvidias FP4-kvant flippet halvparten av tokenene ved 88k kontekst
Lørdag 22. august
08:21
08:21 Qwen · 2 min · Nari Labs
Nari Labs presser Qwen3-TTS under 50 ms og ned til 2 dollar per million tegn
Fredag 21. august
16:44
16:44 Ytelse · Lenke · The Decoder
Waymo bytter Nvidia mot egen brikke fra TSMC
16:37
16:37 Hugging-face · 2 min · Hugging Face - Blog
Seks av elleve ASR-modeller gjenga fasitens feil, ikke lyden
16:34
16:34 Lokale-modeller · 3 min · Liquid AI
LFM2.5-2.6B går fra 61 til 139 tokens i sekundet på MacBook
12:26
12:26 Llm · 2 min · DeepSeek
DeepSeeks eksperimentelle synsmodell nærmer seg Opus 4.8
08:35
08:35 Ytelse · 2 min · Netic
Netic byttet 223-node agent-graf med én åpen KI-modell
Torsdag 20. august
04:17
04:17 Hugging-face · 3 min · NVIDIA (GitHub)
NVIDIA TensorRT Model Connect: Hugging Face-modell til C++-inferens på to kommandoer
Onsdag 19. august
20:48
20:48 Lokale-modeller · 3 min · Release notes from ollama
Ollama cacher modellmetadata, halverer tid til første token
20:47
20:47 Lokale-modeller · 3 min · PantheonGPU (Show HN)
PantheonGPU stresstester GPU-en, men KI-lastene er syntetiske
16:21
16:21 Llm · 3 min · Cerebras
Cerebras CS-4 dobler ytelsen på samme wafer ved å doble effekten
08:13
08:13 Hugging-face · 2 min · GitHub
To kommandoer tar en Hugging Face-modell til C++-inferens
04:27
04:27 Lokale-modeller · 2 min · Inco AI
DFlash 2 gir 21 prosent flere tokens per verifiseringsrunde
00:35
00:35 Ytelse · 2 min · The Decoder
Ny benchmark rangerer sju søke-APIer for KI-agenter på kvalitet, pris og fart
00:33
00:33 Llm · 2 min · Hugging Face - Blog
IBM målte 16 prosentpoeng bedre agent med kuratert minne til 5 prosent mer tokens
Tirsdag 18. august
16:53
16:53 Hugging-face · 2 min · Hugging Face - Blog
Sentence Transformers 6.0 tar inn ColBERT-søk: bedre treff, mye større indeks
00:45
00:45 Utvikling · 3 min · Hugging Face - Blog
33 prosentpoeng mer GPU-utnyttelse kom av rekkefølgen, ikke maskinvaren
Mandag 17. august
16:15
16:15 Gemini · 3 min · Roboflow
Sol løftet OpenAIs objektdeteksjon til 46,2 mAP
Søndag 16. august
12:33
12:33 Llm · 3 min · The Decoder
Optima lar deg bygge benchmark på egne data og måler kostnad per oppgave
08:16
08:16 Koding · 2 min · arXiv
KI-agent portet 250 000 linjer gammel værsimulering til GPU, 5,1x raskere
Lørdag 15. august
20:45
20:45 Fine-tuning · 3 min · Hacker News - Newest: ""AI" "LLM" "Claude""
Netflix erstattet tusenvis av håndlagde features med tekst
08:22
08:22 Koding · 3 min · Hacker News - Newest: ""AI" "LLM" "Claude""
Strengere verifikator forkaster 1 487 GPU-kjerner som standardtesten godkjente
04:26
04:26 Llm · 2 min · Mixedbread
Toast 1 tok Codex fra 33 til 70 prosent på Databricks-testen
Fredag 14. august
21:11
21:11 Llm · 2 min · AI News & Artificial Intelligence | TechCrunch
Kog fikk 3 000 tokener i sekundet ut av én forespørsel på H200 og MI300X
05:04
05:04 Lokale-modeller · 3 min · Hacker News - Newest: ""AI" "LLM" "Claude""
Fire V620-kort fra e-avfall kjører DeepSeek V4 Flash i garasjen
00:26
00:26 Llm · 2 min · Pathway
Pathways 150M-modell koster en ellevtedel av GPT-5.6 Luna per oppgave
Torsdag 13. august
16:44
16:44 Anthropic · Lenke · Hacker News - Newest: ""AI" "LLM" "Claude""
Anthropic i samtaler om å kjøpe Decart for 6 milliarder dollar
05:06
05:06 Lokale-modeller · Lenke · Simon Willison's Weblog
MiniMax-H3 kjører på Apple Silicon: 115 GB modellfiler og 45 minutter per klipp
00:28
00:28 Lokale-modeller · Lenke · Release notes from ollama
Ollama 0.32.10-rc0 gir 7,9 prosent raskere prefill på ModelOpt-vekter
Onsdag 12. august
20:34
20:34 Hugging-face · 2 min · Hugging Face - Blog
LFM2.5-VL-3B kjører på 3 GB minne og leser skjermbilder
04:34
04:34 Lokale-modeller · 3 min · VentureBeat
LTX-2.5 gir åpne vekter fra 16 GB VRAM, og lisensen smitter på det du trener
Tirsdag 11. august
20:59
20:59 Llm · 2 min · Hugging Face - Blog
IBM leverer samme agent-minne som ACE for en sjuendedel av tokenene
20:51
20:51 Lokale-modeller · 3 min · Hacker News - Newest: ""AI" "LLM" "Claude""
Metal-shim i macOS-VM ga 11 til 16 ganger raskere llama.cpp
20:21
20:21 Koding · 2 min · danluu.com
50 kjøringer per test: støyen er større enn forskjellen mellom GPT-modellene
05:25
05:25 Claude-code · 3 min · Hacker News - Newest: ""AI" "LLM" "Claude""
21 300 tokens i sekundet på et FPGA-brett til 250 dollar
Mandag 10. august
12:51
12:51 Llm · 2 min · MIT Technology Review
Fire veier rundt transformerens flaskehals, og to har vekter du kan laste ned
Søndag 9. august
16:23
16:23 Koding · 2 min · Antigma
DeepSeek V4 Flash 0731: 82,7 prosent på Terminal-Bench til 68 dollar
Lørdag 8. august
16:43
16:43 Llm · 2 min · Hacker News - Newest: ""AI" "LLM" "Claude""
CPU-en er tilbake: 50–90 % av agent-latensen skjer utenfor GPU-en
16:40
16:40 Anthropic · 2 min · The Decoder
Bytedance trener KI-modell med ti billioner parametere
13:06
13:06 Openai · 2 min · The Decoder
xAI Imagine Image 2.0 lander 24 Elo-poeng bak GPT-Image-2 i Arena
08:54
08:54 Ytelse · Lenke · Latent.Space
AMD kjøper Taalas, som støper modellvektene inn i silisiumet
00:59
00:59 Llm · 3 min · Hacker News - Newest: ""AI" "LLM" "Claude""
vLLM innenfra: slik gjør paged attention GPU-minnet til blokker på 16 tokens
00:46
00:46 Llm · 2 min · OpenAI News
GPT-5.6 Sol oppdatert i ChatGPT, men Codex-versjonen er urørt
00:28
00:28 Lokale-modeller · 3 min · XDA Developers
Gemma-4-E2B på en NAS: 10,5 tokens i sekundet på 8 GB RAM
Onsdag 5. august
16:24
16:24 Utvikling · 2 min · The Decoder
FLUX 3 Video åpnes for alle: 20 sekunders klipp med innebygd lyd
12:14
12:14 Llm · 2 min · Hacker News - Newest: ""AI" "LLM" "Claude""
Zero-Mem kutter LLM-kall i agentminnet, 57,6 prosent raskere
04:47
04:47 Cursor · 2 min · Latent.Space
Cursor åpner megakernelen som ga 41 prosent flere tokens i sekundet
00:41
00:41 Utvikling · 2 min · The Cloudflare Blog
Cloudflare sporer nå hvert modellkall og token i agentene dine
Tirsdag 4. august
20:18
20:18 Lokale-modeller · Lenke · Release notes from ollama
Ollama v0.32.6-rc0: Qwen3.5 får spekulativt MTP-hode, MLX-bildegenerering ut
04:25
04:25 Kvantisering · Lenke · Latent.Space
Baseten: kvantisering gjorde GLM-5.2 20 prosent raskere uten kvalitetstap
00:37
00:37 Lokale-modeller · 3 min · Pasquale Pillitteri
Kimi K3 kjørt på én CPU med 8 GB RAM: 2,78 billioner parametere fra disk
Mandag 3. august
20:43
20:43 Selvhostet · 2 min · Devdigest
LocalAI erstattet 9,1 GiB vLLM med en binærfil på 66 MiB, uten å tape fart
20:28
20:28 Lokale-modeller · 3 min · DEV Community
AirLLM kjører Kimi K3 sine 2,8 billioner parametere på 3,72 GB VRAM
12:42
12:42 Kvantisering · 2 min · Level1Techs Forum
ROCm 7.14 halverte farten på én modell, men ikke på den ved siden av
00:19
00:19 Lokale-modeller · 2 min · TechRadar Pro
Acrab lover 100 milliarder parametere lokalt. Målingen er kjørt på Gemma 26B
Søndag 2. august
12:38
12:38 Llm · 2 min · Alexi Gladstone (personlig forskerblogg)
Explorative Modeling gir 6,2 ganger mindre data for samme bildekvalitet
08:44
08:44 Llm · 3 min · Hacker News - Newest: ""AI" "LLM" "Claude""
Simulering: RDMA-kopiert KV-cache kutter ventetiden 54 prosent
08:29
08:29 Selvhostet · 2 min · Wafer
MI355X gir 48 tokens per sekund per dollar på Kimi K3, mot 33 på B300
00:55
00:55 Produktivitet · 2 min · The Decoder
ByteDance slipper Seedance 2.5: 30 sekunder video med lyd i én generering
00:47
00:47 Selvhostet · 2 min · Linuxiac
Incus 7.3 tetter 13 sårbarheter og lar flere VM-er dele ett GPU
00:39
00:39 Lokale-modeller · 2 min · MarkTechPost
AMD åpner hvert treningssteg i Instella-MoE, men bare for forskning
Lørdag 1. august
12:32
12:32 Lokale-modeller · 2 min · GitHub
Åpen kjøremotor strømmer Kimi K3 sine 2,8 billioner parametere fra NVMe
12:25
12:25 Selvhostet · 2 min · Milvus
Milvus 3.0 lar deg søke i data som blir liggende i objektlagringen
00:26
00:26 Llm · 2 min · BleepingComputer
GPT-5.6 Sol får Fast-modus: 2,5 ganger raskere til dobbel pris
Fredag 31. juli
16:24
16:24 Llm · 3 min · OfficeChai
DeepSeek V4-Flash-0731 scorer 82,7 på Terminal Bench til 0,14 dollar per million tokens
00:59
00:59 Microsoft · 2 min · The Decoder
Microsoft satser på små spesialistmodeller framfor frontlinjen
00:53
00:53 Openai · 3 min · The Decoder
OpenAI kutter prisen på GPT-5.6 Luna med 80 prosent
00:28
00:28 Kvantisering · 3 min · GitHub (Show HN)
runNburn kjører en 222 GiB modell på en Mac med 64 GiB minne
Torsdag 30. juli
16:27
16:27 Openai · 2 min · The Decoder
OpenAI slår Opus 5 på ARC-AGI-3 med 38,3 prosent, men bare med sitt eget testoppsett
12:22
12:22 Kvantisering · 2 min · RuntimeWire
VisionPsy-Nano kjører bildeforståelse på mobilen: 460 millioner parametere, Apache 2.0
04:23
04:23 Lokale-modeller · 2 min · GitHub (llama.cpp)
llama.cpp får NextN-dekoding for GLM-5.2: 37 prosent raskere generering
01:09
01:09 Google · 3 min · GitHub (TurboFieldfare)
TurboFieldfare kjører Gemma 4 26B i 2 GB RAM på 8 GB MacBook Air
00:57
00:57 Anthropic · 3 min · Hacker News - Newest: ""AI" "LLM" "Claude""
Claude Fable 5 vinner fysikktest, rammeverket betyr mer
Onsdag 29. juli
16:23
16:23 Mistral · 2 min · The Decoder
GPT Transcribe blir 25 prosent billigere, men taper fortsatt på feilrate
12:30
12:30 Selvhostet · 2 min · GitHub
Triton Control gir NVIDIA Triton på Kubernetes ett kontrollpanel
12:20
12:20 Claude-code · 3 min · JetBrains Blog
Ponytail-skillet kutter 15 % av koden, ikke 54 % som lovet
Tirsdag 28. juli
12:23
12:23 Ytelse · 3 min · Tech Times
Molt kjører agentisk RL på 9 200 linjer kode, mot 62 000 for verl
04:22
04:22 Claude · 2 min · humanlayer
Opus 5 klarer 4 av 17 sjekkpunkter i SlopCodeBench, mot 1 for Opus 4.8 og Sonnet 5
00:19
00:19 Llm · 2 min · Business Wire
Ling-3.0-Flash aktiverer 5,1 milliarder parametere, men vektene ligger ikke ute ennå
Mandag 27. juli
16:35
16:35 Ytelse · Lenke · Hugging Face - Blog
Cosmos-H-Dreams kjører kirurgisk verdensmodell i 160 bilder per sekund på ett kort
16:26
16:26 Ytelse · Lenke · MIT Technology Review
Intel: planlegg agent-flåter etter agenter per vCPU, og varsle på P95-latens
00:22
00:22 Llm · 2 min · MarkTechPost
Photon-1 trente på 18 år skjermvideo uten handlingsetiketter og slår Gemini 3.1 Flash-Lite
Søndag 26. juli
08:13
08:13 Selvhostet · 2 min · Mooncake (GitHub)
Mooncake v0.3.12 flytter KV-cachen ut på nettverks-SSD
Lørdag 25. juli
16:27
16:27 Anthropic · 3 min · The Decoder
Opus 5 topper uavhengige tester, men hallusinasjonsraten er oppe i 50 prosent
08:12
08:12 Koding · Lenke · The Register
AMDs ROCm.AI lar kodeassistenten tune Instinct-inferens
Fredag 24. juli
20:48
20:48 Llm · Lenke · The Decoder
Sakana hevder ruteren Fugu Ultra v1.1 slår Fable 5 uten å bruke den
20:39
20:39 Fine-tuning · Lenke · GitHub - unslothai/unsloth
Unsloth trener nå modeller på AMD-GPU: 2× raskere med 70 % mindre VRAM
16:33
16:33 Llm · 3 min · Hacker News - Newest: ""AI" "LLM" "Claude""
Hetzner tester eget inferens-API: OpenAI-kompatibelt, Qwen3.6 og ingen SLA
04:34
04:34 Anthropic · 2 min · Tech Times
Claude Code v2.1.216 fjerner kvadratisk treghet i lange sesjoner
00:25
00:25 Ytelse · 2 min · The Decoder
Black Forest Labs slipper Flux 3: 20 sekunders video med innebygd lyd
Torsdag 23. juli
20:19
20:19 Lokale-modeller · Lenke · Framework
Framework lanserer 192 GB-variant av Framework Desktop med AMD Ryzen AI Max+ Pro 495
04:46
04:46 Claude · 2 min · Hacker News - Newest: ""AI" "LLM" "Claude""
Claude Fable 5 kostet 20 ganger mer enn GPT-5.6 på å tegne Mona Lisa
Onsdag 22. juli
04:29
04:29 Llm · Lenke · Fireworks AI
Kimi K3 er konkurransedyktig med Fable
04:17
04:17 Kvantisering · Lenke · Show HN
Nettside viser hvilken KI-modell laptopen din kan kjøre lokalt
00:27
00:27 Deepmind · 2 min · Hugging Face - Blog
Simuleringsstacken for fysisk KI i 2026: MuJoCo, Isaac Lab og Newton
Tirsdag 21. juli
21:04
21:04 Alibaba · 3 min · The Decoder
Qwen-Image-3.0 lager tettpakkede infografikker i én pass, men slipper ikke åpne vekter
00:22
00:22 Gemini · Lenke · The Decoder
Googles «Frozen v2»-brikke støper Gemini-arkitekturen inn i silisium
00:16
00:16 Claude-code · 2 min · JetBrains Blog
JetBrains målte rtk-tokenkutt: lovde 60-90 prosent, ble dyrere
Mandag 20. juli
04:13
04:13 Lokale-modeller · 3 min · Hacker News
Headroom måler GPU-taket ditt for lokale modeller på 30 sekunder
00:16
00:16 Claude-code · Lenke · Hacker News - Newest: ""AI" "LLM" "Claude""
Claude Code har kjørt Bun skrevet i Rust siden juni
Søndag 19. juli
13:01
13:01 Kvantisering · 2 min · Tech Times
PrismML klemmer en 27 milliarder-parameter KI-modell ned til under 4 GB for iPhone
Lørdag 18. juli
04:18
04:18 Modeller · Lenke · DEV Community
Unsloth slipper Qwen3.6-27B i NVFP4 med 2,5x raskere gjennomstrømning
Fredag 17. juli
12:27
12:27 Lokale-modeller · 2 min · GitHub
AMD ROCm 7.14 bytter til TheRock byggesystem for lokal KI
04:27
04:27 Kvantisering · 2 min · WinBuzzer
Apple vurderer PrismMLs komprimeringsteknologi for større KI-modeller på iPhone
Onsdag 15. juli
22:50
22:50 Llm · 2 min · Hugging Face - Blog
IBM: GPT-4.1 kostet dobbelt av Claude Sonnet i agent-test, tross lavere pris
16:26
16:26 Lokale-modeller · Lenke · TECHi
llama.cpp får 4,26x raskere prefill på Intel Arc, men bare i et smalt tilfelle
00:14
00:14 Selvhostet · Lenke · Simon Willison's Weblog
Lobsters kjører nå på SQLite: 3,8 GB database på én enkelt VPS
Tirsdag 14. juli
16:24
16:24 Kvantisering · 2 min · Baseten
StepFun slipper Step 3.7 Flash: 198 milliarder parametre på fire H100-kort
06:42
06:42 Claude-code · 2 min · Release notes from claude-code
Claude Code 2.1.208 tetter minnelekkasjer og krymper transkripsjoner opptil 79 ganger
Mandag 13. juli
11:23
11:23 Forskning · 2 min · Ganesh Nanduru (personlig blogg)
Enkeltutvikler slipper åpne treningskjerner for MiniMax sparse attention
04:24
04:24 Openai · 3 min · Ploy
Ploy bytter fra Claude Opus til GPT-5.6 Sol: 2,2x raskere og 27 prosent billigere i produksjon
02:42
02:42 Forskning · 2 min · groundtruth.day
NVIDIAs Puzzle krymper 120B-modellen til 75B og dobler gjennomstrømningen
Søndag 12. juli
20:28
20:28 Lokale-modeller · Lenke · AI | The Verge
M7 Ultra kan få 1,5 TB RAM, arven fra Apples døde bilprosjekt
12:34
12:34 Verktøy · 2 min · Archynewsy
NVIDIA Vera satser på enkelttråd-fart: 1,8 ganger x86-ytelse per kjerne i agent-løkker
08:28
08:28 Lokale-modeller · 3 min · Andryo Marzuki
Utvikler fikset tre cache-bugs og kuttet prefill fra 88 sekunder til 0,64 på Mac Studio
04:18
04:18 Lokale-modeller · 2 min · DEV Community
Utvikler kuttet TTFT 9,9x på Android ved å gjenbruke llama.cpp KV-state
Lørdag 11. juli
16:37
16:37 Lokale-modeller · 2 min · byteiota
Nvidia dropper draft-modellen i spekulativ dekoding med nye Nemotron-vekter
12:31
12:31 Lokale-modeller · 2 min · TechAmerica.ai
Fransk startup ZML lanserer gratis inferensplattform på tvers av brikkeleverandører
Fredag 10. juli
20:14
20:14 Modeller · 2 min · Chutes
Chutes trente en rekurrent modell desentralisert uten synkroniseringsstopp
16:28
16:28 Koding · 3 min · Ello
Ello kastet standard agent-løkke for å holde svartiden under ett sekund
10:46
10:46 Hugging-face · 2 min · Hugging Face - Blog
Hugging Face profilerer attention: math-backenden er 3,7 ganger tregere enn naiv PyTorch-kode
00:53
00:53 Ytelse · 2 min · AI News & Artificial Intelligence | TechCrunch
Nvidia falt 15 prosent mens Micron nesten tredoblet seg: minne er den nye flaskehalsen
00:41
00:41 Google · 2 min · Google Developers Blog
Google slipper LiteRT.js: kjør .tflite-modeller i nettleseren opptil 3x raskere
Torsdag 9. juli
20:50
20:50 Lokale-modeller · 2 min · MarkTechPost
Komprimert Nemotron kjører åtte 1M-forespørsler på én H100
04:33
04:33 Modeller · 2 min · NVIDIA Blog
LangChain: Nemotron 3 Ultra matcher lukkede modeller til en tidel av prisen
00:24
00:24 Modeller · 3 min · The Decoder
Grok 4.5: åtte ganger billigere enn Fable 5, 17 poeng svakere på DeepSWE
Onsdag 8. juli
20:24
20:24 Anthropic · Lenke · The Decoder
Claude Fable 5 topper alle åtte industri-benchmarks, til over 100 ganger prisen
10:39
10:39 Verktøy · Lenke · AI News & Artificial Intelligence | TechCrunch
ZML slipper gratis inference-server som kjører på fem brikkefamilier
00:38
00:38 Lokale-modeller · Lenke · LavX News
AMD lanserer Ryzen AI Halo-arbeidsstasjon på 3999 dollar for lokal KI
Tirsdag 7. juli
20:20
20:20 Modeller · 3 min · IT Brief UK
Sber slipper GigaChat 3.5 Ultra som open source: 432B MoE med lineær oppmerksomhet
04:23
04:23 Llm · 2 min · Kapa.ai
Kapa.ai kutter 68 prosent av RAG-konteksten uten å miste svar-treffsikkerhet
02:55
02:55 Modeller · 1 min · Hugging Face
Tencent slipper Hy3 under Apache 2.0: 295 milliarder parametre, slår GLM-5.1 i egen blindtest
Mandag 6. juli
16:42
16:42 Ytelse · Lenke · The Decoder
Nvidias Kyber NVL144 utsatt til 2028, asiatiske leverandører faller
12:27
12:27 Ytelse · 2 min · Edgee
Compressor V2 kutter KI-agent-kostnader med 50 prosent via tre komprimeringslag
08:13
08:13 Hugging-face · 3 min · Hugging Face - Blog
Hugging Face Kernels laster nå bare betrodde utgivere som standard
Søndag 5. juli
12:38
12:38 Modeller · 1 min · Tech Times
Poolside Laguna XS 2.1: gratis kodemodell med DFlash som kjører på én GPU
12:37
12:37 Lokale-modeller · 1 min · 36Kr (QbitAI)
mlx-dspark: uavhengig utvikler porterte DeepSeeks DSpark til Apple Silicon
Lørdag 4. juli
16:19
16:19 Modeller · Lenke · Federico Cutroni
Cerebras kjører Kimi K2.6 nesten 7x raskere enn beste GPU-sky for agentisk koding
12:46
12:46 Forskning · Lenke · arXiv
Program-as-Weights: en 0,6B-modell matcher 32B ved å kompilere oppgavelogikk til vekter
12:40
12:40 Forskning · Lenke · MarkTechPost
NVIDIA ASPIRE: robotrammeverk som forbedrer seg selv, treffer 31 prosent på lange LIBERO-Pro-oppgaver
04:20
04:20 Lokale-modeller · 1 min · Wafer AI
GLM-5.2 kjører 2626 tokens/sek per node på AMD MI355X til under halve Blackwell-prisen
00:18
00:18 Sikkerhet · 2 min · Let's Data Science
PagerDuty-toppsjef advarer: KI-agenter feiler stille, ikke med et krasj
Fredag 3. juli
20:22
20:22 Claude-code · 2 min · GitHub (pxpipe)
pxpipe kutter Claude Code-kostnaden ved å rendre kontekst som bilder
12:26
12:26 Modeller · 2 min · MarkTechPost
Interfaze åpner diffusjonsbasert talegjenkjenning for seks språk
Torsdag 2. juli
08:30
08:30 Modeller · Lenke · DataCentreNews UK
Nvidia kutter token-kostnaden for DeepSeek V4 med opptil 5x gjennom programvareoptimalisering
08:20
08:20 Forskning · Lenke · AIJourn
STAR-KV komprimerer KV-cache opptil 20x, valgt som ICML 2026-spotlight-artikkel
Onsdag 1. juli
20:22
20:22 Forskning · 2 min · The Register
SEMQ-metoden kutter minnebruk for KI-modeller uten å tape nøyaktighet
16:22
16:22 Modeller · 2 min · MarkTechPost
NVIDIA slipper Nemotron-Labs-TwoTower: diffusjonsmodell med dobbel gjennomstrømning
14:50
14:50 Selvhostet · 2 min · LavX News
ZLUDA 6 bringer CUDA-kompatibilitet til AMD GPU-er
08:26
08:26 Google · 1 min · TechCrunch
Google lanserer Nano Banana 2 Lite: raskere og rimeligere bildegenerering
06:46
06:46 Lokale-modeller · 2 min · The Decoder
DeepSeek slipper DSpark: opptil 85 prosent raskere inferens under strammere eksportkontroll
06:45
06:45 Forskning · Lenke · Hacker News - Newest: ""AI" "LLM" "Claude""
Sophon PFG-1: foreslått KI-brikke med 330 GB DRAM on-die og null HBM
04:50
04:50 Llm · Lenke · AI News & Artificial Intelligence | TechCrunch
Nvidia-utfordrer Etched til 5 mrd dollar med inference-brikke og 1 mrd dollar i ordre
02:54
02:54 Claude · Lenke · Hacker News - Newest: ""AI" "LLM" "Claude""
Claude Sonnet 5: benchmark-resultater
Tirsdag 30. juni
08:21
08:21 Llm · 2 min · TechTimes
DFlash knekker spekulativ dekoding: 15x raskere inferens på Blackwell GPU-er
Mandag 29. juni
20:18
20:18 Lokale-modeller · 2 min · Quesma
Qwen 3.6 27B: 27 milliarder parametre slår 397 milliarder på koding
16:25
16:25 Lokale-modeller · Lenke · MarkTechPost
Liquid AI sender LFM2.5-230M: liten modell kjører lokalt via llama.cpp, MLX og vLLM
16:20
16:20 Llm · Lenke · HTX Insights
DeepSeek V4 DSpark: ny spekulativ dekodingsramme øker inferenshastigheten med 80 prosent
04:19
04:19 Modeller · 2 min · TechTimes
NVIDIA Vera Rubin tredobler minnebåndbredden mot Blackwell og kutter tokenkostnad ti ganger
Søndag 28. juni
22:48
22:48 Lokale-modeller · 2 min · MarkTechPost
DeepSeek åpner DSpark: spekulativ dekoding gir 60 til 85 prosent raskere V4-inferens
Søndag 14. juni
18:20
18:20 Lokale-modeller · 2 min · VideoCardz
AMD Ryzen AI Halo-PC med 128 GB minne nå tilgjengelig for 3 999 dollar
12:04
12:04 Lokale-modeller · 2 min · MarkTechPost
Zyphra slipper Zamba2-VL: hybrid Mamba2-modell kutter tid til første token med rundt ti ganger
11:59
11:59 Llm · Lenke · Wccftech
NVIDIA GB300 håndterer 61 000 KI-agenter per megawatt, 20 ganger Hopper, i ny benchmark
Tirsdag 9. juni
18:39
18:39 Lokale-modeller · 2 min · MarkTechPost
Xiaomi MiMo og TileRT presser en billionparameter-modell forbi 1000 tokens per sekund på vanlige GPU-er
Tirsdag 19. mai
22:21
22:21 Google · 2 min · Ars Technica
Gemini 3.5 Flash: 300 tokens i sekundet med frontier-ytelse og Omni do-anything-modell
15:24
15:24 Lokale-modeller · 3 min · Startup Fortune
llama.cpp dobler Qwen3.6 27B med Multi-Token Prediction: 7,4 til 18,1 t/s på Strix Halo
Torsdag 14. mai
22:22
22:22 Modeller · 2 min · Crypto Briefing
OpenAI lanserer GPT-5.3-Codex-Spark: første produkt på Cerebras-maskinvare
14:34
14:34 Utvikling · 3 min · aiHola
Coding Agent Index: Cursor CLI med Opus 4.7 topper første tverr-stack-benchmark
Onsdag 13. mai
18:28
18:28 Modeller · 2 min · VentureBeat
Perceptron Mk1: video-analyse 80 til 90 prosent billigere enn Anthropic, OpenAI og Google
Mandag 11. mai
22:18
22:18 Kvantisering · 3 min · jola.dev
Lokale modeller på M4 med 24 GB minne: hva som faktisk er brukbart
18:14
18:14 Llm · 3 min · MarkTechPost
Sakana og NVIDIA gjør LLM-inferens 20,5 prosent raskere med TwELL: ren CUDA, ingen arkitekturendring
Søndag 10. mai
18:33
18:33 Lokale-modeller · 3 min · Hackaday
Brukt server-GPU til 200 dollar kjører LLM bedre enn RTX 3060
Lørdag 9. mai
14:16
14:16 Modeller · 2 min · CnTechPost
Baidu lanserer Ernie 5.1: pretrening koster 6 prosent av tilsvarende modeller
06:36
06:36 Utvikling · 2 min · Modular
Modular slipper Mojo 1.0 Beta: Python-syntaks med C++-ytelse og GPU-kjerner i ett språk
Fredag 8. mai
14:12
14:12 Lokale-modeller · 2 min · Tom's Hardware
Hovedkortsalget faller 28 prosent: KI-fabrikker spiser komponentene du trenger til lokale modeller
02:16
02:16 Openai · 3 min · InfoQ
OpenAI bytter Responses API til WebSocket: 40 prosent kortere agent-latens i Vercel, Cline og Cursor
Torsdag 7. mai
22:16
22:16 Lokale-modeller · 2 min · GitHub (Blaizzy/mlx-vlm)
mlx-vlm v0.5.0: kontinuerlig batching, MTP-spekulering og Gemma 4-video på Apple Silicon
22:13
22:13 Lokale-modeller · 2 min · GitHub (antirez/ds4)
antirez slipper ds4: dedikert Metal-motor for DeepSeek V4 Flash, 2-bit kvantisering, KV-cache på SSD
14:27
14:27 Google · 2 min · Belitsoft
Google legger multi-token-prediksjon til Gemma 4: opptil 3,1× raskere lokalt uten å endre kvaliteten
10:23
10:23 Modeller · Lenke · Winbuzzer
OpenAI gjør GPT-5.5 Instant til ny standardmodell, hevder over 50 prosent færre hallusinasjoner
10:16
10:16 Google · 2 min · InfoQ
Google deler TPU 8 i to varianter: 9 600 brikker per superpod for trening, 288 GB minne per chip for agent-inferens
Onsdag 6. mai
22:32
22:32 Lokale-modeller · 2 min · Ollama / GitHub Releases
Ollama v0.23.1: Gemma 4 MTP gir over 2x fart på Mac for kodingsoppgaver
18:44
18:44 Ytelse · 2 min · Reflex Blog
Computer-use 45 ganger dyrere enn struktur-API i Reflex-benchmark
Tirsdag 5. mai
22:51
22:51 Google · 2 min · Google
Gemma 4 får MTP-drafters: opp til 3x raskere lokal inferens uten kvalitetstap
10:08
10:08 Modeller · 2 min · Wccftech
NVIDIAs åpne Nemotron 3 Super topper EnterpriseOps-Gym med 27,3 poeng og slår DeepSeek og Kimi
02:09
02:09 Openai · 2 min · OpenAI Engineering Blog
OpenAI: slik holder vi 900 millioner stemme-sesjoner i gang uten merkbar latens
Mandag 4. mai
06:25
06:25 Llm · 2 min · InfoQ
Cloudflare splitter LLM-prosessering i to: Infire kjører Kimi K2.5 på 8 H100-er
Lørdag 2. mai
18:12
18:12 Modeller · 3 min · DeepLearning.AI The Batch
GPT-5.5 vant intelligens-indeksen, men hallusinerer 85 % av tiden den ikke vet svaret
10:16
10:16 Llm · 2 min · XDA Developers
En uke uten Claude Pro: lokal Qwen 3.5 9B taklet alt unntatt render-panelet
Fredag 1. mai
18:28
18:28 Modeller · 2 min · dataphoenix.info
DeepSeek V4: åpen 1,6T-modell med MIT-lisens nær GPT-5.5 til en sjettedel av prisen
14:18
14:18 Forskning · Lenke · Interesting Engineering
Lumai Iris Nova: optisk datamaskin kjører Llama 70B med 90 prosent mindre strøm
14:16
14:16 Google · 1 min · AI Pressa
Google TurboQuant: KV-cache-kompresjon kutter minnebruk 6x uten retrening
Torsdag 30. april
18:15
18:15 Utvikling · Lenke · SiliconANGLE
Runpod Flash: skriv Python lokalt, få auto-skalerende inferens-endepunkt uten Docker
Tirsdag 28. april
02:18
02:18 Ytelse · 2 min · GitHub (Show HN)
Open source-agenten Dirac topper TerminalBench 2.0 med 65,2 prosent og 64,8 prosent lavere kostnad
Søndag 26. april
10:19
10:19 Forskning · 3 min · Victor Taelin
LamBench tester KI-modeller på lambda-kalkyle — Opus 4.6 og GPT-5.3 Codex deler førsteplassen
Onsdag 22. april
22:13
22:13 Google · 2 min · Ars Technica
Google deler TPU i to: 8t for trening, 8i for inferens, dobbel ytelse per watt
Mandag 20. april
18:13
18:13 Lokale-modeller · Lenke · The Verge
RAM-mangelen kan vare til 2030 — lokal inferens blir dyrere lenge
02:09
02:09 Lokale-modeller · 2 min · Startup Fortune
llama.cpp fletter inn spekulativ sjekkpunkting: 40 prosent mindre VRAM, 20 prosent flere tokens
Lørdag 18. april
10:11
10:11 Forskning · Lenke · Cloudflare Research
Cloudflare komprimerer LLM-vekter tapsfritt — 2,6 bits entropi per BF16-eksponent
Fredag 17. april
22:17
22:17 Claude · Lenke · Claude Code Camp
Opus 4.7 bruker 1,33x flere tokens enn 4.6 — måling av den nye tokenizeren
Torsdag 16. april
22:19
22:19 Llm · 2 min · Simon Willison
21GB Qwen3.6 på en laptop tegnet bedre pelikan enn Claude Opus 4.7
Onsdag 15. april
16:10
16:10 Google · Lenke · GizmoWeek
Google Gemma 4 kjører direkte på iPhone med full offline-inferens
Tirsdag 14. april
20:12
20:12 Llm · 2 min · Artificial Analysis
Åpne modeller under 32B parametre matcher nå GPT-5-nivå ytelse
Mandag 13. april
20:16
20:16 Lokale-modeller · Lenke · EE Times
ROCm tar opp kampen mot CUDA: AMD satser steg for steg
Søndag 12. april
14:19
14:19 Verktøy · Lenke · Analytics India Magazine
NVIDIA lanserer AITune: åpen kildekode-verktøy for automatisk inferensoptimalisering
Lørdag 11. april
18:14
18:14 Google · Lenke · PyShine
Google lanserer LiteRT-LM: inferens-rammeverk for LLM på kant-enheter
18:14
18:14 Verktøy · Lenke · MarkTechPost
NVIDIA lanserer AITune: velger raskeste inferens-backend automatisk
Tirsdag 7. april
10:25
10:25 Llm · Lenke · XDA Developers
Spekulativ dekoding gjør lokale LLM-er raskere uten maskinvareoppgradering
Mandag 6. april
20:13
20:13 Modeller · Lenke · WinBuzzer