Samme nettside kostet 519 kreditter hos Claude Opus 5 og 2,4 hos DeepSeek V4 Flash
Kostet samme nettside-oppdrag 519 kreditter hos Claude Opus 5 og 2,4 hos DeepSeek V4 Flash i Netlifys test av elleve modeller.
519 mot 2,4. Det er spennet Netlify målte da de ga elleve modeller det samme oppdraget tre ganger hver: bygg en enkeltside for en nabolagskafé med åpningstider, adresse, en kort meny og et bilde. Claude Opus 5 landet på 519 kreditter i snitt, DeepSeek V4 Flash i 0731-revisjonen på 2,4. Testen er publisert på Netlifys egen blogg og dekker bare det første av tre scenarioer.
Snittet for Opus er dratt opp av én enkelt kjøring. To av de tre landet på 253 og 249 kreditter, mens den tredje brukte 1 055, omtrent fire ganger mer enn noen annen kjøring i hele testen. Netlify beskriver det som et gjentakende mønster: Opus har en tendens til å løpe av med kredittbruken sammenlignet med sin egen normale bunnlinje, uten at resultatet blir garantert bedre eller dårligere.
Rangeringen følger ikke prislappen på modellene. Netlify skriver at GPT 5.6 Sol på lav tenketid slo Anthropics mellomklassemodell Sonnet 5 på designintuisjon i denne oppgaven, til omtrent samme kredittbruk. Et hakk ned i OpenAIs stige ligger GPT 5.6 Terra på 39 kreditter, med et annet visuelt språk uten å være tydelig dårligere. Gemini 3.1 Pro brukte 53 kreditter og leverte så lite at Netlify ikke tok med lenker til resultatene, mens den nyere Gemini 3.6 Flash brukte dobbelt så mye og jobbet merkbart hardere med innholdet.
For de åpne modellene er bildet delt. Kimi K3 landet på 102 kreditter, men Netlify påpeker at modellen er bygget for langhorisont-agentoppgaver og ikke for designledet arbeid. GLM 5.2 kom ut på 27 kreditter med tre kjøringer som virket som de kom fra ulike modeller, og siden 5.2 er ren tekst kan den ikke ta imot skjermbilder som designreferanse slik Kimi-modellene kan. DeepSeek V4 Pro leverte for 37 kreditter en side der HTML-en pekte på en bildefil som ikke fantes i prosjektet.
Kredittene er den delen som treffer lommeboken direkte. Gratisplanen hos Netlify har 300 kreditter, Personal 1 000 og Pro 3 000, med påfyll til 10 dollar per 1 500 kreditter. Én uheldig Opus-kjøring på 1 055 kreditter spiser altså mer enn hele gratiskvoten.
Bakgrunn
Testen kom sammen med en avtale mellom Netlify og OpenRouter som gir prosjekter tilgang til alle OpenRouter-modeller gjennom Netlifys AI Gateway, og som utvider modellutvalget i Agent Runners med blant annet Kimi K3, GLM 5.2 og DeepSeek V4. Netlify la samtidig til OpenCode som agentvalg ved siden av Claude Agent, OpenAI Codex og Gemini CLI, fordi de eksisterende agentene er optimalisert for sine egne leverandørmodeller. Tre kjøringer per modell er et tynt grunnlag, og Dan Luu viste nylig at støyen mellom kjøringer kan være større enn forskjellen mellom modelloppsettene. Netlifys systematiske evalueringer går gjennom AXIS, deres eget rammeverk som nå er åpen kildekode. For deg som bygger betyr spennet at modellvalg er en budsjettbeslutning like mye som en kvalitetsbeslutning, og at den dyre modellen ikke er dyr på en forutsigbar måte.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.