Ny benchmark rangerer sju søke-APIer for KI-agenter på kvalitet, pris og fart
Rangerer sju søke-APIer for KI-agenter på kvalitet, kostnad og fart, og viser at det raskeste per spørring ikke er raskest per oppgave.
Parallel Search i turbo-versjon svarer på 0,51 sekunder per spørring, mot 1,03 sekunder for Basic-versjonen. Likevel ender total tid per oppgave omtrent likt, fordi turbo scorer lavere på kvalitet (67 mot 73) og tvinger agenten til å kjøre flere runder. Det er hovedpoenget i «Search Index», en ny benchmark fra Artificial Analysis som The Decoder omtalte 18. august 2026.
Testoppsettet er bygget for å isolere én variabel. Alle leverandørene kjøres med samme modell, GPT-5.6 Luna, i et standardisert agent-oppsett på Stirrup, Artificial Analysis' eget open source-rammeverk. Agenten får 25 kjøringer per oppgave til å søke og hente websider. Bare søkeleverandøren byttes ut. Startfeltet består av Parallel, Exa, Firecrawl, You.com, Tavily, Keenable og Brave.
Indeksen kombinerer tre likt vektede benchmarks: DeepSearchQA med 900 researchspørsmål som hver krever flere søk, et BrowseComp-utvalg på 200 vanskelig oppdrivelige fakta som krever flerstegs browsing, og AA-Omniscience med 600 spørsmål fordelt på seks kunnskapsdomener. En verktøyfri baseline, der modellen svarer på egen hånd, er sammenligningspunktet.
Den mest nyttige innsikten for den som betaler regningen er at bedre søkekvalitet trekker totalkostnaden ned. Modellen bruker færre tokens når den får gode treff med én gang. Med Parallel Search i avansert modus faller tokenbruken over 40 prosent sammenlignet med Basic. Søkekostnaden per oppgave stiger, men totalen havner lavere: 0,084 dollar mot 0,11.
Artificial Analysis oppgir at Parallel, Firecrawl og Parallel turbo treffer den beste balansen mellom kostnad og ytelse. Metodikken er offentlig, og andre leverandører kan søke om å bli med.
For norske byggere er dette først og fremst en påminnelse om hvordan man måler. Latens per API-kall er tallet leverandørene markedsfører, men regningen din avgjøres av hvor mange runder agenten må ta før den har svaret.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.