Hopp til hovedinnhold
Tilbake
Llm 2 min · Kilde: Kapa

Kapa-benchmark: grep-agent matcher tunet RAG på 0,61, men bruker 13 til 17 sekunder per søk

KI Takeaway KI-generert · kan inneholde feil

Mål søket ditt før du bytter til agentisk grep: i Kapas nye benchmark nådde en grep-agent samme score som en tunet RAG-pipeline, men brukte fire til fem ganger så lang tid.

0,61 er scoren både en grep-agent drevet av OpenAI-modellen gpt-6.1-sol og Kapas egen faste søkepipeline fikk i Company Knowledge Bench, som Kapa publiserte 2. oktober. Kapa selger en plattform som gjør dokumentasjon, tickets, Slack og wikier søkbare for agenter, og testen består av 1000 ekte produksjonsspørringer. Grep-agentene brukte 13 til 17 sekunder per spørring mot 3,3 for pipelinen, og returnerte rundt 40 000 tokens, der bare én av 25 biter faktisk trengtes.

Hver testcase har spørringen, et øyeblikksbilde av korpuset og et boolsk kriterium for hvilke biter som er gyldige. Målet er et minimalt sett som svarer fullstendig, og autoritative, ferske kilder skal foretrekkes: en referanseside slår en forumtråd som gjentar samme fakta. Kriteriene er skrevet av agenter, kalibrert mot 170 testcaser som mennesker merket for hånd.

Nøkkeltall
0,41
hybrid-søk med gemini-embedding-001, topp 15 biter
0,50
samme søk med Voyage AI rerank-2 over topp 100
0,56
spørringen splittet i opptil tre delspørringer, 1,8 sekunder
0,65
Kapa Deep, selskapets egen søkeagent, på rundt fem sekunder

Rerankeren kostet en tredjedel av et sekund ekstra og ingen flere tokens:

«Hvis du endrer én ting i en enkel RAG-pipeline, legg til en reranker.» — Finn Bauer, Kapa

Modellstyrken betyr også mye. Den mindre gpt-6.1-luna med samme grep-oppsett fikk 0,54, lavere enn pipelinen med delspørringer, som brukte en sjuendedel av tiden. Grep-agenten med gpt-6.1-sol kostet i tillegg rundt 0,17 dollar i modellkall per spørring.

Kapa tar selv et forbehold: alle sju søkemetodene er bygd av selskapet og bruker dokumenter fra selskapets egen pipeline. Benchmarken er dessuten privat fordi den bygger på kundedata, så du kan ikke kjøre den selv.

Mønsteret holder likevel for deg som bygger agenter over intern dokumentasjon: en reranker er billig, mens en grep-løkke på en stor modell koster to ganger, i modellkall og i tokens agenten må lese.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter