Hopp til hovedinnhold

Søndag 11. oktober

Vals AI: agentteam kostet opptil 5,1 ganger mer og ga bedre apper i bare én av fire tester

søndag 11. oktober · KI-generert · Kilde: Vals AI

Innholdet er KI-generert og kan inneholde feil. Sjekk originalkilden.

Regn med 1,8 til 5,1 ganger høyere regning når én KI-agent deler jobben med underagenter, og sjelden en målbart bedre app, viser en ny test fra Vals AI.

122 dollar per app kostet Claude Opus 5.5 som agentteam på maks reasoning effort, mot 4,08 dollar som enkeltagent på medium, og teamet scoret under to poeng høyere. Tallet er fra en ny test fra evalueringsselskapet Vals AI, der GPT 6 Sol og Opus 5.5 bygde 50 komplette webapper i Vibe Code Bench, både alene og som team med inntil fem underagenter samtidig. Opus kjørte i Claude Code CLI i headless-modus.

Av fire sammenligninger mellom team og enkeltagent var bare én statistisk signifikant: Sol på medium effort gikk fra 77,6 til 84,9 prosent beståtte UI-tester (p = 0,005). De tre andre forskjellene lå mellom −0,3 og +3,4 poeng. For Sol ga det mer å skru opp reasoning effort enn å bruke team, for maks effort løftet enkeltagenten 11,4 poeng.

Mesteparten av merkostnaden er cachet input. Hver underagent har egen kontekst som sendes på nytt ved hvert modellkall. På maks effort leste Opus' underagenter en median på 224 millioner cachede tokens per app, mot 55 millioner for enkeltagenten.

Nøkkeltall
$1,22
Sol alene på medium, 77,6 % score
$3,07
Sol-team på medium, 84,9 % score
$4,08
Opus 5.5 alene på medium, 91,5 % score
$122
Opus 5.5-team på maks, 93,2 % score

Modellene orkestrerte ulikt. Sols leder delte appen i database, API, grensesnitt og deploy i løpet av første minutt og testet resultatet selv, og på maks effort falt kjøretiden fra 38 til 28 minutter. Opus' leder skrev først en felles CONTRACT.md med skjema, API-ruter og fileierskap, og delegerte så i bølger. Det gjorde teamet opptil 2,3 ganger tregere enn enkeltagenten.

«These observations come from one benchmark of full-stack web apps and may not carry over to other kinds of work.» — Vals AI

For deg som bruker underagenter i Claude Code er poenget at Opus' billigste oppsett, én agent på medium, scoret omtrent like godt som det dyreste. Vals AI tror team gjør mest nytte på oppgaver med mange uavhengige deler, som store kodebaser og bred research.

Pulsen · norske KI-nyheter for deg som bygger. Sakene er KI-generert fra originalkilden, som alltid lenkes.