Hopp til hovedinnhold
Tilbake
Verktøy 3 min · Kilde: The Decoder

Optima lar deg bygge benchmark på egne data og måler kostnad per oppgave

KI Takeaway KI-generert · kan inneholde feil

Bygg din egen benchmark på dine egne data i Optima, som måler kvalitet, kostnad per oppgave og tid per oppgave i samme kjøring.

Offentlige benchmarks sammenligner modeller på forhåndsdefinerte oppgaver og kriterier, og sier derfor lite om hvilken modell som er best i akkurat din arbeidsflyt. Artificial Analysis, kjent for uavhengige LLM-evalueringer og implementasjoner som GDPval-AA og AA-Briefcase, har lansert Optima for å tette det gapet. Plattformen er tilgjengelig nå.

Du kan komme dit fra tre kanter. Last opp et evalueringsdatasett fra egne filer eller fra Hugging Face, importer agent-traces fra plattformer som Arize, Braintrust eller Langfuse, eller installer en skill som samler informasjon fra kodemiljøet ditt og tidligere sesjoner. Har du ingenting av dette, beskriver du bruksområdet med eksempel-input og eksempel-output, og Optima foreslår testinput, evalueringskriterier og oppgaver som du kan justere før kjøring. Scoringen er enten rubrikkbasert mot objektive kriterier, eller parvis, der du først rangerer et utvalg svarpar og systemet utleder resten.

Den interessante delen er at kostnad og tid er egne sammenligningsakser, ikke fotnoter. For agentiske oppsett sier ren tokenpris nesten ingenting: en billigere modell kan ende opp dyrere hvis den trenger flere forsøk, feiler oftere eller etterlater opprydding. Kostnad per fullførte oppgave er tallet som faktisk treffer regningen. Artificial Analysis oppgir at tidlige testere bygde benchmarks for finans- og regnskapsagenter og fant modeller som kuttet kostnaden med en faktor ti uten stort kvalitetstap.

Prisingen er uten påslag på tokenene. Rubrikkbasert evaluering koster 0,125 dollar per kriterium per modell, parvis evaluering 0,375 dollar per sammenligning, og plattformen holder av et beløp basert på et kostnadsestimat før hver kjøring.

Grunnen til at dette er verdt tiden din, er hvor skjøre de offentlige tallene er. En analyse fra Epoch AI viste at resultater avhenger av implementasjonsdetaljer som sjelden oppgis, som promptformulering og temperatur. På agentiske benchmarks som SWE-bench sto bytte av scaffold alene for opptil 15 prosentpoeng forskjell. En gjennomgang av 445 benchmark-artikler fant metodiske svakheter i minst ett område i nesten alle, og bare rundt 10 prosent brukte komplette, virkelighetsnære oppgaver.

En skreddersydd benchmark fjerner ikke de metodiske problemene. Den flytter dem til deg: nytten avhenger av hvor presist du definerer evnen du måler, hvor representative testtilfellene er, og hvordan evalueringen faktisk implementeres.

Hva bør du gjøre?

  1. Start med agent-traces du allerede har liggende i Arize, Braintrust eller Langfuse. Det gir en benchmark på ekte trafikk i stedet for oppgaver du finner på i dag.
  2. Mål kostnad per fullførte oppgave, ikke per token, før du bytter modell. Det er der en billigere modell med flere forsøk avslører seg.
  3. Skriv ned kriteriene og testutvalget sammen med resultatet. Uten det er din egen benchmark like udokumentert som de offentlige du forlot.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter