Jev som agentvakt: 2,94 dollar mot 372 med en frontiermodell i QueryStorys demo
Vurder en rask beslutningsmodell som Jev eller OpenAIs Decisions API som vakt på hver agenthandling, siden den kan gjøre kontinuerlig overvåking over hundre ganger billigere enn en frontiermodell.
2,94 dollar mot 372 dollar er det TechCrunch oppgir at slik agentovervåking koster med beslutningsmodellen Jev kontra en frontiermodell, i en demo fra Shapor Naghibzadeh i startupen QueryStory. Demoen, bygget på en hackathon forrige helg, sjekker hver handling agenten gjør mot oppgaven den fikk. Handlinger Jev er svært sikker på at er gale, blokkeres, usikre saker flagges for gjennomgang, og resten slipper gjennom.
Bakgrunnen er at OpenAI på DevDay tirsdag lanserte Decisions API, som gir lavprismodellen Luna et fast sett med valg å velge mellom. TechCrunch beskriver det som OpenAIs svar på Jev, som TypeSafe AI slapp tidligere i september.
«Ved å fokusere modellen på det valget kan vi gjøre den ekstremt rask, samtidig som vi beholder egenskaper som bildeforståelse, bred språkstøtte og sikkerhetsbeskyttelse» — Sam Altman, OpenAI
Overvåkingsvinkelen er det nye. Etter flere hendelser der agentene oppførte seg dårlig på det åpne nettet, bruker OpenAI nå en egen modell som ser etter skadelige handlinger, til det TechCrunch kaller en betydelig regnekostnad. En beslutningsmodell som svarer med sannsynligheter i stedet for fritekst, er billig nok til å kjøre på hver eneste handling, ikke bare på stikkprøver.
Samme hackathon viste mønsteret i andre domener. Prosjektet KYC Sentinel lot Jev vurdere om nyhetsartikler handlet om riktig kunde, og gikk gjennom en portefølje på 26 kunder med 37 kall på 0,9 sekunder for 0,0011 dollar. Teamet anslår det til rundt 145 ganger billigere enn samme jobb med en frontiermodell. Tersklene ligger i kode, ikke i prompter, og enhver usikkerhet eller modellfeil sendes til manuell gjennomgang.
Kalibreringen er det åpne spørsmålet. TechCrunch påpeker at det er uklart hvor godt sannsynlighetene fra slike modeller stemmer med virkeligheten, og at ingen utviklere ennå har testet Decisions API grundig.
Hva bør du gjøre?
- Logg agentens verktøykall allerede nå, slik at du har et datasett å teste en beslutningsmodell som vakt mot.
- Legg tersklene for blokkering og flagging i kode, og la usikre svar alltid gå til manuell gjennomgang.
- Mål kalibreringen selv før du stoler på sannsynlighetene, for eksempel ved å sammenligne vaktens avgjørelser med dine egne på noen hundre handlinger.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.