Hopp til hovedinnhold

Lørdag 10. oktober

 Tilbake Openai 2 min 00.15

Asana kuttet nettleseragentens modellkostnad 76 ganger, men mesteparten kom fra caching og ikke modellbytte

lørdag 10. oktober · KI-generert · Kilde: OpenAI News

Innholdet er KI-generert og kan inneholde feil. Sjekk originalkilden.

Cache den voksende historikken til agenten din, ikke bare systemprompten, for det var der Asana fant mesteparten av et kostnadskutt på 76 ganger i nettleseragenten sin.

OpenAI presenterer kundehistorien som en seier for GPT-6.1 Sol, men Asanas egne tall deler kuttet i to. Nettleseragenten i StackAI, plattformen Asana har kjøpt opp, kostet minst 36,21 dollar per kjøring på den opprinnelige produksjonsmodellen, kalt Model B. Med optimalisert arbeidsflyt falt samme modell til 1,24 dollar, et kutt på 29 ganger. Byttet til GPT-6.1 Sol tok den videre til 0,47 dollar, ytterligere 2,6 ganger. Model B kommer fra en annen frontlab, som ikke navngis.

Feilen var klassisk prompt-caching. Agenten cachet de faste instruksene og verktøydefinisjonene, men ikke den voksende historikken med sidetekst og skjermbilder, så hvert kall sendte historikken på nytt til full pris. Den fjernet også gamle skjermbilder og trimmet tekst i nesten hvert steg, og hver slik endring brøt cachen. Løsningen ble å cache historikken, øke historikkbudsjettet fra 120 000 til 480 000 tegn og la skjermbildene hope seg opp til 20 før agenten kuttet ned til det siste. På GPT-6.1 Sol alene falt kostnaden fra 1,97 til 0,47 dollar. Hvert kall ble omtrent tre ganger billigere, fordi 89 prosent av input kom fra cache til 5 prosent av ordinær pris.

Budsjettet påvirket også om agenten på GPT-6.1 Sol leverte i det hele tatt. Med det lille historikkbudsjettet ga 3 av 18 kjøringer et svar, med det store ga alle 18 riktig svar. Testoppgaven var å hente seks felter for 32 bøker fra en offentlig demokatalog, og hele studien besto av 144 kjøringer som GPT-6 Astra i Codex satte opp og kjørte.

«Jeg satte et /goal før jeg la meg og gikk gjennom resultatene om morgenen.» — Frank Hidalgo, teknologidirektør for StackAI i Asana

Hva bør du gjøre?

  1. Sjekk hva agentens cache faktisk dekker. Prompt-caching treffer bare et uendret prefiks, så hver endring tidlig i historikken gjør resten av kallet dyrt igjen.
  2. Beskjær konteksten i batcher i stedet for i hvert steg, slik at prefikset holder seg likt over flere kall.
  3. Mål kostnad per vellykket kjøring, ikke per kall, siden et for lite historikkbudsjett kan gi billige kjøringer som ikke leverer svar.

Pulsen · norske KI-nyheter for deg som bygger. Sakene er KI-generert fra originalkilden, som alltid lenkes.