Asana kuttet nettleseragentens modellkostnad 76 ganger, men mesteparten kom fra caching og ikke modellbytte
lørdag 10. oktober · KI-generert · Kilde: OpenAI News
Cache den voksende historikken til agenten din, ikke bare systemprompten, for det var der Asana fant mesteparten av et kostnadskutt på 76 ganger i nettleseragenten sin.
OpenAI presenterer kundehistorien som en seier for GPT-6.1 Sol, men Asanas egne tall deler kuttet i to. Nettleseragenten i StackAI, plattformen Asana har kjøpt opp, kostet minst 36,21 dollar per kjøring på den opprinnelige produksjonsmodellen, kalt Model B. Med optimalisert arbeidsflyt falt samme modell til 1,24 dollar, et kutt på 29 ganger. Byttet til GPT-6.1 Sol tok den videre til 0,47 dollar, ytterligere 2,6 ganger. Model B kommer fra en annen frontlab, som ikke navngis.
Feilen var klassisk prompt-caching. Agenten cachet de faste instruksene og verktøydefinisjonene, men ikke den voksende historikken med sidetekst og skjermbilder, så hvert kall sendte historikken på nytt til full pris. Den fjernet også gamle skjermbilder og trimmet tekst i nesten hvert steg, og hver slik endring brøt cachen. Løsningen ble å cache historikken, øke historikkbudsjettet fra 120 000 til 480 000 tegn og la skjermbildene hope seg opp til 20 før agenten kuttet ned til det siste. På GPT-6.1 Sol alene falt kostnaden fra 1,97 til 0,47 dollar. Hvert kall ble omtrent tre ganger billigere, fordi 89 prosent av input kom fra cache til 5 prosent av ordinær pris.
Budsjettet påvirket også om agenten på GPT-6.1 Sol leverte i det hele tatt. Med det lille historikkbudsjettet ga 3 av 18 kjøringer et svar, med det store ga alle 18 riktig svar. Testoppgaven var å hente seks felter for 32 bøker fra en offentlig demokatalog, og hele studien besto av 144 kjøringer som GPT-6 Astra i Codex satte opp og kjørte.
«Jeg satte et /goal før jeg la meg og gikk gjennom resultatene om morgenen.» — Frank Hidalgo, teknologidirektør for StackAI i Asana
Hva bør du gjøre?
- Sjekk hva agentens cache faktisk dekker. Prompt-caching treffer bare et uendret prefiks, så hver endring tidlig i historikken gjør resten av kallet dyrt igjen.
- Beskjær konteksten i batcher i stedet for i hvert steg, slik at prefikset holder seg likt over flere kall.
- Mål kostnad per vellykket kjøring, ikke per kall, siden et for lite historikkbudsjett kan gi billige kjøringer som ikke leverer svar.