IBM leverer samme agent-minne som ACE for en sjuendedel av tokenene
Leverer IBM Researchs ALTK-Evolve samme eller bedre treffsikkerhet enn ACE på AppWorld, til under halvparten så mange tokener per oppgave.
To systemer løser samme problem på motsatt måte. Begge gjør en agents tidligere kjøringer om til gjenbrukbare lærdommer som mates inn ved inferens, uten vektoppdateringer og uten menneskelige merkelapper. ACE, altså Agentic Context Engineering, dyrker fram én samlet spillebok og injiserer hele boka på hvert steg. ALTK-Evolve, som IBM Research presenterte i en gjennomgang på Hugging Face, behandler leveransen som en skru du kan vri på.
Forskjellen ligger to steder:
- Konsolidering. ALTK-Evolve klynger nesten like lærdommer og slår dem sammen støttebevarende, slik at den overlevende arver den samlede tellingen. Lærdommene er typede, med årsaksattribusjon tilbake til kjøringen de kom fra.
- Leveranse. I stedet for hele spilleboka sendes en liten fast kjerne av godt understøttede retningslinjer, utvidet med en håndfull valgt for oppgaven som står for tur.
Det er leveransen som avgjør regningen. På AppWorld med DeepSeek-V3.2 og samme ReAct-agent i bunnen scoret ACE 80,4 i oppgaveløsning til 634 000 tokener per oppgave, mens ALTK-Evolve scoret 89,3 til 263 000. På den svakere gpt-oss-120b endte de likt på treffsikkerhet, 56,0 mot 54,8, men til 116 000 tokener mot 777 000.
Fordelingen etter vanskelighetsgrad forklarer hvorfor. På gpt-oss-120b leder ACE på lette og middels oppgaver, der en fyldig ledetekst hjelper mer enn den forstyrrer. På de harde snur det, 31,8 mot 23,8, fordi modellen der må plukke riktig lærdom i stedet for å vasse gjennom alle.
IBM kjørte ACE selv på samme splitt og samme grunnmodeller, siden ACE-artikkelen rapporterer på DeepSeek-V3.1. Tallene er enkeltkjøringer, pass@1, over 168 oppgaver i AppWorlds test_normal.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.