Hopp til hovedinnhold
Tilbake
Koding 3 min · Kilde: NVlabs

SoL-Pi fra NVlabs kutter tokenbruken i kodeagenten Pi nesten i to

KI Takeaway KI-generert · kan inneholde feil

Test SoL-Pi hvis kodeagenten din jobber i timevis, for de fire mekanismene NVlabs fant med automatiserte forskningsløkker kutter tokenbruken i Pi med 45–49 prosent og beholder rundt 94 prosent av scoren.

8,75–13,50 dollar i timen sparer en forsker som jobber med ett problem på å bruke SoL-Pi i stedet for Codex eller Claude Code, ifølge NVlabs, forskningsmiljøet til NVIDIA. SoL-Pi bygger på Pi, en lettvekts og utvidbar kodeagent, og samler mekanismene som automatiserte forskningsløkker fant da de lette etter svinn. Mot Codex og Claude Code bruker SoL-Pi 35–64 prosent færre tokens, og API-kostnaden etter listepris er 50–54 prosent lavere. Sammenlignet med Pi selv er kostnaden omtrent en tredjedel lavere.

Av 152 foreslåtte ideer overlevde fire. Action Fusion slår sammen en filendring og kommandoen som tester eller bygger den til ett verktøykall, så agenten slipper en ekstra runde til modellen. ObservationPack arkiverer store verktøyresultater lokalt og legger bare igjen et håndtak og et kort utdrag i konteksten, med nøyaktig gjenfinning av sidene ved behov. Online Context Compact vurderer komprimering hver gang en deloppgave er ferdig, men gjør det bare når forventet besparelse kan betale for omskrivingen. Evidence-Preserving Reducer lar en billigere agent lese lange bygge- og testlogger først, og hver siterte linje sjekkes mot den arkiverte loggen før toppmodellen ser kvitteringen.

«Delegering krever ikke lenger tillit til et velformulert sammendrag» — Haozhe Liu og medforfatterne, NVlabs

Kravet var at besparelsen ikke skulle komme av at agenten gjør mindre. Hver kandidat måtte holde alle kapabilitetsmål innenfor en forhåndsbestemt toleranse og samtidig forbedre minst ett effektivitetsmål. Små tap per mekanisme hoper seg likevel opp. Samlet beholder SoL-Pi rundt 94 prosent av Pis snittscore på EdgeBench, men med GPT-5.6 Sol slår den modellens egen Codex.

«En agent kan også redusere tokenbruken rett og slett ved å gjøre mindre» — SoL-Pi-rapporten, om hvorfor kvalitetsgulvet trengs

Målingene er gjort på EdgeBench, 51 langvarige oppgaver som ble holdt helt utenfor søket. Forfatterne valgte testen fordi den gir sammenhengende arbeid på omtrent to til tolv timer, mens Terminal-Bench 2.1 og SWE-bench som regel er ferdige på under en time. På korte oppgaver drukner små besparelser per runde i oppstartskostnader og variasjon mellom oppgavene.

Hva bør du gjøre?

  1. Kjører du Pi i lange økter, finn de fire mekanismene i egne utvidelsesmapper i SoL-Pi-repoet til NVlabs på GitHub og vurder dem hver for seg.
  2. Mål effekten på oppgaver som varer i timevis, siden forfatterne fant at små besparelser per runde skjules av oppstartskostnader på korte oppgaver.
  3. Test mot dine egne oppgaver før du bytter, for SoL-Pi beholdt rundt 94 prosent av Pis snittscore, ikke hele.

Bakgrunn

SoL-Pi er et forsøk på det forfatterne kaller rekursiv selvforbedring: å la KI gjøre maskineriet rundt seg selv mer effektivt før det skaleres opp. Hver idé fikk sin egen forskningsløkke etter Karpathys autoresearch-mønster, og søket gikk på 535 kjørbare treningsmiljøer, der 495 er hentet fra par av issues og pull requests på GitHub. Bredde slo dybde. Selv GPT-5.6 Sol på xhigh kunne kjøre seg fast i samme design etter fem til ti iterasjoner, og bare omtrent én av 40 startideer overlevde valideringen. Mennesker satte premissene på forhånd og ryddet opp i koden til mekanismene som overlevde.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter