Ponytail-skillet kutter 15 % av koden, ikke 54 % som lovet
Målte 15 % mindre kode og 10,3 % lavere kostnad fra Ponytail-skillet, mot 54 % og 20 % i prosjektets egen markedsføring.
Ponytail-prosjektet oppgir 54 % mindre kode, 22 % færre tokens, 20 % lavere kostnad og 27 % kortere tid. JetBrains kjørte 80 parvise oppgaver gjennom sin egen testrigg og landet på 15 % mindre kode, 10,3 % lavere kostnad og 11 % kortere tid. Avstanden mellom de to tallsettene er hele saken.
Ponytail er en skill for Claude Code som tvinger modellen gjennom en stige med spørsmål før den skriver en eneste linje: må dette finnes i det hele tatt, ligger det allerede i kodebasen, klarer standardbiblioteket det, kan det gjøres på én linje. Validering, feilhåndtering, sikkerhet og universell utforming er eksplisitt unntatt fra minimalismen. Testen er tredje del i en serie der JetBrains kjører identiske parvise målinger mot tillegg som lover lavere tokenforbruk. Caveman-skillet oppga 65 % og målte 8,5 %. RTK oppga 60 til 90 % og ga 7,6 % dyrere kjøringer.
«Ponytail virker. Over 80 parvise oppgaver kuttet skillet den typiske regningen med 10,3 % og koden med 15 %, uten kvalitetsforskjell vi klarte å måle.» — JetBrains AI-teamet, i sin konklusjon
Oppsettet er dokumentert i detalj: Claude Code 2.1.201 i headless-modus, claude-sonnet-5 på medium reasoning effort, SkillsBench med 80 parvise oppgaver, til sammen 251 fakturerte agent-kjøringer til 246,09 dollar. Regelsettet som ble injisert i behandlingsarmen ble generert ved å kalle Ponytails eget hook-skript, ikke ved å skrive et sammendrag av det. Hver eneste kjøring ble revidert etterpå for å bekrefte at regelsettet faktisk nådde modellen: 100 % i behandlingsarmen, 0 % i baselinen.
Kvaliteten holdt seg. 65 oppgaver fikk identisk score, 9 ble litt dårligere, 6 litt bedre. JetBrains kaller det et nullresultat og ikke en frikjennelse, fordi 80 oppgaver ikke er nok til å bevise likeverdighet. Det som er utelukket, er den åpenbare feilmodusen der mindre kode i stillhet slutter å bestå testene.
«Vi bygde om benchmarken vår etter kritikk om at tallene kom fra en pratsom baseline.» — Ponytail-prosjektet, i sin egen dokumentasjon av testmetoden
Prosjektet dokumenterte også en kontamineringsfeil i sin egen måling, der en SessionStart-hook kjørte Ponytail i baselinen. Den åpenheten er grunnen til at JetBrains valgte akkurat dette tillegget: påstanden var etterprøvbar.
Installasjonsmåten avgjør om du får noe som helst ut av skillet. Kopierer du SKILL.md inn i en skills-mappe og lar modellen selv velge når den skal brukes, aktiverer den seg null ganger. JetBrains bekreftet dette over ti sesjoner. Ponytail er laget for å kjøre som plugin med en SessionStart-hook som injiserer regelsettet automatisk, og det er den eneste konfigurasjonen som gir målbar effekt.
Hva bør du gjøre?
- Installer Ponytail som plugin med SessionStart-hook. En løs SKILL.md i skills-mappa selvaktiverer aldri.
- Regn med gevinst bare der agenten faktisk overbygger. På større byggeoppgaver falt koden 31 % i JetBrains-kjøringen, på allerede stramme oppgaver rørte den seg knapt.
- Mål på din egen kodebase før du stoler på noen av tallene. JetBrains sin ti-oppgavers smoketest sa 3 % kutt og 9,6 % dyrere kjøring, stikk i strid med det de fulle 80 oppgavene viste.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.