wmo lover frontier-kvalitet til 40 prosent lavere pris, Hacker News etterlyser bevis
Ruter agent-trafikken din mellom frontier-modeller og billigere åpne modeller, men leverer ingen målinger som viser at kvaliteten holder.
«Tittelen er misvisende. Dette er modellruting, ikke destillering.» — HN-brukeren surround
Experiential Labs la ut world-model-optimizer, forkortet wmo, som Show HN 26. juli. Tråden fikk 41 poeng og 21 kommentarer. Verktøyet installeres med pip, leser OTel-traser fra agenten du allerede kjører, scorer hver registrerte modell på oppgaver holdt utenfor treningen, og fitter en rutingpolicy du deretter serverer selv med wmo serve.
Tanken er at trafikken flyttes gradvis. Utvikleren bak prosjektet skriver i tråden at rutingen går mellom frontier-modeller og åpne modeller som trenes kontinuerlig med Tinker, og at mer trafikk havner hos de små etter hvert som de blir bedre. Repoet inneholder også verdensmodeller som simulerer agentmiljøet, slik at endringer i prompt, verktøy og kjøreramme kan måles mot de samme simulerte oppgavene før en ny versjon får status som «champion».
Innvendingene i tråden handler om at ingenting av dette er dokumentert med tall. Flere kommentatorer påpeker at det verken finnes benchmarks eller case-studier, og at et løfte om 40 prosent lavere kostnad uten målinger er umulig å etterprøve. Moderatoren dang ba utvikleren vente med å poste til det finnes mer å ta tak i, og fikk fjernet en venteliste som bryter reglene for Show HN.
Mekanikken kan du likevel etterprøve på egen hånd, siden koden er åpen og rapporten sammenligner mot en baseline du velger selv. Merk at telemetri er slått på som standard. Den skal ifølge repoet bare inneholde metadata, aldri prompts, traser, filstier eller modellnavn.
Hva bør du gjøre?
- Kjør
wmo optimize route sweeppå dine egne OTel-traser og les matrisen før du fester lit til prosenttallet. - Slå av telemetrien før første kjøring mot ekte traser, med
wmo config telemetry disableellerDO_NOT_TRACK=1. - Behandle ruting og destillering som to separate spørsmål. Rutingen kan du måle på en ettermiddag, destilleringen krever at du faktisk trener en modell.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.