Tokenless racer flere modeller mot hverandre og avbryter dem som henger etter
Sender Tokenless hver forespørsel til flere modeller samtidig, avbryter dem som ikke ser ut til å løse oppgaven, og fakturerer bare den som blir stående.
Ruterlaget mellom agenten din og modell-APIene er i ferd med å bli et eget produktmarked. OpenRouter har Fusion, DigitalOcean har Model Synthesis, og denne uken lanserte Y Combinator-selskapet Tokenless sin variant på Hacker News. Grepet deres er at modellvalget ikke tas før forespørselen sendes, men underveis.
Tokenless sender samme forespørsel til en gruppe modeller parallelt og leser de første resonnementssporene deres. Når én modell ser ut til å være på rett spor, kanselleres de andre. Endepunktet er kompatibelt med APIene til OpenAI og Anthropic, så det skal holde å bytte to linjer i oppsettet. Selskapet oppgir 52 prosent kutt i regningen, og sier det har trent egne modeller til å forutsi hvilken modell som klarer en gitt oppgave, framfor å spørre en språkmodell om det samme.
Skepsisen som møtte lanseringen handler om cache. I lange agentkjeder går det tool-kall etter tool-kall uten at brukeren er involvert, og det er der tokenene brenner.
«Varme cachekall reduserer inn-kostnaden med 90 prosent. Dette kan i praksis bare spare penger i de rundene der KI-en leverer et resultat til brukeren» — mediaman, Hacker News
Medgrunnlegger rohaga svarte at bytte også kan lønne seg med varm cache, fordi en modell som DeepSeek kan være 30 ganger billigere selv kald, og at alle modellene som deltar i et race får oppdatert sin egen cache underveis. Han viser samtidig til at selskapet analyserte hundrevis av milliarder tokens for å finne ut hvor tidlig et resonnementsspor røper om modellen er på rett vei.
Den andre innvendingen gjelder tallene selskapet selv stiller ut. På benchmarkene deepswe og terminalbench er Tokenless dårligere og billigere enn frontier-modellene, og bedre og dyrere enn de små. Bare på tau-Banking oppgir de både høyere treffrate og lavere pris.
«Det er nøyaktig det jeg ville forventet selv av en ruter som bytter tilfeldig» — MikhailTal, Hacker News
Verdien avhenger altså av oppgavemiksen din. Kjører du mange korte, enkle kall med kald cache, er det plausibelt at en ruter tar bort mye av regningen. Kjører du lange agentøkter mot én kodebase, spiser cachetreffene mesteparten av gevinsten før ruteren rekker å gjøre noe.
Hva bør du gjøre?
- Sjekk hvor stor andel av trafikken din som faktisk er cache-varm før du regner hjem 52 prosent. Tallet gjelder ikke likt for alle arbeidslaster.
- Krev tall på din egen trafikk. Tokenless tilbyr å kjøre analysen, og det er den eneste målingen som betyr noe når gevinsten avhenger av oppgavemiksen.
- Slå på logging av rutingsvalg fra første dag. Selskapet oppgir at dashbordet viser hvilke modeller som ble vurdert og hvilken som ble valgt per tur, og uten det kan du ikke feilsøke et dårlig svar.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.