Baseten blir inferensleverandør på Hugging Face med Kimi K3 og GLM-5.2
Legger Hugging Face til Baseten som inferensleverandør på Hub-en, slik at åpne modeller som Kimi K3, DeepSeek V4 Flash og GLM-5.2 kan kalles uten egen konto hos leverandøren.
Baseten er nå en støttet Inference Provider på Hugging Face Hub, skriver Hugging Face i annonseringen. I denne første integrasjonen dekkes conversational og tekstgenerering, med støtte for flere oppgavetyper senere. Baseten selv er en infrastrukturplattform for serverløs inferens og trening, med en katalog av frontier-modeller.
Det praktiske er at ingenting i koden din trenger å endres utover én streng. Router-endepunktet er OpenAI-kompatibelt, så du peker klienten mot router.huggingface.co og skriver leverandøren inn i modellnavnet, for eksempel som suffikset baseten på DeepSeek V4 Flash. Python-veien krever huggingface_hub fra versjon 1.26.1, og JavaScript-veien bruker inference-pakken deres. De samme leverandørene er allerede koblet inn i agentverktøy som Pi, OpenCode, Hermes Agents og OpenClaw.
Faktureringen har to former, og forskjellen er verdt å forstå før du velger. Setter du inn din egen Baseten-nøkkel, går kallene direkte til Baseten og du får regningen derfra. Autentiserer du med Hugging Face-token i stedet, rutes kallet gjennom Hub-en og belastes HF-kontoen din.
«Du betaler standard leverandørpriser. Det er ikke noe påslag fra oss, vi sender leverandørens kostnader rett videre» — Hugging Face
PRO-abonnenter får inferens-kreditter tilsvarende to dollar i måneden, brukbare på tvers av leverandører, og innloggede gratisbrukere har en liten kvote. Baseten har tidligere vist at kvantisering ga GLM-5.2 rundt 20 prosent høyere hastighet uten målbart kvalitetstap, så modellene som nå dukker opp bak Hub-routeren er ikke urørte referansevekter.
Hva bør du gjøre?
- Test rutingen før du binder deg. Legg leverandørsuffikset på et modellnavn du allerede bruker, og sammenlign latens og svar mot dagens leverandør.
- Velg egen nøkkel hvis volumet er reelt. Rutingen gjennom Hugging Face er praktisk til utprøving, men du mister leverandørens egne kvote- og loggverktøy.
- Sorter leverandørene i kontoinnstillingene. Rekkefølgen der styrer hva kodesnuttene på modellsidene faktisk viser deg.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.