Hopp til hovedinnhold
Tilbake
Verktøy 2 min · Kilde: Hugging Face - Blog

Baseten blir inferensleverandør på Hugging Face med Kimi K3 og GLM-5.2

KI Takeaway KI-generert · kan inneholde feil

Legger Hugging Face til Baseten som inferensleverandør på Hub-en, slik at åpne modeller som Kimi K3, DeepSeek V4 Flash og GLM-5.2 kan kalles uten egen konto hos leverandøren.

Baseten er nå en støttet Inference Provider på Hugging Face Hub, skriver Hugging Face i annonseringen. I denne første integrasjonen dekkes conversational og tekstgenerering, med støtte for flere oppgavetyper senere. Baseten selv er en infrastrukturplattform for serverløs inferens og trening, med en katalog av frontier-modeller.

Det praktiske er at ingenting i koden din trenger å endres utover én streng. Router-endepunktet er OpenAI-kompatibelt, så du peker klienten mot router.huggingface.co og skriver leverandøren inn i modellnavnet, for eksempel som suffikset baseten på DeepSeek V4 Flash. Python-veien krever huggingface_hub fra versjon 1.26.1, og JavaScript-veien bruker inference-pakken deres. De samme leverandørene er allerede koblet inn i agentverktøy som Pi, OpenCode, Hermes Agents og OpenClaw.

Faktureringen har to former, og forskjellen er verdt å forstå før du velger. Setter du inn din egen Baseten-nøkkel, går kallene direkte til Baseten og du får regningen derfra. Autentiserer du med Hugging Face-token i stedet, rutes kallet gjennom Hub-en og belastes HF-kontoen din.

«Du betaler standard leverandørpriser. Det er ikke noe påslag fra oss, vi sender leverandørens kostnader rett videre» — Hugging Face

PRO-abonnenter får inferens-kreditter tilsvarende to dollar i måneden, brukbare på tvers av leverandører, og innloggede gratisbrukere har en liten kvote. Baseten har tidligere vist at kvantisering ga GLM-5.2 rundt 20 prosent høyere hastighet uten målbart kvalitetstap, så modellene som nå dukker opp bak Hub-routeren er ikke urørte referansevekter.

Hva bør du gjøre?

  1. Test rutingen før du binder deg. Legg leverandørsuffikset på et modellnavn du allerede bruker, og sammenlign latens og svar mot dagens leverandør.
  2. Velg egen nøkkel hvis volumet er reelt. Rutingen gjennom Hugging Face er praktisk til utprøving, men du mister leverandørens egne kvote- og loggverktøy.
  3. Sorter leverandørene i kontoinnstillingene. Rekkefølgen der styrer hva kodesnuttene på modellsidene faktisk viser deg.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter