Hetzner tester eget inferens-API: OpenAI-kompatibelt, Qwen3.6 og ingen SLA
Bytt base_url i OpenAI-klienten din og du treffer Hetzners eksperimentelle inferens-API, uten fakturering og uten SLA.
Hetzner er kjent for billige dedikerte servere i Tyskland og Finland, ikke for KI-tjenester. Nå ligger det et inferens-API i Experiments-dashbordet deres, og utviklerbloggen til Sliplane har tatt det for en første runde. Hetzner sier selv at de vil finne ut om folk faktisk vil ha dette, hvordan systemet skalerer, hvilke funksjoner som betyr noe og hvor mye last det tåler. Det er altså ikke en produktlansering.
Teknisk er terskelen lav. Du lager et API-token i dashbordet, peker en OpenAI-klient mot «https://inference.hetzner.com/api/v1» og bruker det som et hvilket som helst annet inferens-API. Eneste tilgjengelige modell akkurat nå er Qwen/Qwen3.6-35B-A3B-FP8, en Mixture-of-Experts-modell på 35 milliarder parametere der 3 milliarder er aktive. Den tar tekst og bilder, har et kontekstvindu på 262K og kjører med FP8-kvantiserte vekter. Hetzner har også publisert en kort veiledning for å koble OpenCode til API-et, hvis du vil prøve uten å skrive kode.
Sliplane kjørte noen små tester 23. juli 2026 og målte 153 millisekunder median tid til første token over sju korte forespørsler på en allerede åpen forbindelse, og 224 output-tokens per sekund over fem lengre generasjoner kappet på 512 tokens. Det er raske tall, men de kommer fra én klient på ett tidspunkt og sier lite om hva som skjer når mange bruker tjenesten samtidig.
Modellen selv er omtrent som forventet av størrelsen. Den fulgte de fleste formaterings- og gjenfinningsinstruksjonene, håndterte et bilde riktig og bommet på to svært enkle regnestykker.
«En liten, litt elendig språkmodell.» — Sliplane, om Qwen3.6-35B i testen
Én detalj er verdt å notere hvis du tester selv: parameteren «enable_thinking» i «chat_template_kwargs». Uten den kan modellen bruke en overraskende stor del av completion-budsjettet på resonnering før den returnerer et synlig svar. Den fungerte i testene, men er ikke dokumentert av Hetzner, så ikke bygg noe viktig rundt akkurat den forespørselsformen ennå.
Det interessante her er ikke Qwen-endepunktet, men at Hetzner i det hele tatt tester inferens. Inferens på åpne vekter er et råvaremarked: alle kan laste ned de samme vektene, kjøre omtrent samme serveringsprogramvare og eksponere et OpenAI-kompatibelt API. Bytte av leverandør er også enkelt, særlig med OpenRouter eller LiteLLM i mellomlaget. Marginene krever da at du kan kjøpe og drifte GPU-maskinvare billigere enn andre, noe Hetzner har bygget hele forretningen sin på.
Hva bør du gjøre?
- Ikke flytt produksjonslast hit. Uten fakturering og SLA kan tjenesten forsvinne uten varsel.
- Bruk den til å måle hva du egentlig trenger. Hvis 35B-A3B holder for din oppgave, vet du at du kan kjøre den selv på en Hetzner-boks senere.
- Sett «enable_thinking» eksplisitt i testene dine, ellers sammenligner du responstider som inkluderer usynlig resonnering.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.