Janus kjører GGUF-modeller på AMD, Intel og Nvidia fra én Go-binær
Bygg Janus fra kildekoden hvis du vil ha et OpenAI-kompatibelt API for GGUF-modeller på AMD-, Intel- eller Nvidia-kort uten Python, Docker eller Ollama.
På Windows er Janus ett byggskript og én .exe, mens du på Linux selv må skaffe libllama.so og legge den ved siden av binæren. Forskjellen sier mye om hvor det MIT-lisensierte Go-prosjektet fra GitHub-kontoen Vibra-Ingenn står: README-en kaller Windows primærplattform, repoet ble opprettet 24. september, og det finnes ingen release ennå. Du trenger altså Go 1.22+ uansett plattform. Prosjektet kom på Hacker News som Show HN 1. oktober og hadde 33 stjerner da vi sjekket.
Under panseret er det llama.cpp med Vulkan-backend, så samme binær treffer AMD, Intel og Nvidia, med CPU som reserve. Janus lytter på 127.0.0.1:8990 og eksponerer /v1/chat/completions med streaming og /v1/models, slik at Cursor, Cline og andre OpenAI-klienter kobles til med base-URL og tomt nøkkelfelt. Du bytter modell via /models/load uten omstart, chat-malen leses fra GGUF-metadataene, og tenkemodellers -blokker skilles ut i et eget reasoning_content-felt. README-en lister også openrouter som backend.
Det som mangler, er tall. Den første kommentaren på Hacker News etterlyste nettopp sammenligning mot vLLM, SGLang og ExLlama. Et svar i tråden:
«Siden dette i bunn og grunn er en wrapper rundt libllama.so, vil jeg anta at ytelsen er omtrent den samme som llama.cpp upstream.» — rancor, Hacker News
En annen kommentator advarte om at Vulkan gir mye overhead på Intel-maskinvare. Verdien i Janus ligger derfor i pakkingen, ikke i farten: én prosess, ingen container og et API du allerede kan snakke med.
Hva bør du gjøre?
- Test med en liten modell først, for eksempel Llama 3.2 3B, og bruk den medfølgende
modelgettil å hente GGUF-filen fra Hugging Face. Regn med 10 til 60 sekunder før første svar mens modellen lastes inn i VRAM. - Sett
JANUS_VRAM_CEILING_MBtil det kortet ditt faktisk har. Standardverdien er 9216 MiB. - La
JANUS_LISTEN_ADDRstå på127.0.0.1. Klientene kobles til uten API-nøkkel, så ikke bind serveren til0.0.0.0på et delt nett.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.