Aleph Alpha slipper Kolibri: åpen 78B MoE med 3B aktive parametere under Apache 2.0
Last ned Kolibri hvis du har minst ett H200-kort eller to A100 80 GB og trenger en åpen modell som heller avstår enn gjetter når dokumentet ikke dekker spørsmålet.
3,46 milliarder av Kolibris 78 milliarder parametere er aktive per token, og det er tallet Aleph Alpha bygger hele lanseringen rundt. Det tyske KI-selskapet slapp modellen på Hugging Face 3. oktober, på Tysklands gjenforeningsdag, under Apache 2.0. Kolibri er en Mixture-of-Experts-modell med 384 eksperter per lag, der 6 rutes og 1 er delt. Ifølge modellkortet er konteksten validert opp til 1 048 576 tokens, men Aleph Alpha anbefaler maks 262 144 når latens eller gjennomstrømning teller.
Arkitekturen er skrudd for billig servering. Bare 10 av 50 lag ser hele konteksten, mens de 40 andre jobber i et glidende vindu på 512 tokens. Aleph Alpha skriver i lanseringsbloggen at en 123B-variant bare klarte 3 samtidige forespørsler på 256 000 tokens på to H100-kort, mens 78B-modellen håndterer 18 og dekoder 28 % raskere.
Modellen er trent på 20 billioner tokens, der 21,3 % er tysk. Selskapet laget en egen tokenizer med 128 000 tokens i vokabularet og brukte maskinoversettelse sparsomt, 6 % totalt.
«Resultatet er en modell som er tospråklig fra grunnen av, ikke en engelsk modell som har lest litt tysk.» — Aleph Alpha i lanseringsbloggen
Det mest interessante for deg som bygger RAG er avholdenheten. Aleph Alpha trente Kolibri med en egen protokoll, Merlin-Arthur, der en motpart fjerner bevisene fra dokumentet og prøver å lokke modellen til å hallusinere. Kolibri avstår i stedet for å svare feil på 44 % av AA-Omniscience-oppgavene, mot 15 % for forgjengeren Kolibri Origin. Qwen3.6-35B-A3B scorer likevel 56,7 i samme tabell.
Resten av tallene er blandet, og de kommer fra Aleph Alphas egen lanseringsblogg, der selskapet skriver at alle modellene er kjørt i eget testoppsett med høyeste reasoning-nivå der det var mulig. Kolibri får 96,9 på AIME 2025 og 85,9 på LiveCodeBench v6, men 66,4 på SWE-Bench Verified mot 73,8 for Qwen3.6-35B-A3B. Qwen3.8 27B, som Aleph Alpha selv fører opp som tett (dense) modell i tabellen, slår Kolibri på samlet engelsk score, 80,2 mot 75,5. På Hacker News påpekte brukeren spijdar at Qwen3.8 Flash mangler helt i sammenligningen.
Kan du kjøre den?
FP8-vektene tar rundt 78 GB, og modellkortet oppgir minst 2× A100 80 GB, 2× H100, 1× H200 eller 1× B200. Du trenger Aleph Alphas egen vLLM-plugin, pakken aleph-alpha-inference, og får et OpenAI-kompatibelt API med reasoning_effort satt til none, low, medium eller high. Modellkortet beskriver FP8-vekter, og HN-kommentarer der brukere venter på kvantiseringer tyder på at det ennå ikke finnes versjoner for mindre kort. HN-brukeren martianvoid rapporterer rundt 170 tokens i sekundet i FP8 på et RTX PRO 6000-oppsett, men med et forbehold:
«it spends way too many tokens on overthinking stuff» — martianvoid på Hacker News
Bakgrunn
Kolibri kommer drøyt to uker etter at kanadiske Cohere 16. september kunngjorde at selskapet har signert en avtale om å slå seg sammen med Aleph Alpha. Det sammenslåtte selskapet skal operere globalt som Cohere, og avtalen venter fortsatt på godkjenning fra myndighetene. Modellkortet beskriver støtten for bare tysk og engelsk som et bevisst valg av dybde over bredde, så norsk er ikke en del av målet.
Hva bør du gjøre?
- Start med reasoning_effort satt til low eller none, og skru bare opp når oppgaven trenger det.
- Kjør dine egne norske dokumenter gjennom modellen før du bygger noe på den, siden den kun er trent for tysk og engelsk.
- Test avholdenheten mot dokumentsamlingen din med spørsmål du vet at dokumentene ikke kan besvare.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.