Microsoft satser på små spesialistmodeller framfor frontlinjen
Prioriterer token-effektivitet framfor toppytelse, skriver Microsofts KI-sjef Mustafa Suleyman om selskapets modellstrategi.
Mustafa Suleyman, KI-sjef i Microsoft, skriver at bransjen må veie toppytelse mot kostnad, og at Microsoft velger kostnad. I stedet for én allmennmodell trener selskapet kompakte modeller for ett fagfelt hver. Bildemodellen MAI-Image-2.5-Flash skal kutte GPU-kostnaden med opptil 84 prosent sammenlignet med GPT-Image-2.
Sikkerhetsmodellen MAI-Cyber-1-Flash er eksempelet Suleyman løfter fram: den slår Anthropics Mythos med 12 prosentpoeng på CyberGym-testen til halve prisen. Forbeholdet står i samme åndedrag. Resultatet forutsetter MDASH-systemet, som orkestrerer flere modeller og fortsatt sender de vanskeligste oppgavene videre til OpenAIs resonneringsmodeller.
Suleyman vil også ha utbyttbare modeller, slik at Microsoft ikke blir låst til én modellfamilie. Om de små MAI-modellene faktisk kan erstatte OpenAI-avhengigheten forblir uavklart så lenge de harde kallene rutes ut av huset.
Det som flytter seg her er hvor konkurransen foregår. Den går fra enkeltmodeller til orkestreringslaget: programvaren som ruter oppgaver og leverer kontekst. Orkestratoren sender mesteparten til billige spesialister og reserverer frontmodellene for de vanskelige tilfellene. Anthropic bygde Claude Fable 5 etter samme mønster, og Sakana bygde Fugu rundt det.
Hva bør du gjøre?
- Kopier rutingmønsteret, ikke modellen. Gevinsten Microsoft rapporterer kommer i hovedsak fra å sende de enkle kallene til en billig modell, og det krever bare en terskel og et fallback-kall, ikke egen modelltrening.
- Mål hvor stor andel av kallene dine som faktisk eskalerer. Microsofts eget tall er at MDASH fortsatt må videre til OpenAI på de harde oppgavene, så regn med at eskaleringsraten din bestemmer besparelsen, ikke spesialistmodellens pris.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.