Falcon-Emirati-7B svarer på emiratisk dialekt der større modeller faller tilbake til standardarabisk
Merk deg oppskriften, ikke modellen: Technology Innovation Institute har trent Falcon-Emirati-7B til å svare på emiratisk dialekt, men vektene er foreløpig ikke lagt ut.
«En modell som bare kan standardarabisk, kan oversette hvert ord i en emiratisk setning og likevel gå glipp av hva den faktisk betyr.» — teamet bak Falcon-Emirati, Technology Innovation Institute
Det skriver Technology Innovation Institute (TII) i lanseringsinnlegget for Falcon-Emirati-7B på Hugging Face-bloggen 6. oktober. Modellen bygger på 7B-varianten av Falcon-H1-Arabic, en hybridarkitektur der Mamba-lag og transformer-attention går parallelt i hver blokk. Emiratisk arabisk er mest et muntlig språk og finnes lite skrevet på nett, så teamet hadde lite rå tekst å trene på.
Dataoppskriften har tre deler. Den første er dialekttekst crawlet fra emiratiske nettsteder og forum. Den andre er tekst på standardarabisk om emiratisk kultur, skikker og historie. Den tredje er syntetiske data, generert under strenge regler med ordlister og ordbøker for emiratisk ordforråd og grammatikk. TII skriver at det ikke finnes noen etablert oppskrift for hvor mye dialektdata som trengs eller i hvilket treningssteg, så mye av arbeidet var ablasjoner og prøving og feiling, vurdert både med benchmarks og av morsmålsbrukere.
Flervalg sier lite, dialekten sier mye
På Alyah, en flervalgstest med 1 173 spørsmål samlet inn manuelt fra emiratiske morsmålsbrukere, scorer modellen 84,83 prosent. Lanseringsinnlegget holder Falcon-H1-Arabic-familien utenfor sammenligningen. I Alyah-innlegget fra januar scoret basismodellen falcon-h1-arabic-7b-instruct 82,18 prosent, så gevinsten på flervalg er beskjeden.
Forskjellen viser seg når modellene skal svare fritt. TII lot Gemini 3.7 Flash dømme svar på de samme spørsmålene, og målte om svaret faktisk kom på emiratisk. Falcon-Emirati-7B fikk 0,52 i dialekttroskap, mot 0,05 for ALLaM-7B, 0,03 for gemma-3-27b-it, 0,02 for Jais-2-8B og nær null for Fanar-2-27B. De andre modellene kan ofte svaret, men gir det på standardarabisk, selv når de blir spurt på dialekt. Merk at både testen og dommeroppsettet er TIIs eget.
Alyah-tallene viser også hvor svakt generelle modeller står. Qwen3-8B fikk 25,66 prosent på en test med fire svaralternativer, altså omtrent det tilfeldig gjetting gir.
«Dialektspesifikk semantisk kunnskap tilegnes ikke lett gjennom generisk flerspråklig trening alene.» — Alyah-teamet ved TII, i benchmark-innlegget på Hugging Face
Falcon-Emirati-7B kan foreløpig bare prøves i TIIs egen chattjeneste, og da saken ble skrevet fantes det ingen offentlige vekter på Hugging Face. Alyah-datasettet er derimot åpent der.
For deg som bygger på norsk er oppskriften det overførbare: ekte dialekttekst, kulturtekst på standardspråket, regelstyrt syntetisk data og et eget testsett fra morsmålsbrukere passer like godt for dialekter som sjelden skrives ned.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.