Aether-7B-5Attn: fullt åpen koreansk MoE-modell med 162 000 treningslogger
Slipper VIDRAFT en 6,59B MoE-modell der alt fra treningsdata-oppskrift til alle 162 000 treningssteg er åpent under Apache-2.0.
Koreanske VIDRAFT Inc. har lagt ut Aether-7B-5Attn på Hugging Face: en Mixture-of-Experts-språkmodell med 6,59 milliarder parametere totalt og rundt 2,98 milliarder aktive per token. Ifølge modellkortet er dette den første koreanske grunnmodellen som åpner både treningsdata og treningskode, ikke bare vektene.
Det uvanlige er ikke størrelsen, men åpenhetsnivået. VIDRAFT publiserer datamiks-oppskriften, tokeniseringsskriptet, FSDP-treningskoden, samtlige hyperparametere, komplette logger fra alle 162 000 stegene og tre mellomsjekkpunkter. Selskapet peker på Allen Institute sin OLMo som normen: bare når data, kode og logger følger vektene, blir en modell etterprøvbar. Oppskriften bygger utelukkende på offentlige repoer (fineweb-edu, finemath, koreansk webtekst), slik at identisk tokenizer og miksevekter etter planen skal gi byte-identiske treningsbinærfiler.
«Vekter alene lar deg verken forstå en modell, verifisere den eller bygge den på nytt.» — Aether-modellkortet, VIDRAFT
Arkitekturen er også et eksperiment. De 49 lagene fordeler fem ulike attention-mekanismer over et 7×7 latinsk kvadrat, slik at ingen type samler seg i bestemte dybder. Navnet «5Attn» viser til de fem distinkte mekanismene. Modellen ble trent fra bunnen på 16 × NVIDIA B200 over rundt 46 dager og 144,2 milliarder tokens.
For deg som vil kjøre den lokalt er det tunge forbehold. Dette er en ren basemodell uten instruksjonstuning eller sikkerhetsjustering, den har ingen KV-cache (så generering er treg, rundt 1,5 tokens/s på en NVIDIA T4), og vLLM støttes ikke ennå fordi arkitekturen er egendefinert. Den laster i cirka 14 GB VRAM i bfloat16. Benchmark-tallene modellkortet oppgir er beskjedne (SciQ 73,7, PIQA 66,3), som ventet for en liten forskningsbasemodell.
Hva bør du gjøre?
- Vil du kjøre den: last med trust_remote_code=True og use_cache=False, hold max_new_tokens lav og bruk batch_size=1.
- Er du ute etter en brukbar chat-modell: vent på instruct-varianten Aether-7B-5Attn-it. Basemodellen fullfører tekst, den svarer ikke på spørsmål.
- Vil du studere reproduserbarhet eller heterogen attention: datamiks-oppskriften og de åpne loggene er hele poenget med utgivelsen.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.