PSSA: Rust-modell uten transformer slår en like stor transformer, men bare i miniformat
Les PSSA som et arkitektureksperiment, ikke en modell du kan bruke: fordelen over en like stor transformer er målt på bare 1,5 millioner parametere.
12 ganger raskere tekstgenerering på samme CPU er hovedtallet i PSSA, et prosjekt GitHub-brukeren Sparticle62ops har lagt ut som åpen kildekode under GPL-3.0. Ifølge README-en genererte PSSA 200 tokens på 226 ms, mot 2 735 ms for en transformer med like mange parametere. Modellen leser teksten ett token om gangen gjennom et tilstandsrom-lag (state space) av samme familie som Mamba, slår opp i en episodisk minnebank med 512 plasser og skriver om deler av sine egne vekter mens den kjører. Alt er håndskrevet lineær algebra i Rust, uten PyTorch eller andre ML-rammeverk.
Fordi modellen bærer en tilstand av fast størrelse i stedet for å lese hele konteksten på nytt for hvert token, vokser kostnaden lineært med lengden. På 12,7 millioner tokens fra WikiText-103 endte PSSA på 3,98 i krysstap mot transformerens 4,43. På et usett utsnitt på 198 939 tokens traff PSSA riktig neste token i 24,1 prosent av tilfellene, mot 18,0 prosent for transformeren.
Forfatteren er selv tydelig på skalaen:
«Dette er modeller på 1,5M parametere trent på 12,7M tokens. Det er en forskningsprototype, ikke en konkurrent til noe du har hørt om.» — README-en til PSSA
Mottakelsen på Hacker News, der prosjektet fikk 85 poeng, var skeptisk. Brukeren kasumispencer2 spurte om dette ikke bare er en RNN der nesten ingenting er nytt, og janalsncm mente prosjektet burde vært skrevet i PyTorch slik at andre kan etterprøve det. README-en innrømmer selv at en felles læringsplan kan ha gitt transformeren et handikap, og at det ennå ikke er målt om minnebanken i det hele tatt påvirker tapet. En læringsrate-sweep per modell kjører nå.
Hva bør du gjøre?
- Bygg prosjektet med
cargo build --releaseog kjørbenchmark-kommandoen hvis du vil se arkitekturen i arbeid på egen CPU; GPU er valgfritt. - Vent på sweepen og ablasjonen av minnebanken før du trekker konklusjoner om arkitekturen mot transformere.
- Bidra med en sammenligning mot en moderne rekurrent baseline hvis du har regnekraft, det er det forfatteren selv ber om hjelp til.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.