Speakrail er en åpen taleassistent du kan avbryte, og den kjører lokalt på ett RTX 4090
Test Speakrail hvis du har et 24 GB NVIDIA-kort: taleassistenten lytter mens den snakker, lar deg avbryte og kjører hele kjeden lokalt med én Docker Compose-kommando.
0,7 til 0,8 sekunder går det fra du slutter å snakke til svaret når øret ditt, ifølge README-en til Speakrail, et nytt open source-prosjekt på GitHub som bygger en full duplex-taleassistent av tre åpne modeller på ett RTX 4090. Tallet er medianen på innspilte samtaler. Repoet ble opprettet 4. oktober og har én bidragsyter, så dette er et ferskt enmannsprosjekt, ikke et ferdig produkt.
Full duplex betyr at assistenten lytter mens den snakker. Du kan avbryte den, si «mm-hmm» uten at den stopper, og ta en tenkepause midt i setningen uten å bli kuttet av. Vanlige oppsett lar en VAD eller en stillhetstimer avgjøre når du er ferdig, og det er det leddet Speakrail bytter ut.
Kjeden har tre ledd. Voxtral Mini 4B Realtime fra Mistral AI transkriberer talen via en fork av audio.cpp, og et turtakingshode på 2,4 millioner parametere leser modellens skjulte tilstander og melder hvert 80. millisekund om du snakker, er ferdig, tar en pause eller bare gir lyd fra deg. Gemma 4 12B med en LoRA fra Speakrail tar så én beslutning per hendelse (snakk, lytt, avbryt, vik eller skyt inn) som ett enkelt token på rundt 60 ms. Breeze TTS 2 leser svaret opp. Utvikleren begrunner arkitekturen slik i modellkortet for turtakingshodet:
«En VAD eller stillhetstimer egner seg ikke for full duplex-samtaler, og i mine tester var Smart Turn-modellene upålitelige.» — utvikleren bak Speakrail, i modellkortet på Hugging Face
På Full-Duplex-Bench v3, der 100 innspilte samtaler med verktøybruk spilles direkte inn i systemet, oppgir Speakrail en Pass@1 på 0,52. Det er under GPT-Realtime 1.5 (0,60) og Gemini Live 3.1 (0,54), men Speakrail har høyest verktøy-F1 i tabellen (0,915) og raskest første ord i snitt (1,82 sekunder). Tallene er prosjektets egne kjøringer, og skytjenestenes forsinkelse inkluderer nettverk.
Prisen for de korte, muntlige svarene står åpent i README-en:
«Å følge instruksjoner om skriftlig format (antall ord, markdown) går dårligere enn med standard-Gemma: modellen er trent for korte, muntlige svar.» — README-en til Speakrail
Du trenger Linux, en nyere NVIDIA-driver, Docker Compose v2 med NVIDIA Container Toolkit og rundt 75 GB disk, hvorav 22 GB er modeller. Første oppstart tar rundt 20 minutter. Ferdigbygde images dekker RTX 3090 og 4090, mens RTX 5090 krever bygg fra kildekode. Assistenten forstår bare engelsk og tar én samtale om gangen. Koden er Apache 2.0, det samme er Gemma 4 og Voxtral, men vektene til Breeze TTS 2 og lyden de lager er kun for forskning og ikke-kommersiell bruk.
Hva bør du gjøre?
- Klon repoet speakrail/speakrail, kjør
docker compose up -dog åpne localhost:8080 i nettleseren for å teste avbrytelser og tenkepauser selv. - Står GPU-en i en annen maskin i hjemmelaben, bruk en SSH-tunnel (
ssh -L 8080:localhost:8080), siden nettleseren bare slipper til mikrofonen på localhost eller HTTPS. - Åpne /debug/ for å se turtakingssannsynlighetene og latensen per tur før du justerer
SILENCE_MSeller senkerLLM_GPU_MEMORY_UTILIZATIONfra 0,48 hvis kortet også driver skjermen din.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.