llama.cpp kjører nå Qwen3-TTS lokalt: stemme kopieres fra én lydfil
Bygg llama.cpp på nytt før du bruker `llama-tts` igjen, for Qwen3-TTS-støtten kom med en varslet brytende endring i binæren.
Ti språk, 1,7 milliarder parametere og én referansefil i wav eller mp3. Det er hele oppskriften for lokal stemmesyntese etter at pull request 26254 ble flettet inn i llama.cpp 4. august, 56 commits og 42 endrede filer etter at den ble åpnet 28. juli. Bidraget kommer fra vedlikeholderen ngxson og gir mtmd-modulen støtte for Qwen3-TTS-12Hz-1.7B-Base, med ferdige GGUF-vekter publisert under ggml-org.
Bruken er ett kall: llama-tts med -p for teksten, --tts-lang for språk og --tts-speaker-file som peker på et lydklipp. Referanselyden går gjennom en speaker_encoder og oversettes til embeddings i tekstrommet, så modellen leser stemmen ut av klippet i stedet for å ha den trent inn på forhånd. De ti språkflaggene er kinesisk, engelsk, tysk, italiensk, portugisisk, spansk, japansk, koreansk, fransk og russisk, med engelsk som standard. Norsk står ikke på lista.
Under panseret sampler en talker-backbone den semantiske koden, mens en egen code_predictor genererer de neste 15 akustiske tokenene i én enkelt graf. ngxson begrunner det med at libllama ikke støtter å generere N tokens i grafen, og at synkronisering per token gjør en så liten modell minnebundet og treg.
Én begrensning er verdt å notere før du planlegger noe rundt dette: støtte i llama-server kom ikke med i denne sammenslåingen. ngxson lister to gjenstående punkter, en egen prosesseringsfunksjon som lar serveren avbryte kansellerte oppgaver, og GGUF-metadata som markerer at modellen ikke kan brukes til chat eller tekstgenerering. Begge er skjøvet til en oppfølgings-PR. Kodekvaliteten fikk også et forbehold under gjennomgangen.
«Konverteringskoden er rotete, men akseptabel foreløpig. Forhåpentligvis kan den ryddes opp og samles etter hvert som vi får flere TTS-modeller» — CISC, vedlikeholder i llama.cpp
Hva bør du gjøre?
- Bygg llama.cpp fra master på nytt og hent
ggml-org/Qwen3-TTS-12Hz-1.7B-Base-GGUFmed-hf-flagget. Gamlellama-tts-skript vil trenge justering. - Behold en eksisterende TTS-løsning i produksjon inntil server-oppfølgeren lander. Slik det står nå kjører Qwen3-TTS bare gjennom kommandolinjebinæren, ikke gjennom HTTP-endepunktet du bygger resten av stacken på.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.