KI-følgesvennen i Skyrim svarer lokalt på under 500 millisekunder
Kjører en KI-følgesvenn i Skyrim på under 500 millisekunder fra spilleren slutter å snakke til figuren svarer, med all sanntidsbehandling lokalt.
40 til 80 millisekunder på tale til tekst, 20 millisekunder på å tolke hva du ba om, 20 til 60 millisekunder på lydgenerering og 300 til 600 millisekunder på å forme svaret. Det er latensbudsjettet utvikleren bak pantel.is har satt opp for Varkos, en KI-styrt følgesvenn som spiller Skyrim sammen med deg.
Poenget er handling, ikke prat. Varkos tar imot instruksjoner som strekker seg over tid: vent her, og når du ser pilen jeg skyter i lufta, hent flasken og kom til meg. Planen registreres som en fremtidig utløser, venter på riktig hendelse i spillverdenen og repareres eller stanses hvis verden endrer seg underveis. Ingenting er forhåndsskrevet.
Spillet kjører på Windows, mens lyd og logikk kjører på en M4 MacBook. Tale til tekst gjøres av en optimalisert Qwen3-ASR på 1,7 milliarder parametere, satt opp med rullende delresultater fordi modellen ikke støtter strømming i utgangspunktet. Talesyntesen går på PocketTTS-Raven, som allerede ligger ute åpent, med 20 til 30 millisekunder per generering.
Kjernen kalles ALE, Action Latent Encoder, og er verken en språkmodell eller en enkel klassifiserer. Den kombinerer embeddinger, små klassifiserere, eksplisitte regler og tradisjonell maskinlæring, og tar imot spillverdenens tilstand som JSON sammen med det du sa. «Plukk opp sverdet og gi det til meg» blir til to koblede handlingsspor, på 2 til 20 millisekunder.
Begrensningen utvikleren selv peker på, er at raske lokale modeller mister tråden over lange samtaler, og at skyleverandører ikke løser det: store modeller er for trege, og de raskeste tjenestene tilbyr modeller som er svake på samtale.
Hva bør du gjøre?
- Sett et latensbudsjett per ledd før du velger modeller. Summen av tale til tekst, tolkning, generering og talesyntese avgjør om samspillet føles levende.
- Legg intensjonstolkningen utenfor språkmodellen. ALE velger riktig handling på under 20 millisekunder, der et modellkall koster hundrevis.
- Start med PocketTTS-Raven hvis du bygger noe stemmestyrt. Den ligger ute nå, mens oppsettet rundt Qwen3-ASR ifølge utvikleren kommer senere.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.