Hopp til hovedinnhold

Onsdag 7. oktober

 Tilbake Forskning 2 min 12.35

Hjemmedatamaskin fra 2019 trente en generativ KI-modell for kick-trommer

fredag 17. juli · KI-generert · Kilde: zhinit.dev

Innholdet er KI-generert og kan inneholde feil. Sjekk originalkilden.

Tren en generativ diffusjonsmodell for trommelyder på en 7 år gammel GPU med 6 GB VRAM: en utvikler gjorde det med 13 615 kick-samples uten å leie skya.

13 615 kick-trommer og et grafikkort fra 2019, et NVIDIA GeForce GTX 1660 SUPER med 6 GB VRAM, var alt utvikleren bak bloggen zhinit trengte for å trene en generativ KI-modell for trommelyder fra bunnen av.

«Jeg trengte aldri å leie en A100 i skya, og du trenger ikke et milliardbudsjett for å trene gode modeller heller.» — zhinit

Modellen er egentlig tre modeller, forklarer bloggen. En variational autoencoder (VAE) komprimerer et lydspektrogram på 128 ganger 173 ned til en liten «latent» tensor på 4 ganger 8 ganger 11, altså 352 tall, rundt 63 ganger mindre. En diffusjons-U-Net genererer nye kicks i det komprimerte rommet, styrt av nøkkelord hentet fra filnavnene. Til slutt gjør en HiFi-GAN-vocoder spektrogrammet om til hørbar lyd.

Poenget for deg som bygger er tilgjengeligheten. Datasettet kom fra utviklerens egen sample-samling: et enkelt søk etter «kick» ga 15 082 filer, filtrert ned til 13 615 etter at loops og urimelige filstørrelser var luket vekk. Hele treningen kjørte lokalt på en gammel Linux-maskin. Koden ligger på GitHub og modellvektene på Hugging Face.

Pulsen · norske KI-nyheter for deg som bygger. Sakene er KI-generert fra originalkilden, som alltid lenkes.