Unsloth v0.1.50-beta gir AMD-GPUer lokal LLM-trening
Kjør lokal fine-tuning på AMD-GPUer: Unsloth v0.1.50-beta legger til ROCm-støtte med opptil 2x raskere trening og 70 % mindre VRAM enn før, ifølge Unsloth.
70 % mindre VRAM og opptil 2x raskere trening uten tap av nøyaktighet: det er tallene Unsloth oppgir for v0.1.50-beta, betaversjonen som for første gang tar lokal LLM-trening og -inferens til AMD-GPUer. Støtten dekker Windows, WSL og Linux, og bygger på egne Triton-kjerner og matematikk-optimaliseringer utviklet i samarbeid med AMD.
Fram til nå har Unsloths raske QLoRA-stack i praksis krevd NVIDIA og CUDA. AMD-eiere har vært henvist til tyngre oppsett eller ren llama.cpp-inferens. Med denne betaen sier Unsloth at de samme kjernene nå kjører over 500 modeller på AMDs Radeon-, Instinct-, Ryzen- og datasenter-GPUer, med optimaliserte ROCm-bygg for både GGUF- og Safetensors-inferens. Kompatibiliteten er særlig forbedret for datasenterkortene MI300X og MI325X.
«Vårt AMD-samarbeid, egne Triton-kjerner og matematikk-algoritmer lar deg trene og kjøre over 500 modeller på AMDs GPUer, opptil 2x raskere med 70 % mindre VRAM og uten tap av nøyaktighet» — Unsloth, utgivelsesnotat v0.1.50-beta
Tilnærmingen er den samme som Unsloth tidligere brukte sammen med NVIDIA, der de dokumenterte hvordan kjerne-optimalisering kan kappe treningstid uten å røre nøyaktigheten.
«Disse optimaliseringene har ingen tap i nøyaktighet og er et tillegg oppå Unsloths allerede 2-5x raskere hastighet» — Unsloth, NVIDIA-samarbeidsbloggen
For deg som bygger lokalt betyr det at en Radeon- eller Ryzen-maskin nå kan kjøre fine-tuning-løkker som før krevde et NVIDIA-kort. Betaen legger også til triks for å presse større modeller inn på begrenset maskinvare: MoE-ekspertlag kan flyttes til systemminnet, og modeller kan splittes over flere GPUer eller kjøres med Tensor Parallelism. Et nytt opt-in MCP-endepunkt lar KI-klienter inspisere modeller, starte og stoppe trening, laste checkpoints og eksportere GGUF-filer.
Merk at ytelsestallene er Unsloths egne og ennå ikke uavhengig verifisert, og at dette er en betaversjon: ROCm-oppsett er historisk mer skjørt enn CUDA, så forvent noe rusk på mindre vanlige kort.
Hva bør du gjøre?
- Installer eller oppdater via installasjonsskriptet fra unsloth.ai. Linux, WSL og macOS bruker curl-skriptet, Windows bruker PowerShell-varianten, og betaen krever pakken unsloth>=2026.7.3.
- Sjekk hvilket kort du har, for MI300X og MI325X har best ROCm-støtte, mens Radeon og Ryzen fungerer for lokal fine-tuning på mindre modeller.
- Har du en stor modell, kan du flytte MoE-ekspertlag til systemminnet eller dele modellen over flere GPUer med Tensor Parallelism før du gir opp på VRAM.
- Vil du styre trening eksternt, slår du på MCP-endepunktet med UNSLOTH_STUDIO_ENABLE_MCP=1 og setter en bearer-token.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.