Hopp til hovedinnhold
Tilbake
Verktøy 3 min · Kilde: Unsloth (GitHub)

Unsloth v0.1.50-beta gir AMD-GPUer lokal LLM-trening

KI Takeaway KI-generert · kan inneholde feil

Kjør lokal fine-tuning på AMD-GPUer: Unsloth v0.1.50-beta legger til ROCm-støtte med opptil 2x raskere trening og 70 % mindre VRAM enn før, ifølge Unsloth.

70 % mindre VRAM og opptil 2x raskere trening uten tap av nøyaktighet: det er tallene Unsloth oppgir for v0.1.50-beta, betaversjonen som for første gang tar lokal LLM-trening og -inferens til AMD-GPUer. Støtten dekker Windows, WSL og Linux, og bygger på egne Triton-kjerner og matematikk-optimaliseringer utviklet i samarbeid med AMD.

Fram til nå har Unsloths raske QLoRA-stack i praksis krevd NVIDIA og CUDA. AMD-eiere har vært henvist til tyngre oppsett eller ren llama.cpp-inferens. Med denne betaen sier Unsloth at de samme kjernene nå kjører over 500 modeller på AMDs Radeon-, Instinct-, Ryzen- og datasenter-GPUer, med optimaliserte ROCm-bygg for både GGUF- og Safetensors-inferens. Kompatibiliteten er særlig forbedret for datasenterkortene MI300X og MI325X.

«Vårt AMD-samarbeid, egne Triton-kjerner og matematikk-algoritmer lar deg trene og kjøre over 500 modeller på AMDs GPUer, opptil 2x raskere med 70 % mindre VRAM og uten tap av nøyaktighet» — Unsloth, utgivelsesnotat v0.1.50-beta

Tilnærmingen er den samme som Unsloth tidligere brukte sammen med NVIDIA, der de dokumenterte hvordan kjerne-optimalisering kan kappe treningstid uten å røre nøyaktigheten.

«Disse optimaliseringene har ingen tap i nøyaktighet og er et tillegg oppå Unsloths allerede 2-5x raskere hastighet» — Unsloth, NVIDIA-samarbeidsbloggen

For deg som bygger lokalt betyr det at en Radeon- eller Ryzen-maskin nå kan kjøre fine-tuning-løkker som før krevde et NVIDIA-kort. Betaen legger også til triks for å presse større modeller inn på begrenset maskinvare: MoE-ekspertlag kan flyttes til systemminnet, og modeller kan splittes over flere GPUer eller kjøres med Tensor Parallelism. Et nytt opt-in MCP-endepunkt lar KI-klienter inspisere modeller, starte og stoppe trening, laste checkpoints og eksportere GGUF-filer.

Merk at ytelsestallene er Unsloths egne og ennå ikke uavhengig verifisert, og at dette er en betaversjon: ROCm-oppsett er historisk mer skjørt enn CUDA, så forvent noe rusk på mindre vanlige kort.

Hva bør du gjøre?

  1. Installer eller oppdater via installasjonsskriptet fra unsloth.ai. Linux, WSL og macOS bruker curl-skriptet, Windows bruker PowerShell-varianten, og betaen krever pakken unsloth>=2026.7.3.
  2. Sjekk hvilket kort du har, for MI300X og MI325X har best ROCm-støtte, mens Radeon og Ryzen fungerer for lokal fine-tuning på mindre modeller.
  3. Har du en stor modell, kan du flytte MoE-ekspertlag til systemminnet eller dele modellen over flere GPUer med Tensor Parallelism før du gir opp på VRAM.
  4. Vil du styre trening eksternt, slår du på MCP-endepunktet med UNSLOTH_STUDIO_ENABLE_MCP=1 og setter en bearer-token.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter