Hopp til hovedinnhold
Tilbake

Ollama 0.34.1 gjør MLX-import stabil og sender GGUF-konvertering over til llama.cpp

KI Takeaway KI-generert · kan inneholde feil

Sjekk importskriptene dine før du oppgraderer til Ollama 0.34.1, fordi GGUF-modeller fra safetensors nå må konverteres og kvantiseres med llama.cpp.

Fra 3,1 sekunder til 294 millisekunder: så mye raskere svarer /api/tags fra kald start på store modellbiblioteker i Ollama 0.34.1, ifølge utgivelsesnotatene på GitHub. Endepunktet rapporterer nå også modellenes egenskaper konsekvent, så verktøy som lister installerte modeller ofte får både raskere og mer forutsigbare svar.

Den viktigste endringen for deg som lager egne modeller er at ollama create med MLX-safetensors ikke lenger er eksperimentelt. Samtidig må GGUF-modeller nå lages med llama.cpp sine verktøy for konvertering og kvantisering. En arbeidsflyt som har latt Ollama gjøre safetensors om til GGUF, må altså få et eget llama.cpp-steg.

Utgivelsen forbedrer også minnehåndteringen for MLX på Apple Silicon. Deteksjonen av tokens som gjentar seg ukontrollert, krever nå 100 gjentatte tokens før den slår inn, for å gi færre falske positiver, for eksempel ved OCR. Parameteren typical_p er utfaset: den kan ikke lenger settes når du lager nye modeller, men eksisterende GGUF-modeller beholder støtten.

Hva bør du gjøre?

  1. Legg inn llama.cpp sine konverterings- og kvantiseringsverktøy i pipelinen hvis du bygger GGUF-modeller fra safetensors.
  2. Fjern typical_p fra Modelfile-er og skript du bruker til å lage nye modeller.
  3. Prøv MLX-importen med ollama create på en Mac med Apple Silicon, nå som den ikke lenger er merket eksperimentell.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter