Perplexity åpner Lily: egenbygd inferensmotor slår MLX på Mac
Åpner Perplexity kildekoden til Lily, en Metal-basert inferensmotor i Rust som dekoder rundt 1,3 ganger raskere enn MLX på Qwen3.6-35B-A3B.
Lily dekoder 194,7 tokens i sekundet ved 256 tokens kontekst. MLX 0.32.2 gjør 148,5 på samme maskin og samme modell. Forspranget holder seg påfallende jevnt gjennom hele kontekstspennet Perplexity målte: 1,29 ganger ved 2 048 tokens, 1,32 ganger ved 8 192, og fortsatt 1,24 ganger helt oppe ved 131 072 tokens, der Lily gjør 92,7 mot MLX sine 75,0.
Prefill er en annen historie. Der vinner Lily de korte kontekstene med 1,13 ganger ved 256 tokens, men taper fra rundt 32 768 og oppover. Ved 65 536 tokens ligger Lily på 0,90 av MLX, og ved 131 072 tokens på 0,80. Hvis arbeidsmengden din er å dytte inn en stor kodebase og få et kort svar, er ikke Lily raskere. Hvis den er lange, agentiske sesjoner der modellen genererer mye, er den det.
Perplexity er selv tydelig på hva målingen ikke er. Begge motorene kjører batchstørrelse 1, grådig argmax, identiske syntetiske prompt-tokens og en fersk prosess per måling, med 64 målte dekodesteg. Men arbeidet inne i et token er ikke likt: mlx-lm regner ut og returnerer en full logprob-vektor over hele vokabularet, som testoppsettet kaster, mens Lilys minimale API bare gjør grådig tokenvalg. Påstanden er derfor gjennomstrømning for produksjonsmotoren, ikke at Lily kjører samme graf mer effektivt.
Rapporten oppgir også at hvert publiserte par av motor og kontekst reproduserte sitt eget 64-token-avtrykk eksakt, og at det største avviket mellom målerunder var 0,995 prosent. Det er uvanlig ryddig for en leverandørpublisert benchmark.
Kravene er strenge. README-en i samme mappe oppgir Apple GPU-familie 10 eller nyere, altså M5 og oppover, macOS 26 eller nyere, og Rust 1.92. Lily validerer arkitekturen og kvantiseringsoppsettet ved lasting og godtar bare Qwen3.6-35B-A3B konvertert til MLX affin 4-bit med gruppestørrelse 64. Tette Qwen-sjekkpunkter, GGUF, AWQ, GPTQ, int8 og fp8 blir avvist. Serveren snakker en bevisst smal del av OpenAIs chat completions-API: ingen sampling-parametre, ingen strømming, ingen verktøykall.
Lily ligger i pplx-garden-repoet under Apache 2.0, sammen med Perplexitys øvrige inferensarbeid.
Hva bør du gjøre?
- Sjekk maskinen din først. Har du en Mac med M4 eller eldre, eller macOS 25, kompilerer ikke Lily. MLX er fortsatt riktig valg der.
- Last ned nøyaktig den revisjonen av mlx-community/Qwen3.6-35B-A3B-4bit som repoet pinner, ellers avviser Lily sjekkpunktet ved oppstart.
- Mål på din egen prompt før du bytter. Forholdet mellom dekode- og prefill-tid i din arbeidsmengde avgjør om 1,3 ganger på dekoding faktisk gir deg noe.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.