Lemonade 11s personvernfilter feiler åpent mot skyen
Bytt feilpolicyen i Lemonade 11s hybridruter til match_true, ellers går personopplysninger til skyen når klassifisereren svikter.
AMD ga ut Lemonade Server 11 for et par uker siden, men først nå har XDA Developers gått gjennom ruteren i praksis, og der ligger en standardverdi som gjør det motsatte av hensikten. Ruteren kan gates på utdata fra en ONNX-klassifiserer, en semantisk likhetssjekk eller en liten LLM som dommer, med etikettfeltet forhåndsutfylt med PII og NO_PII. Tanken er tydelig nok: har prompten personopplysninger, går den til en lokal modell, ellers ut til en skyleverandør.
Problemet er hva som skjer når sjekken ikke lykkes. Feilpolicyen står som standard på match_false, altså feiler den åpent, og personopplysningene havner i skyen. XDA mener riktig standard er match_true, og at signaltypen også bør stå på LLM. Det er to standardverdier satt feil i samme funksjon.
Rutingen har en beslektet skjevhet. Standardprompten ber modellen velge den «beste» modellen, og uten kostnad i regnestykket betyr det som regel den største. I testen gikk «hva er en segfault?» til en GPT-OSS-120B, en oppgave den minste modellen i gruppa kunne løst. Én linje om å foretrekke den minste modellen som svarer godt nok, flyttet spørsmålet ned til en 3B-modell.
Ellers bekrefter gjennomgangen at maskinvaren holder. På en Ryzen AI Max+ 395 ga Qwen3-8B 37,7 tokens i sekundet på Radeon 8060S-iGPU-en mot 10,9 på Ryzen AI-NPU-en, og tiden til første token var 0,08 sekunder mot 1,50. iGPU-en er dermed 3,4 ganger raskere på generering og rundt 19 ganger raskere til første token. Seks aktive backender samtidig, inkludert gpt-oss-120b med 128K kontekst og 3D-pipelinen, la beslag på 117 av 128 GB minne uten at noe ble kastet ut.
Utgivelsesnotatet dekker fire funksjoner. XDA teller elleve kapabilitetsfamilier og ni backender i den samme binærfilen, og finner bilderedigering, oppskalering, musikk, lydeffekter og embedding med reranking som ingen har annonsert.
Hva bør du gjøre?
- Åpne hybridruteren din og sett feilpolicyen til match_true før du sender noe reelt gjennom den. Standardverdien lekker i feiltilfellet.
- Skriv om ruteprompten til å foretrekke den minste modellen som klarer oppgaven. Ellers betaler du 120B-pris for trivielle spørsmål.
- Kjør på iGPU-en, ikke NPU-en, når du vil ha fart. NPU-en gir mening som andreplass mens iGPU-en jobber med noe annet.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.