Perplexity åpner pplx-embed-v2: kontekstuelle RAG-embeddings med 8,4 milliarder parametere under MIT
Test Perplexitys nye kontekstuelle embedding-modell mot din egen RAG-indeks, men bygg ikke produksjon på en preview som kan bryte bakoverkompatibiliteten.
Perplexity har publisert pplx-embed-v2-context-9b-preview på Hugging Face under MIT-lisens. Repoet ble opprettet 25. september og modellkortet sist oppdatert 30. september. I stedet for å kode hver chunk for seg sender du hele dokumentet inn som en liste med chunker. Modellen koder dem samlet, så vektoren for hver chunk også reflekterer teksten rundt, og du får én embedding per chunk tilbake.
Det angriper en kjent svakhet i vanlig RAG: en chunk som bare sier at «den» ble lansert i fjor, mister hva «den» viser til når den kodes alene. Perplexity løste det samme i januar med pplx-embed-context-v1 i størrelsene 0,6B og 4B, bygget på Qwen3 med diffusjonsbasert videretrening og 32K kontekst. Den nye modellen har 8,4 milliarder parametere ifølge Hugging Face-metadataene, og konfigurasjonen merker arkitekturen som pplx_contextual_qwen3_5: 32 lag, der 24 bruker lineær attention og 8 full attention. Vektorene har 2048 dimensjoner, mot 2560 i 4B-utgaven av v1.
v1 ble laget uten instruksjonsprefikser, og Perplexity begrunnet valget slik:
«Vi unngår bevisst dette kravet: du kan embedde teksten du vil indeksere direkte, uten å måtte velge eller vedlikeholde et instruksjonsprefiks.» — Perplexity, modellkortet for pplx-embed-context-v1
I v2 er prefiksene faste og bygget inn, men det gir en felle. Spørringer skal kodes med encode_queries og dokumentchunker med encode. Bruker du encode på spørringer, svekkes gjenfinningen uten at du får noen feilmelding, ifølge modellkortet.
Modellen gir unormaliserte INT8-embeddings, så du sammenligner med cosinus-likhet, eller setter normalize_embeddings=True og bruker prikkprodukt. Den er trent med Matryoshka-tap på 1024 og 2048 dimensjoner. Kutter du til de første 1024 verdiene, halverer du lagringen til 1 KB per chunk, men andre kuttstørrelser er ikke trent.
Maskinvarekravet er reelt. Vektene ligger i float32 og fyller 33,6 GB fordelt på sju safetensors-filer, så et vanlig 24 GB-kort holder ikke uten videre. Du trenger transformers 5.4.0 eller nyere og trust_remote_code=True, som betyr at du kjører Perplexitys egen modellkode fra repoet.
«Dette er en preview-utgivelse, ikke en ferdig modell. Vekter, embeddings og grensesnittet kan endres i senere versjoner uten bakoverkompatibilitet» — Perplexity, modellkortet for pplx-embed-v2-context-9b-preview
Modellkortet inneholder ingen benchmark-tall, så Perplexity har ennå ikke vist hvor mye v2 slår v1 eller konkurrentene. Modellen hadde 145 nedlastinger da saken ble skrevet.
Hva bør du gjøre?
- Kjør 50 til 100 egne spørsmål med kjente svar mot indeksen og sammenlign treffraten med embedding-modellen du bruker i dag, siden det ikke finnes publiserte benchmarks.
- Les
modeling_pplx_contextual.pyi repoet før du slår påtrust_remote_code, og legg inn en test som sikrer at spørringer går gjennomencode_queries. - Lagre preview-vektorene i en egen samling, slik at du kan reindeksere rent når den endelige versjonen kommer.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.