Hopp til hovedinnhold
Tilbake
Verktøy 2 min · Kilde: Hugging Face - Blog

Papers with Code indekserer 110 000 artikler på 256 dimensjoner

KI Takeaway KI-generert · kan inneholde feil

Start med nøkkelordsøk og legg til vektorsøk først når det faktisk løfter treffene, er rådet fra teamet bak søkemotoren på Papers with Code.

«Hybridsøk er ikke alltid det beste alternativet», skriver Niels Rogge i Hugging Faces gjennomgang av søket på Papers with Code, publisert 21. august. Tjenesten holder embeddinger for over 110 000 artikler fra arXiv og Daily Papers, og arkitekturen er delt i to: tung batch-jobbing utenfor forespørselsløypa, og bare selve spørring-embeddingen på den.

Den delingen er hele poenget. Hugging Face Jobs kjører korpuset gjennom en L4-GPU med 24 GB VRAM, og i piloten på 5000 artikler kodet jobben rundt 75 artikler i sekundet på 1024 dimensjoner. Resultatet legges i en Storage Bucket som uforanderlige kjøringer med manifest og SHA-256-sjekksummer, og importøren validerer skjema, dimensjoner og innholdshasher før vektorene får røre søkeindeksen. Bare spørringen embeddes live, gjennom et autentisert Inference Endpoint med Qwen3-Embedding-0.6B pinnet til en eksakt revisjon.

Endepunktet skalerer til null når det er stille, så kaldstart er normaltilstand og ikke unntak. Klienten har derfor ett sekunds timeout i produksjon, en circuit breaker etter gjentatte feil, og validering av dimensjon og norm på svaret. Svikter noe av dette, hopper systemet rett til PostgreSQLs fulltekstsøk i stedet for å la brukeren vente på en ustabil avhengighet.

Vektorstørrelsen er det andre valget som betaler seg. 256 dimensjoner ga 0,9955 Recall@20 mot eksakt søk i piloten, med 1,31 ms i median og 2,21 ms i p95 på HNSW-oppslaget, og tabell og indeks brukte rundt 27 prosent av lagringen til 1024-dimensjonsvarianten. De to grenene slås sammen med vektet reciprocal rank fusion og k lik 60.

Hva bør du gjøre?

  1. Behandle embedding-formatet som et versjonert API. Modellrevisjon, dimensjon, normalisering og innholdshash lagres sammen med vektoren, slik at en endret abstract ikke blir liggende bak en gammel vektor.
  2. Bygg fallback til fulltekstsøk før du setter et skalerbart endepunkt på forespørselsløypa.
  3. Test 256 dimensjoner mot 1024 på ditt eget korpus før du betaler for lagringen. Qwen3-modellene støtter Matryoshka-kutt fra samme kjøring, så sammenligningen koster ingen ekstra inferens.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter