Linkups SPARSEUP søker under ett millisekund og scorer 56,4 på BEIR-13
Vurder Linkups åpne SPARSEUP hvis søket i RAG-oppsettet ditt trenger en invertert indeks og presis ordmatching, men vit at en tett modell på samme data fortsatt er litt bedre.
56,4 nDCG@10 i snitt på BEIR-13 er tallet Linkup Research lanserer SPARSEUP med, en lært sparse embedding-modell på 149M parametere under Apache 2.0. Ifølge modellkortet på Hugging Face er den den sterkeste offentlige vokabularbaserte sparse-modellen under 150M parametere som Linkup kjenner til, foran splade-v3 (51,7) og OpenSearchs doc-v3-gte (54,6). Modellen ble lagt ut 16. september.
I stedet for én tett vektor gir SPARSEUP vekter over rundt 34 000 vokabulardimensjoner, så resultatet passer i en vanlig invertert indeks og kan leses av mennesker. Den bygger på LightOns LateOn-unsupervised (ModernBERT) med MLM-hodet fra ModernBERT podet på. Tre grep holder vektorene sparsomme: logit_shift på 15, maks 12 vokabulardimensjoner per token før pooling, og sammenslåing av store og små bokstaver som krymper vokabularet fra 50 000 til rundt 34 000.
«SPARSEUP fyller den manglende plassen: en lært sparse embedding-modell, slik at de tre arkitekturene kan sammenlignes med ryggrad og data holdt fast» — Linkup Research, modellkortet
Den kontrollerte sammenligningen er ærlig: med samme ryggrad og treningsdata ligger SPARSEUP bak både DenseOn (57,9) og LateOn (58,9). SPARSEUP er dessuten målt med den approksimative søkemotoren Seismic, mens de to andre er målt med eksakt søk. Til gjengjeld gir Seismic under ett millisekund per spørring på MS MARCO, enkelttrådet.
Hva bør du gjøre?
- Last modellen med SparseEncoder i sentence-transformers og trust_remote_code=True, og bruk encode_to_dict til å se hvilke termer som faktisk fyrer for dine egne spørringer.
- Test den på norske dokumenter før du bytter, siden modellkortet oppgir engelsk som eneste språk.
- Kjør den som sparse-leddet i et hybridsøk ved siden av en tett modell, der den gir raskest gevinst på sjeldne ord og egennavn.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.