Hopp til hovedinnhold
Tilbake

NeoMME søker i PDF-sider med 260M parametre og 6 kB per side

KI Takeaway KI-generert · kan inneholde feil

Krymper NeoMME-Retriever indeksen for visuelt dokumentsøk fra rundt 1,5 MB til 6 kB per side, 255 ganger mindre, med over 95 prosent av opprinnelig nDCG@10 i behold.

255 ganger mindre indeks er tallet som avgjør om sideoppslag med sen interaksjon er praktisk mulig hos deg. H Company oppnår det på NeoMME-Retriever med hierarkisk token-pooling og asymmetrisk kvantisering, og oppgir at over 95 prosent av utgangsverdien på nDCG@10 overlever kompresjonen.

NeoMME er en familie flerspråklige, multimodale enkodere på 260M og 800M parametre. I motsetning til de fleste nyere dokumentsøkere er den ikke bygget av et forhåndstrent synstårn pluss en kausal språkmodell: én toveis Transformer behandler både tekst-tokens og rå bildeflater på 32 ganger 32 piksler, og hele modellen er trent fra bunnen med et maskert diskret diffusjonsmål. Konteksten er 16 384 tokens, nok til to bilder i 4K.

Nøkkeltall
0,523
nDCG@10 på ViDoRe v3 for NeoMME-Retriever-260M
0,556
Samme mål for 800M-varianten
0,524
ColQwen2.5 med 3,75 milliarder parametre

260M-modellen er altså 0,002 nDCG@10 unna ColQwen2.5, med omtrent 14 ganger færre parametre. Den koder rundt 51 sider i sekundet på en NVIDIA L40S ved 2048 ganger 2048 piksler inn, cirka det dobbelte av ColModernVBERT. Én foroverpassering returnerer både en tett vektor og embeddinger for sen interaksjon, så du kan hente grovt med en ANN-indeks og omrangere presist uten å kjøre modellen to ganger.

Sidene behandles som bilder, ikke tekst, så du hopper over OCR og beholder layout, tabeller, figurer og skriftstørrelser som søkbart signal. Alle sjekkpunkter er sluppet under Apache 2.0 og ligger i Hugging Face Transformers.

Hva bør du gjøre?

  1. Test 260M-varianten først hvis du indekserer PDF-er. Den ligger på Pareto-fronten for treffkvalitet mot modellstørrelse, og passer på maskinvare 800M-modellen ikke gjør.
  2. Slå på token-pooling og kvantisering fra start. 6 kB per side mot 1,5 MB avgjør om du kan holde hele korpuset i minnet.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter