LightOnOCR-3 gir tekst, layoutbokser og diagramdata fra én OCR-modell ned til 0,8 milliarder parametere
lørdag 10. oktober · KI-generert · Kilde: Hugging Face Blog
Test LightOnOCR-3-0.8B hvis du bygger RAG over PDF-er, for den minste modellen gir tekst, merkede bounding boxes og diagramdata i ett kall og skårer bare 0,8 poeng under 4B-varianten på olmOCR-Bench.
85,5 poeng på olmOCR-Bench for en modell på 0,8 milliarder parametere. LightOn publiserte LightOnOCR-3 på Hugging Face 9. oktober i tre størrelser, 0,8B, 1B og 4B, alle under Apache 2.0 for både forskning og kommersiell bruk. 4B-modellen når 86,3, 1,3 poeng bak Infinity Parser Pro på 35,1 milliarder parametere. 0,8B og 4B bygger på Qwen3.5-arkitekturen, mens 1B beholder arkitekturen fra LightOnOCR-2.
Det nye er grounding-modus. Sender du grounding som eneste prompt, kommer hver blokk tilbake med etikett og koordinater normalisert til 0–1000, bilder får en kort beskrivelse, og diagrammer blir HTML-tabeller med datapunktene. Tom prompt gir ren transkripsjon som før. Ifølge modellkortet koster grounding omtrent 25 prosent flere output-tokens, 1433 mot 1158 per side for 4B-modellen.
Farten er målt på én H100 med vLLM 0.30.0. Rendres sidene med 1540 piksler på langsiden, serverer 0,8B-modellen 4,78 sider i sekundet og 4B-modellen 3,36. Mot Chandra-OCR-2, som også bygger på Qwen3.5-4B, er LightOnOCR-3-4B 19 prosent raskere på en enkeltside, blant annet fordi formatet gir 14 prosent færre tokens per side.
Benchmark-tallene har et forbehold LightOn selv er åpen om. Alle tre testene bruker redigeringsavstand, der samme fotnote skrevet i HTML, LaTeX eller ren tekst gir ulik skår.
«Vi valgte bevisst å ikke skreddersy treningsdataene eller det native output-formatet til konvensjonene referanse-benchmarkene våre foretrekker.» — LightOn
I stedet kjører LightOn normaliseringsfunksjoner på output før scoring, og de ligger i det tilhørende repoet sammen med skriptene for å reprodusere tallene.
Hva bør du gjøre?
- Start med
vllm serve lightonai/LightOnOCR-3-0.8Bog bruk enten tom prompt ellergrounding. Andre instruksjoner er utenfor det modellen er trent på. - Render PDF-sidene med 1540 piksler på langsiden hvis gjennomstrømning teller mer enn de siste poengene. Toppskåren krever 400 DPI og et tak på 5 megapiksler, som gir rundt 4800 bildetokens per side.
- Bruk blokketikettene og boksene til chunking i RAG-pipelinen i stedet for å kjøre en egen layoutmodell ved siden av OCR-en.