Hopp til hovedinnhold
Tilbake
Verktøy 2 min · Kilde: The Decoder

FineBooks testet 14 OCR-modeller på gamle bøker, og de minste vant

KI Takeaway KI-generert · kan inneholde feil

Viser FineBooks at åpne OCR-modeller på 1 til 3 milliarder parametere nå leser gamle boksider godt nok til å trene språkmodeller på.

Bibliotekene digitaliserte samlingene sine for lenge siden, med tekstgjenkjenning som var det den var. Feilene fra den gang ligger fortsatt i treningsdataene til åpne språkmodeller, og de koster: Talkie-prosjektet målte at en modell trent på OCR-tekst lærte med bare 30 prosent av effektiviteten til en modell trent på menneskelige transkripsjoner av de samme bøkene.

FineBooks, et samarbeid mellom Hugging Face og EleutherAI, testet om dagens åpne modeller kan rydde opp. Teamet kjørte 14 modeller med åpne vekter på 2 165 sider fra historiske bøker og publiserte resultatene som en offentlig ledertavle, skriver The Decoder. Fasiten kommer fra IMPACT og BHL-Europe, som i 2011 og 2012 lot eksperter transkribere seks bind på engelsk, fransk, tysk og latin med en feilrate rundt ett tegn per 2 000.

Størrelse hjelper ikke. Den ledende modellen, dots.mocr, bruker 3 milliarder parametere, mens Qwen3.5-9B havner lenger ned til tross for nesten tre ganger så mange. Alle 14 modellene kjører på lokal maskinvare uten API-nøkkel.

Nøkkeltall
97,6 %
dots.mocr (3B) til 1,94 dollar per tusen sider
96,9 %
OvisOCR2 (0,9B) til 0,46 dollar per tusen sider
96,1 %
PaddleOCR-VL-1.6 (1B) til 0,34 dollar per tusen sider
94,9 %
Qwen3.5-9B (9,7B) til 0,89 dollar per tusen sider

Kvaliteten er god nok til trening, ikke til forskning. Modellene moderniserer stille: lang s og ligaturer byttes ut med moderne tegn, noe teamet mener målrettet fine-tuning kan rette opp. Bibliotekene har et annet problem, siden systemene deres bygger på ALTO XML med koordinater per ord, mens de nye modellene leverer markdown eller ren tekst uten posisjoner. Testen dekker dessuten bare antikva i fire språk, ikke fraktur, ikke-latinske skrifter eller håndskrift, og bare enkeltspaltede sider.

Neste steg er volum. Teamet planlegger å kjøre rundt 200 000 dokumenter fra Biodiversity Heritage Library gjennom en av toppmodellene og slippe teksten som et åpent datasett. Samlingen teller over 300 000 digitaliserte dokumenter og mer enn 64 millioner sider.

Hva bør du gjøre?

  1. Start med OvisOCR2 eller PaddleOCR-VL-1.6 hvis du digitaliserer tekst selv. De koster en fjerdedel av toppmodellen og taper under to prosentpoeng nøyaktighet.
  2. Ikke stol på ledertavlen hvis kildene dine er fraktur, håndskrift eller flerspaltede sider. Evalueringen dekker ingen av delene.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter