LAION slipper 10 millioner timer åpen video for multimodal trening
Slipper LAION-BVD, et åpent videodatasett på 10 millioner timer, til forskningsbruk.
De største videodatasettene for multimodal trening ligger hos et lite antall proprietære selskaper. LAION-BVD går motsatt vei: hele korpuset er lagt åpent ut for forskning, og forskergruppen bak begrunner det nettopp med at konsentrasjonen begrenser uavhengig forskning og reproduserbarhet. Artikkelen ble lagt ut på arXiv 25. august, med Andreas Hochlehnert som førsteforfatter og navn som Jenia Jitsev og Christoph Schuhmann blant medforfatterne.
Byggemetoden starter i Common Crawl. Derfra hentet gruppen 1,3 milliarder plattformspesifikke video-URLer, lastet ned 80 millioner videoer, og delte dem opp med innholdsbevisst scenedeteksjon. Videoklippene og lydsporene fikk deretter syntetisk genererte tekstbeskrivelser. Gruppen trakk også ut enkeltbilder ved scenebytter, og fant at bildene har en visuell fordeling som skiller seg fra vanlige web-bildekorpus.
Målingene gruppen oppgir er moderate, ikke oppsiktsvekkende. ViCLIP-modeller trent på LAION-BVD matcher eller slår modeller trent på InternVid med opptil 2,1 prosentpoeng på standard video-tekst-tester, og forspranget holder seg når treningen skaleres fra 10 til 50 millioner klipp. CLAP-modeller trent på lyden fra videoene er konkurransedyktige mot andre store, ukuraterte lyddatasett.
Den harde begrensningen står i lisensvilkårene: LAION-BVD er utgitt utelukkende til forskningsformål, ikke til kommersiell bruk. Gruppen ber brukerne respektere opphavsretten til innholdsskaperne, og advarer om at datasettet, som andre store web-korpus, kan inneholde skjevheter og ujevn dekning på tvers av språk og regioner.
For deg som bygger, betyr det at datasettet er en referanse og et forskningsgrunnlag, ikke et treningsgrunnlag for noe du skal selge.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.