Hopp til hovedinnhold

Onsdag 7. oktober

 Tilbake Forskning 2 min 16.34

Ant Group åpen-kildekoder LingBot-Vision: 1B-parameters synsmodell for romlig persepsjon

onsdag 8. juli · KI-generert · Kilde: MarkTechPost

Innholdet er KI-generert og kan inneholde feil. Sjekk originalkilden.

Robbyant har åpen-kildekodet LingBot-Vision, en synsmodell på 1 milliard parametere som matcher eller slår modeller opptil sju ganger større på tette romlige oppgaver.

1,1 milliard parametere. Det er størrelsen på flaggskipet ViT-g/16 i LingBot-Vision, familien av Vision Transformers som Robbyant, robotikk-selskapet i Ant Group, nå har sluppet under Apache-2.0 på Hugging Face, ifølge MarkTechPost. Vektene kommer i fire størrelser, fra ViT-giant ned til ViT-small, med teknisk rapport og inferens-kode.

De fleste synsmodeller trenes for semantisk invarians. De lærer hva som er i et bilde og kaster den finmaskede romlige strukturen, altså objektgrenser, konturer og dybdesprang, som roboter er avhengige av. LingBot-Vision snur prioriteringen og behandler grenser som et eget treningssignal. Resultatet er en 1B-modell som matcher eller slår modeller opptil sju ganger større, inkludert 7B-modellen DINOv3.

Modellen er trent med et nytt mål kalt masked boundary modeling på rundt 161 millioner bilder, valgt fra en pool på 2 milliarder, uten menneskelige etiketter og uten en forhåndstrent modell å starte fra. Korpuset er en størrelsesorden mindre enn DINOv3s, og modellen bruker under en tredjedel av treningsprøvene.

Hva bør du gjøre?

  1. Bygger du syn for robotikk eller romlige oppgaver: hent vektene på Hugging Face og test de mindre studentene som frosne readouts før du strekker deg etter en 7B-modell.
  2. Trenger du mindre budsjett: flaggskipet er destillert til ViT-L på 300M, ViT-B på 86M og ViT-S, som leder tett prediksjon i hver sin størrelsesklasse.

Pulsen · norske KI-nyheter for deg som bygger. Sakene er KI-generert fra originalkilden, som alltid lenkes.