Hopp til hovedinnhold
Tilbake
Modell 3 min · Kilde: Tech Times

VideoChat3 slår GPT-5 på tidsforankring i video med 4B parametere

KI Takeaway KI-generert · kan inneholde feil

Slår GPT-5 og Gemini 2.5 Flash på tidsforankring i video med bare 4 milliarder parametere, og slipper vekter, treningskode og treningsdata under Apache 2.0.

En modell på 4 milliarder parametere skal i utgangspunktet ikke slå GPT-5 på noe som helst. På tidsforankring i video gjør VideoChat3 det likevel, ifølge forskergruppen bak modellen. Bak den står 27 forskere fra Nanjing University, Shanghai AI Laboratory, Nanyang Technological University og Peking University, og modellen ligger nå ute som MCG-NJU/VideoChat3-4B på Hugging Face under Apache 2.0-lisens.

Tidsforankring er oppgaven med å peke ut nøyaktig hvilket segment av en video som svarer på et spørsmål. Den er vanskeligere enn vanlig videoforståelse, fordi modellen må holde styr på rekkefølge og varighet, ikke bare hva som er i bildet. På Charades-STA oppgir forfatterne 56,1 mIoU for VideoChat3-4B mot 40,5 for GPT-5, og på QVHighlights 67,0 mot 52,1. Tallene er hentet fra gruppens egen artikkel og er ikke reprodusert av uavhengige forskere ennå.

Mekanismen bak effektiviteten er verdt å forstå. Vanlige videomodeller behandler hvert bilde som et selvstendig stillbilde og lager en full runde med visuelle tokens for hvert av dem. Siden nabobilder i en video er nesten identiske, gir det store mengder duplikate tokens som språkmodellen må jobbe seg gjennom, og kostnaden vokser kvadratisk med sekvenslengden. VideoChat3 grupperer i stedet fire bilder om gangen i en egen bildekoder som ser dem under ett, og komprimerer bort overlappet før tokenene når språkmodellen.

Nøkkeltall
56,1 mot 40,5
Charades-STA tidsforankring i mIoU, VideoChat3-4B mot GPT-5
12 544
visuelle tokens ved 256 bilder, mot 25 088 for Qwen3-VL
1,0 sekund
LLM-inferens ved 1 024 bilder, mot 11,1 sekunder for Qwen3-VL

Det mest interessante for deg som bygger er ikke benchmarken, men hva som faktisk er sluppet. Modellkortet er eksplisitt på omfanget:

«Modellen overgår tidligere åpne modeller på samme eller større parameterskala, samtidig som vekter, treningskode, treningsstrategi og treningsdata slippes for å støtte reproduserbar åpen forskning.» — VideoChat3-modellkortet på Hugging Face

Treningsdataene utgjør rundt 3 millioner instruksjonseksempler fordelt på generell, langformat og strømmende video. At datasettene følger med er sjeldnere enn at vektene gjør det, og det er forskjellen på å kunne finjustere modellen mot ditt eget domene og bare kunne kjøre den som den er.

En 4B-modell er dessuten liten nok til å kjøre på en vanlig utviklermaskin med et brukbart skjermkort. Kombinasjonen av Apache 2.0, halvparten så mange tokens som Qwen3-VL og en tiendedel av inferenstiden ved lange klipp gjør dette til et realistisk alternativ for videoindeksering du kjører selv, i stedet for å sende hver klipp til et API.

Hva bør du gjøre?

  1. Installer med pip install torch transformers accelerate qwen-vl-utils og last modellen med trust_remote_code=True. Demo-skriptet demo_vc3.py i GitHub-repoet er raskeste vei til et første kjørende eksempel.
  2. Kjør din egen måling før du stoler på tallene. Benchmarkene er selvrapporterte i en fersk artikkel, så test heller på ti klipp fra ditt eget bruksområde enn å regne mIoU-tallene som fasit.
  3. Vurder finjustering hvis videoene dine er domenespesifikke. Treningskoden og datasettene er tilgjengelige, noe som er den egentlige forskjellen fra en lukket modell bak et API.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter