Qwen-Drive 1.0 begrunner bremsingen, men begrunnelsen matcher ikke alltid manøveren
Samler romforståelse, trafikkspørsmål og ruteplanlegging i én 4B-modell som halverer utforkjøringer i simulator.
Alibabas forskningsavdeling har sluppet Qwen-Drive 1.0, en modell som håndterer tre oppgaver i ett: romlig oppfatning av omgivelsene, spørsmål om trafikksituasjoner og ruteplanlegging, skriver The Decoder. Modellen bygger på Qwen3.5-4B og slippes fritt til forskningsmiljøet på Hugging Face, ModelScope og GitHub.
To komponenter er lagt til grunnmodellen. Den første lager et fugleperspektiv-kart av omgivelsene ved å plassere objekter i 3D, avgjøre hvilke områder som er opptatt og trekke opp veibanen. Den andre, kalt Planning Expert, bruker modellens interne tilstand til å planlegge bilens neste bevegelser.
Det mest lærerike funnet er negativt. Da forskerne trente bare den påbygde planleggingsmodulen og lot vision-språkmodellen være urørt, holdt den romlige treffsikkerheten seg lav. Først da de også trente selve vision-språkmodellen på romlige oppgaver, tok ytelsen seg opp. En modell som beskriver bilder i detalj forstår altså ikke tredimensjonalt rom automatisk. Det må bygges inn med hensikt.
I simulatoren, der feil hoper seg opp over tid, falt andelen tilfeller der bilen kjørte av veien fra 24 til 12 prosent etter at modellen ble etterlært med forsterkningslæring. Bilen kjørte samtidig mer forsiktig og tilbakela kortere distanse. Modellen skårer også klart over den urørte Qwen3.5-4B på spørsmål om trafikkscener, med størst utslag når den må forklare årsak og virkning.
Svakheten er den som ga saken navnet sitt. Forklaringene peker ikke alltid på den faktiske årsaken: et rødt lys langt fremme og et barn som går ut i veien krever helt ulik reaksjonstid, og modellen kan blande dem sammen. Den planlagte manøveren stemmer heller ikke alltid med resonnementet modellen ga på forhånd. Flere av resultatene hviler på testoppsett forfatterne selv har laget eller bygget om, så enkelttall sier lite om ekte kjøring.
Å koble en språkmodell til en kjørefunksjon åpner også en ny angrepsflate. Forskere ved UC Santa Cruz plasserte et merket skilt i kameraets synsfelt og fikk kjøresystemet DriveLM til å svinge mot fotgjengere det hadde registrert korrekt.
Hva bør du gjøre?
- Hent vektene fra Hugging Face hvis du vil måle romforståelse selv. Modellen er på 4B og er den samme størrelsen du allerede kjører lokalt til andre oppgaver.
- Ta med hovedfunnet til dine egne agenter. En modell som begrunner valget sitt i tekst, kan gi deg en begrunnelse som ikke beskriver det den faktisk gjorde. Logg handlingen, ikke bare resonnementet.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.