LLaDA-Image: 6B-modell som lager og redigerer bilder i fire steg
Slipper LLaDA-Image i to varianter der den destillerte Turbo-modellen gjør på fire sampling-steg det basismodellen bruker femti på.
Femti steg mot fire. Det er hele forskjellen mellom basisvarianten av LLaDA-Image og Turbo-versjonen som inclusionAI publiserte 4. september sammen med inferenskoden, og under panseret er begge den samme 6B-parametermodellen. Turbo er destillert med en metode de kaller Twin-DMD.
Det som skiller modellfamilien fra det meste av det som ligger åpent ute, er at generering og redigering deler samme sjekkpunkt. Du trenger ingen egen redigeringsbackbone: den samme modellen tar en tekstprompt, en referansebildebasert redigeringsinstruksjon eller VQ-betinget generering, og både backbone og DiT er diffusjonsmodeller trent i ett felles rammeverk. Tekstgjengivelse er støttet på både engelsk og kinesisk, noe som er sjeldnere enn det burde være i åpne bildemodeller.
På Qwen-Image-Bench oppgir inclusionAI totalscorer på 53,53 på engelsk og 53,38 på kinesisk, og kaller det state of the art. Det er selvrapporterte tall fra modellkortet, ikke uavhengig verifisert, så behandle dem som utgangspunkt for din egen testing heller enn som en fasit.
En viktig presisering hvis du planlegger å bygge videre: treningskoden er ikke ute. Modellkortet lister den under «coming soon», mens det som faktisk er publisert er vekter og Diffusers-basert inferenskode, i BF16 og FP8 for begge variantene. Rapporten beskriver oppskriften, blant annet at den visuelle forforståelsen bygges gjennom rein bildepretrening før språksupervisjon kobles på, men du kan ikke kjøre den ennå.
Hva bør du gjøre?
- Begynn med Turbo-sjekkpunktet og fire steg med guidance_scale på 1.0. Basismodellen på femti steg er dyr å teste med, og du finner ut om kvaliteten holder for ditt bruk uansett.
- Velg FP8-varianten hvis VRAM er flaskehalsen. Begge modellene finnes i både BF16 og FP8 på Hugging Face og ModelScope.
- Sjekk oppløsningskravene før du automatiserer noe: tekst- og VQ-generering krever høyde og bredde delelig på 16, mens bilderedigering krever 32.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.